香港大学席宁:机器人要学物理世界,光靠数据还不够
- 原文:https://mp.weixin.qq.com/s/KnOZsDqmgkjeHANEf3Pbtg
- 来源:腾讯科技(公众号「值得关注的」);作者:李海伦;编辑:徐青阳
- 发布时间:2026-08-23;获取时间:2026-08-24
核心结论(一句话)
具身智能不能只沿用语言模型的“规模化数据”路径:机器人行动需要逻辑、空间、时间和物理交互的共同约束,而数据学习、有限状态机、动力学和运动学等知识应融合并在真实场景中接受检验。
分类提炼
- 场景:人形机器人、具身智能、物理世界学习
- 类型:专家访谈 / 技术路线与产业成熟度判断
- 标签:#主题/Physical-AI #主题/具身智能 #主题/机器人 #主题/世界模型 #主题/知识融合
知识节点(8 个独立概念)
- 应用检验:机器人技术是否成立,应由真实任务的稳定性、效率与可部署性检验,而不是资本热度或演示效果。
- 路线收敛:VLM、VLA、世界模型等具身路线仍在竞争与验证,尚不能视为已解决物理理解。
- 多维关系:机器人行动同时受逻辑、空间、时间和互动关系约束,模型必须处理这些关系的耦合。
- 动作数据:能关联动作、环境状态和后果的交互数据,才可用于学习可靠控制策略。
- 数据缺口:物理世界不存在互联网文本式的大规模现成操控数据,获取和标注成本限制了纯数据扩张。
- 符号模型:有限状态机等任务结构能表达离散状态、转移与约束,属于可复用的机器人知识。
- 物理先验:动力学与运动学用可计算关系表达力、运动和约束,可减少系统对样本规模的单一依赖。
- 知识融合:数据驱动与结构化物理知识的结合,应以任务效果验证,而非将任一方法当作唯一答案。
数据不是唯一知识来源
语言模型受益于海量文本、搜索和相对成熟的标注机制。机器人控制不同:抓取和移动不仅要判断任务先后,还要理解对象位置、速度、力度与环境反馈。互联网并没有与这些物理后果相连的、可直接复用的大规模动作语料,因此“扩大数据规模”在机器人领域同时受到采集、标注、场景覆盖和质量控制限制。
原文提出的补充方向是复用机器人领域已有的知识表达:有限状态机、动力学、运动学等。它们与数据并非对立:前者把人类对规律的提炼编码为约束,后者从交互样本中学习难以手写的模式。真正的技术问题是如何融合,并以复杂、变化任务中的稳定表现检验融合是否有效。
从模型热度到工程判断
文章对行业热度保持克制:新技术出现资本预期、同质化和回调并不意外;最终差异由能否形成应用决定。标准通常在参与者和协作增加后才成为必要基础设施。对中国的潜在优势,原文只给出条件性判断:大市场和多场景能够持续产生数据,但数据量本身不是优势,筛选、整理和转化为高质量可用数据才是关键。
对 Seetong 的启示
- 对设备侧 AI 功能,录像、报警和传感器数据应保留事件、时间、空间 / 设备状态和操作后果的关联,不能只积累静态截图或文本标签。
- 设备流程、权限、在线状态、告警状态和播放器状态机可作为“符号模型”约束,与模型判断一起参与决策,不让模型直接猜测不可违反的业务状态。
- 视频理解、告警分诊或设备控制的评估应按真实环境变化、异常恢复和安全边界验证,不能以单次 demo 或离线准确率替代。
- 先在有限场景验证融合路径,例如告警截图 + 设备状态 + 规则引擎的分诊建议;人工确认结果回写为可审计数据,再决定是否扩大自动化。
证据边界
- 本文是腾讯科技对席宁的访谈整理,不是论文、基准报告或机器人技术路线的系统综述。
- “目前没有路线彻底解决物理规律学习”“中美路径差异”等是受访者在 2026-08 的专业判断,不应解读为行业定论。
- 文章未给出 VLM / VLA / 世界模型的可复现实验、数据规模、融合架构或性能比较;本页不据此推导具体技术选型。
- 宇树股价、资本市场与产业规模相关背景仅作为访谈语境,不作为投资或市场预测依据。
关联图谱
上游(基于 / 来自)
- [[06-ai-tech/傅盛-李飞飞-机器人世界模型与人的自主性]]:该文解释物理数据、状态预测、行动规划和反馈闭环;本文补充数据不足时的符号 / 物理知识融合。
- [[06-ai-tech/WAIC之夜-Physical-AI-下一个范式]]:该圆桌讨论仿真、视频和融合路线;本文提供动力学、运动学与有限状态机的专家视角。
下游(应用于 / 验证于)
- [[06-ai-tech/量子位-李飞飞-Huberman-AI不替代人]]:机器人和高风险应用需依据数据边界与人机协作设计,不将模型能力直接等同于责任转移。
同级(横向 / 并列)
- [[06-ai-tech/WAIC之夜-Physical-AI-下一个范式]]:前者偏产业圆桌中的技术路线竞争,本文偏物理知识与数据的互补关系。
相关链接