香港大学席宁:机器人要学物理世界,光靠数据还不够

核心结论(一句话)

具身智能不能只沿用语言模型的“规模化数据”路径:机器人行动需要逻辑、空间、时间和物理交互的共同约束,而数据学习、有限状态机、动力学和运动学等知识应融合并在真实场景中接受检验。

分类提炼

知识节点(8 个独立概念)

数据不是唯一知识来源

语言模型受益于海量文本、搜索和相对成熟的标注机制。机器人控制不同:抓取和移动不仅要判断任务先后,还要理解对象位置、速度、力度与环境反馈。互联网并没有与这些物理后果相连的、可直接复用的大规模动作语料,因此“扩大数据规模”在机器人领域同时受到采集、标注、场景覆盖和质量控制限制。

原文提出的补充方向是复用机器人领域已有的知识表达:有限状态机、动力学、运动学等。它们与数据并非对立:前者把人类对规律的提炼编码为约束,后者从交互样本中学习难以手写的模式。真正的技术问题是如何融合,并以复杂、变化任务中的稳定表现检验融合是否有效。

从模型热度到工程判断

文章对行业热度保持克制:新技术出现资本预期、同质化和回调并不意外;最终差异由能否形成应用决定。标准通常在参与者和协作增加后才成为必要基础设施。对中国的潜在优势,原文只给出条件性判断:大市场和多场景能够持续产生数据,但数据量本身不是优势,筛选、整理和转化为高质量可用数据才是关键。

对 Seetong 的启示

  1. 对设备侧 AI 功能,录像、报警和传感器数据应保留事件、时间、空间 / 设备状态和操作后果的关联,不能只积累静态截图或文本标签。
  2. 设备流程、权限、在线状态、告警状态和播放器状态机可作为“符号模型”约束,与模型判断一起参与决策,不让模型直接猜测不可违反的业务状态。
  3. 视频理解、告警分诊或设备控制的评估应按真实环境变化、异常恢复和安全边界验证,不能以单次 demo 或离线准确率替代。
  4. 先在有限场景验证融合路径,例如告警截图 + 设备状态 + 规则引擎的分诊建议;人工确认结果回写为可审计数据,再决定是否扩大自动化。

证据边界

关联图谱

上游(基于 / 来自)

下游(应用于 / 验证于)

同级(横向 / 并列)

相关链接