# 香港大学席宁：机器人要学物理世界，光靠数据还不够

> 原文链接：https://mp.weixin.qq.com/s/KnOZsDqmgkjeHANEf3Pbtg
> 来源：腾讯科技（公众号「值得关注的」）
> 作者：李海伦；编辑：徐青阳
> 发布时间：2026-08-23 20:38 CST
> 获取时间：2026-08-24
> 抓取方式：微信移动端页面；正文转写并保留主要问答结构。

## 导语：热潮不等于能力已收敛

2026 世界机器人大会期间，香港大学机器人与自动化教授席宁接受腾讯科技采访。文章以宇树上市后的市场波动和人形机器人热潮为背景，讨论具身智能如何“真正学会干活”。

席宁的总体判断是：机器人在运动能力和单点任务上进步很快，但复杂场景中的稳定泛化仍未解决。VLM、VLA、世界模型等路线都处在“百花齐放”阶段，尚无路线被证明已彻底解决机器人理解物理规律的问题。

## 01 热潮之后，应用仍是最终检验

对于机器人产业是否存在泡沫，席宁认为新技术在成长中出现高预期、波动和回调很自然，不宜只从投资角度作高估或低估判断。真正的检验是能否成功进入应用：可以稳定应用的系统会获得更多机会并继续发展，无法应用的系统会被淘汰。

标准也应随行业成熟度出现。早期参与者少时标准需求弱；当人形机器人参与者增多、合作与沟通增多，通信等共同标准会变得更重要。文章没有给出具体标准或时间表。

## 02 中美路径差异来自产业基础

席宁认为中美机器人在阶段性技术目标上可能接近，差异更多来自产业基础、研发历史和现有优势，因而会选择不同技术路线与先后顺序。中国供应链和应用场景可能有助于降低成本、累积数据，但机器人还具有高复杂度、动作执行和与人协作等特性，不能简单按新能源汽车的路径类比。

## 03 机器人面对的是逻辑、空间、时间与交互

语言模型主要处理词与词的逻辑关系；机器人完成动作时还必须处理空间位置、时间节奏和与环境的互动。例如抓取一个物体，需要判断物体位置、抓取速度和力度。这些多维关系不能只由文本关系直接覆盖。

因此，VLM、VLA、世界模型等架构都在尝试改善模型对空间、时间和交互的处理能力，但现阶段仍应接受真实任务检验，不能将某个模型发布等同于已理解物理世界。

## 04 数据重要，但动作数据并不像文本数据那样现成

算力、神经网络和 GPU 的发展使数据驱动方法越来越重要。大语言模型的成功受益于互联网的大规模文本、搜索与较容易的标注方式；机器人控制面对的却是动作数据。

动作不只需要逻辑顺序，还涉及空间、时间和力等互动关系。物理世界缺少可直接复用的大规模、标准化操控数据，过去用于收集、检索和标注文本的方法无法直接搬到机器人领域。数据收集仍可推进，但成本与难度是当前限制。

## 05 知识融合：数据驱动与符号 / 物理模型共同表达知识

席宁没有否定数据驱动，而是将其看作一种知识来源。机器人领域已有另一类知识：有限状态机、动力学方程、运动学方程等对物理规律的人工提炼。

两类方法都在表达知识，但获取方式不同：数据驱动通常依赖更多数据；物理规律模型可能以更少数据编码先验。值得研究的方向是将数据驱动与符号、动力学、运动学模型结合，而不是只沿着“继续寻找更多数据”这一条路径。

## 06 场景数据的价值取决于筛选与结构化

中国市场规模和应用场景可持续产生数据，这可能成为产业优势。但席宁强调，数据量大只是第一步；更关键的是筛选、整理并转化为高质量、可用的数据。文章未定义质量标准、数据规模阈值或融合架构的具体实现。

标签： #主题/Physical-AI #主题/具身智能 #主题/机器人 #主题/世界模型 #主题/知识融合 #场景/公众号长文 #节点/物理规律 #节点/动作数据 #节点/符号模型 #节点/有效数据
