核心内容清理版|听李飞飞讲机器人和世界模型,学到了比技术更重要的东西

清理说明:本文依据傅盛在 AASF 活动后对李飞飞访谈的二手转述整理。已移除文末“猎豹 AI 实战派”报名、扫码、名额和效率宣传,以及微信页面噪声;未把该转述当作访谈逐字稿或学术定义。

机器人的核心瓶颈是物理世界数据

大语言模型训练所需的文本,长期沉积在互联网上,输入输出边界相对清楚。机器人面对的是三维世界:移动、抓取、碰撞、摩擦、遮挡和环境变化。它必须在真实接触中收集操控数据,而这种数据尚没有可直接复用的大规模“现成数据库”。

因此,文章转述的判断是:在模型和数据之间二选一,机器人当前更稀缺的是数据,且是能说明真实世界如何运行的数据。自动驾驶虽已积累多年驾驶数据,但其运动空间和自由度仍远小于人形机器人处理拿取、倒水、开门、整理等任务的复杂度。

世界模型的三层:渲染、模拟、规划

文章用三层框架解释世界模型:

  1. 渲染:生成符合人类视觉认知的画面。视频生成模型擅长这一层,但画面真实不等于模型理解物理规律。
  2. 模拟:表示物理状态如何变化,例如液体流动、物体翻倒或碰撞后的结果。机器人可据此在行动前预测后果、行动后解释反馈。
  3. 规划:在预测结果基础上决定下一步行动,例如整理桌面时选择先拿什么、放在哪里、如何避免阻挡后续动作。

三层中,渲染回答“看起来像不像”,模拟回答“世界会怎样变化”,规划回答“接下来该做什么”。文章认为,机器人需要后两层,而非只生成逼真画面。

机器人能力来自行动与反馈闭环

机器人不是一次性从静态数据中学会任务,而要经历“行动 -> 物理反馈 -> 纠正 -> 新数据/学习”的循环。接触真实物体后,系统需要理解力、摩擦、遮挡等反馈,再修正下一步动作。世界模型的工程价值,在于支持这一闭环中的后果预测、策略选择和纠错。

不确定性与人的自主性

文章把移民、科研和创业都描述为进入未知环境后的选择问题:没有确定结果时,仍要依靠热情、韧性和判断向前推进。这里的“无畏”不是忽略风险,而是不因可能失败就放弃自己重视的选择。

对 AI 的立场也由此展开:AI 可以增强创造力和生产力,但不应替人接管目标、价值取舍与最终决定。企业采用 AI 也不存在能外包给他人的标准答案;负责人仍需理解技术、判断方向、组织团队,并承担穿越不确定性的责任。

证据边界

标签:#主题/Physical-AI #主题/具身智能 #主题/世界模型 #主题/人的自主性 #节点/物理数据 #节点/闭环学习 #场景/公众号长文