李飞飞:ChatGPT 之后,AI 从会说话走向理解世界

清理说明:本文根据公众号「晚点再听LaterCast」作者 Capihom 对 Bloomberg The Circuit 李飞飞访谈的整理编译,保留技术路线、产品边界与治理观点,移除播客导流、关注引导和相关文章推广。它不是访谈逐字稿,也不是 World Labs 的技术白皮书。

从 ImageNet 得到的基础设施经验

文章回顾李飞飞在 2006 年开始建设 ImageNet 的经历:彼时计算机视觉的注意力更多在算法,团队反向把数据集作为基础设施来建设,整理约 1400 万张图片、覆盖 2.1 万多个类别。之后公开竞赛、深度神经网络和 GPU 把大规模数据、模型和算力连接起来,形成可复制的进步路径。

这段历史在文中的含义不是“数据越大越好”,而是当一个领域缺少能让模型学习的共同基础时,先建设数据资产可能比局部算法优化更有杠杆。有关规模、时间线和历史归因来自二手整理,未在本次归档中独立核验。

语言能力不等于物理理解

大语言模型能够处理语言、代码和问答,但文本描述一个动作,并不等于能判断真实对象的速度、方向、距离、遮挡、接触和后果。文章以接球、煎蛋等日常动作说明:机器若要成为机器人或科学发现的合作者,需要表达物体、空间和物理变化,而不仅是预测下一个词。

文章没有否定语言模型,而是把空间智能放在缺失拼图的位置:语言模型处理符号,世界模型需要在一致的三维环境中维持视角连续性、预测状态变化,并为行动提供依据。

渲染、模拟与规划

文中将“空间智能”分为三个功能层:

  1. 渲染:生成供人观看的像素或视频,只需在视觉上可信。
  2. 模拟:保持几何结构和物理规律,供机器理解空间与状态变化。
  3. 规划:根据当前状态与预测后果决定下一步动作,例如抓取和放置物体。

三者不是同义词。镜头转向后场景是否仍保持一致、物体碰撞是否给出合理反馈,属于模拟问题;把状态信息变成连续动作,属于规划问题。视频看起来真实并不能单独证明机器人能够可靠行动。

Marble 的产品化边界

World Labs 的 Marble 被描述为其第一款产品:用户从图像或文本生成可探索、可编辑的三维环境,移动视角后画面仍应保持空间一致。文章认为其当前价值首先在创意生产,使影视和游戏团队更低成本地建立可进入的场景;机器人团队也可将生成环境用于训练样本扩充。

Marble 在文中仍被明确为走向完整世界模型的早期步骤,而非家庭或工厂机器人已经可靠理解现实世界的证据。World Labs 与 NVIDIA 的合作、产品能力和适用范围均按原文转述记录。

物理世界数据与早期技术路线

训练世界模型需要面对相机位姿、视角、遮挡、几何关系和物理变化等耦合因素,不能把单帧像素生成直接视为三维理解。文章称 World Labs 同时准备专门数据、模型架构和系统,并强调早期路线尚未收敛,团队判断仍然重要。

文中列举 World Labs 融资、世界模型与人形机器人赛道资金等数字,并将当前阶段类比为大语言模型快速突破前的探索期。这些财务数字、比较和阶段判断均为二手访谈整理,未独立核验。

人的主动权与治理

文章最后将技术评价拉回人:AI 是否扩大科学发现、教育、养老等领域的选择和能力,而不是只看替代率。治理上应区分可验证的当前问题,如错误信息、机器人武器化和教育中的滥用,与关于天堂或末日的科幻式推演;科学家、企业、政府和公众都应参与规则制定。

该立场不主张因风险停止技术,也不接受技术自然会带来好结果。人仍应参与目标设定、使用边界和公共治理,不能把这些决定交给少数技术或资本主体。

证据边界

标签: #主题/Physical-AI #主题/空间智能 #主题/世界模型 #主题/AI治理 #节点/ImageNet #节点/世界模拟 #节点/行动规划 #场景/公众号长文