AREXOpen in interactive Feed

AREX Feed Article

李飞飞斯坦福开讲:世界模型不是视频生成,三层架构直通自动驾驶与机器人

August 10, 2026

「世界模型真正的承诺不是生成更漂亮的视频,而是构建能够理解世界、预测接下来会发生什么、并最终在物理世界中采取智能行动的 AI。」

2026 年 8 月 9 日,在斯坦福大学 AASF Pioneer Symposium 上,World Labs 联合创始人兼 CEO、斯坦福大学教授李飞飞(Fei-Fei Li)给出了她对「世界模型」最清晰的一次公开拆解。

湾区创业者社区 Bay Area Founders Club 创始人 Paul Fang 在现场听完后,称之为「我听过的最清晰的世界模型解释」。

李飞飞将世界模型拆解为三个递进的功能层:Rendering(渲染)、Simulation(模拟)、Planning(规划)。她在每个层面指出了消费者是谁、解决了什么问题、以及当前的边界在哪里。

世界模型不是生成视频

第一层是 Rendering,回答的问题是:世界长什么样?

李飞飞指出,今天大多数视频生成模型就停留在这层:它们不断产出更逼真、更精美的像素,消费者是人。但一个从空中看起来完美的航拍城市,试着开车穿过它就原形毕露:渲染层不携带三维结构的显式理解。

她在今年 6 月发表的《世界模型功能分类学》中已经写过:「渲染器输出像素,它的契约是视觉的;它产出观察者看到的东西,而不是事物本身。」在演讲中,她更进一步,直接把这个区分摆到了公众面前:不要把世界模型等同于视频生成。视频模型是渲染器的一种,但世界模型的野心远不止于此。

AASF 官方在活动回顾中引述了李飞飞的判断:「今天的 AI 会说话、会写作、会编码——但它仍然无法真正理解和作用于物理世界。」

「这个瓶子会怎么动?」

第二层是 Simulation,回答的问题是:世界实际上怎么运作?

李飞飞在现场举了一个最简单的例子:一个瓶子——推动它,它会怎么动?把水倒出来,水会怎么流?这远远超出了「看起来像」的要求。模型必须理解物理、空间关系、因果关系,以及世界如何随时间变化。

这一层有两个消费者:人和机器。建筑师、设计师、游戏开发者需要精度而非视觉可信度;强化学习智能体、机器人控制器、自动驾驶系统则把模拟器当训练场。

在 6 月的分类学文章中,李飞飞和 World Labs 团队已经论证过,三层之中模拟器是最关键的一环。它是渲染和规划之间的桥梁。文章写道:「掌握了模拟层的模型,可以把理解投射为像素供人消费,也可以投射为行动预测供具身智能体使用。只掌握渲染或只掌握规划的模型,都做不到这一点。」

文章进一步论证,模拟层之所以是枢纽,是因为它直接处理世界的结构本身:几何、物理和动力学,而不是世界的投影(像素)或抽象(语言)。如果语言是对世界的抽象,像素是对世界的投影,那么几何、物理和动力学就是世界本身。

这个判断不是纯理论的。就在演讲前两周,World Labs 于 7 月 28 日发布了一篇技术博客 ,展示了公司收购 SceniX 后开发的 R2S2R(real-to-sim-to-real)引擎。

这套引擎将真实机器人任务重建为仿真环境,在仿真中训练策略,然后直接部署到真实硬件上,零真实世界训练数据。多个任务(双机械臂装箱、电缆插拔、试管转移)在物理机器人上自主运行一小时无人工干预。

博客明确将这项工作锚定在功能分类学框架内:「我们论证了模拟器是枢纽(linchpin),因为它将世界变成智能体可以行动、学习和被评估的地方。」

机器自己消费世界模型

第三层是 Planning,回答的问题是:接下来该做什么?

这是三层中最激进的一层。AI 不只是渲染世界或模拟可能发生的事,它用自己对世界的理解来决定下一步行动。在这一层,主要的消费者变成了机器本身。

然后她直接连接了两个巨大的落地场景:自动驾驶和机器人。

这个连接在 World Labs 的技术路线中早已埋下伏笔。R2S2R 博客中提到:「今天道路上运行的最成功的 L3 或 L4 级自动驾驶汽车,正是由同时使用真实驾驶数据和仿真数据训练的模型驱动的。飞机、火箭、无人机和四足运动系统也都在仿真系统中开发和测试。」

但自动驾驶只是起点。博客继续写道:「我们相信,对于训练能够执行更广泛复杂任务、形态各异的机器人,同样的逻辑也成立。」R2S2R 引擎同时具备策略无关和具身无关的特性,同一个重建任务可以为不同机器人、不同传感器、不同策略栈的客户服务。

李飞飞在 6 月的文章中已经指出,规划层是「最引人入胜也最稚嫩」的一层。过去两年里机器人 demo 视频看起来很震撼,「但坦诚是必要的:几乎所有 demo 都局限在严格受控的实验室环境里,物体集合狭窄,任务时长短。没有一个在真实部署所要求的复杂度、多样性和持续时间上通过了验证。」

三层递进——Rendering → Simulation → Planning——共享同一底层知识。李飞飞在 6 月文章中写道:「一个真正理解杯子如何立在桌上的模型——它的几何、材质、受力响应——应该能从任意角度渲染它,模拟它被推倒时发生什么,并规划一只手去拿起它。」三层不过是同一种底层理解的三张投影。

当 AI 开始触碰物理世界

李飞飞的演讲出现在一个更大的背景之下。斯坦福 HAI 于 7 月 27 日发布了一份政策简报 ,指出世界模型对治理提出了一个语言模型从未触及的核心问题:一个学习出来的仿真环境,是否与物理现实足够接近,以至于可以用来训练、测试另一个系统,或指导真实世界的决策?

简报写道,世界模型是「双用途」技术,降低自主系统成本的同时也降低了军事门槛,使得世界模型研究的早期领导地位和治理框架成为「紧迫的国家安全优先事项」。简报特别指出,最稀缺的输入不是互联网视频,而是带有动作标注的交互数据:机器人轨迹和车队日志无法从网上抓取,存在集中控制的风险。

李飞飞在 AASF 演讲结尾留下了一句被广泛引述的话:「不要让任何技术夺走你作为人的能动性(human agency)。」AASF 官方回顾特别突出了这句话。放在世界模型的语境里,当机器开始理解物理世界、预测变化并自主行动时,谁来做决定,就不再是一个抽象问题了。

参考链接