AREX Feed Article
李飞飞亮底牌:零真机数据训出机器人,World Labs 打通 R2S2R 闭环
五台机器人,零条真实训练数据,在物理硬件上自主运行了整整一个小时。2026 年 7 月 28 日,李飞飞创立的 在官方博客公布了 Real-to-Sim-to-Real(R2S2R)引擎的首批实测结果,首次打通了从真实世界采集数据构建仿真环境、在仿真中大规模训练策略、再部署回真实硬件的完整闭环。
这些机器人策略完全在仿真中训练。没有碰过一次物理机械臂,没有重置过一根线缆,没有从任何一次真实失败中恢复。训练完成后直接迁移到 ALOHA、YAM、RB-Y1、Flexiv、xArm 五种不同硬件平台上,执行了双机械臂装箱、柔性线缆插拔、电源线布线、试管转移和密集堆中取物五类任务。
一周前,World Labs 刚刚宣布机器人仿真公司 SceniX。一个半月前,李飞飞发表,将世界模型归纳为渲染器(Renderer)、模拟器(Simulator)和规划器(Planner)三大功能类别,并明确指出:负责还原物理规律的模拟器,是物理 AI 发展的最关键一环。
R2S2R 的首次亮相,把这篇理论文章的核心判断放进了现实。
李飞飞:我们不可能有足够的真实世界数据
在 R2S2R 结果公布次日,a16z 发布了。李飞飞直言:「你可以在仿真中推演那些尚未发生、或不可能发生的事件,并且在推演的过程中学会如何行动。这对机器人来说至关重要,因为我们不可能为它收集到足够的真实世界数据。」
她以自动驾驶为例:Waymo 官方宣称使用了数十亿小时的仿真里程。「汽车是最简单的一类机器人。仿真在机器人学习中显然扮演着巨大的角色。」
Martin Casado 在随后的中指出,训练语言模型和训练机器人是根本不同的两类问题。LLM 有互联网规模的文本数据,机器人没有。R2S2R 试图在机器人领域复制 LLM 曾经实现的那种数据杠杆:采集一次,复用无穷。
就在 World Labs 发布 R2S2R 的同一天,将于 8 月初在其 Di Space 体验店首次展出人形机器人。近 20 家主要汽车制造商已进入人形机器人赛道。产业端对仿真训练策略达到量产级可靠性的需求,正在以比学术日程更快的速度膨胀。
从三分法到收购 SceniX,两个月三次落子
World Labs 在 2026 年六七月间的三次动作构成了一条递进线索。
6 月 3 日,李飞飞以 World Labs 创始人身份发表《世界模型的功能分类法》(A Functional Taxonomy of World Models),将当时业界混乱的「世界模型」概念拆解为三种功能:渲染器输出人眼可见的像素,追求视觉逼真度;模拟器输出精确的几何、物理和动力学状态,追求结构正确性;规划器根据观测和目标决定下一步动作。三种能力共享同一套底层知识(几何、物理、动力学),而模拟器处于中枢位置:向上可投射为像素供人类消费,向下可推导动作后果供机器人使用。
7 月 21 日,World Labs 收购 SceniX。这家公司由哥伦比亚大学助理教授 Yunzhu Li 联合创立,专精于将真实机器人、环境和交互转化为仿真环境,用于策略训练和评估。李飞飞在宣布收购时写道:「空间智能从来不只是感知和生成虚拟与物理世界,更是与它们交互。」
7 月 28 日,R2S2R 结果公布。理论与收购落到了具体的机器人演示上。
先修仿真,再谈迁移
R2S2R 的核心思路与传统 sim-to-real 路线有一个根本分歧。
过去十年,机器人社区应对 sim-to-real gap 的主流方法是域随机化(domain randomization):在仿真中随机扰动光照、纹理、质量、摩擦力等参数,迫使策略学会在这些扰动中泛化,寄望真实世界条件落在随机化的范围之内。据 指出,这一方法由 Tobin(2017)和 Peng(2018)确立,至今仍是大多数机器人团队设计训练管线的默认起点。
World Labs 的论证起点不同。如果仿真本身对物理现实的建模就有问题——把可变形线缆假设为刚体,接触力计算不准确——那么再多的随机化也弥补不了上游的失败。先让仿真足够准确,迁移问题就接近自行解决了。
R2S2R 引擎分为两个方向:
Real-to-Sim(R2S):从一个真实机器人任务出发,采集机器人、传感器、环境、物体和任务演示数据,用生成式世界建模系统重建为可交互的仿真世界。重建同时瞄准视觉保真度和物理保真度,不只追求「看起来像」,还要保证物体在机器人接触时如何变形、抵抗和响应。每一项重建都通过仿真与现实中的同一段开环动作序列并排对比来验证,直接比较观察结果、物体响应和任务结果。
Sim-to-Real(S2R):在精确对齐的仿真环境中大规模训练策略,并利用仿真提供物理世界难以获取的监督信号,包括精确的物体位置、接触力、替代动作下的交互结果。由于仿真可以系统性地改变物体配置、机器人状态、视角、光照、物理属性、速度和难度,单次真实任务演示就能生成数千种训练变体。一个重建好的任务可以服务于多种策略架构和多种机器人平台。
在策略评估层面,R2S2R 的表现尤为实际。团队在 ALOHA 双机械臂平台上测试了四种策略架构(Diffusion Policy、ACT、π0 和 π0.5),每个 checkpoint 在仿真中评估 2,000 次,在真实环境中评估 100 次。结果显示了强秩序相关性:在仿真中表现更好的策略,在硬件上也更好;checkpoint 排名在两种环境中保持一致;仿真中的失败区域与真实失败区域匹配。仿真不需要精确匹配真实世界的成功率,只需要保持策略之间的相对排名。R2S2R 满足了这个更弱但实际够用的条件。
对于机器人团队而言,这意味着可以把绝大多数候选策略的筛选放在仿真中完成,只在最关键的节点上使用昂贵的物理硬件测试。
一次重建,服务无数策略和无数机器人
R2S2R 的经济逻辑被 World Labs 放在了技术博客的靠后位置,但它才是这套框架最可能改变产业计算方式的地方。
一个真实任务被重建为精确的仿真世界后,可以反复用于新的模型训练、新的硬件平台适配、新的评估运行,每次迭代的边际成本急剧下降。这镜像了当年 LLM 实现能力跃升的结构性动力:互联网规模的文本采集一次后,被平摊到了所有下游任务上。R2S2R 提出的是机器人领域的同类平摊逻辑——在一个任务的高保真 real-to-sim 重建上投资一次,然后在其中运行成千上万次训练和评估。
当前机器人开发中最昂贵的环节是物理试验、硬件重置和真实世界演示,模型架构反而不是主要开销。World Labs 将这一定位为机器人 Scaling Law 的瓶颈:体验和评估的规模化受阻,模型架构本身并不是限制因素。
在竞争格局上, 的分析指出,NVIDIA 的 Cosmos 3 世界基础模型从视频和物理模型生成合成机器人训练数据,Physical Intelligence 的 π0/π0.5 聚焦策略架构和开放世界泛化。World Labs 的区隔在于:Cosmos 从生成式视频模型产生合成数据,R2S2R 从真实物理任务重建为物理精确仿真。两者并非互斥。NVIDIA 全球机器人公告确认 World Labs 正在同时使用 Isaac Sim 验证其生成式世界模型。
需要指出的是,目前发布的 R2S2R 结果是 World Labs 内部生成的数据,尚未经过独立复现或同行评审。一小时自主运行的 benchmark 仅限于预先采集并标定过的任务环境,系统尚未展示对未经重建的新环境的自主泛化能力。World Labs 也将「世界模型性能如何随交互数据和计算规模扩展」列为下一步关键研究方向,这个问题的答案将决定其当前成本结构能否在规模化后持续。
数据,而不是算法,才是物理 AI 的真正瓶颈
李飞飞在 6 月的分类法文章结尾写道:「语言模型让机器能够谈论世界,世界模型将让机器最终能够理解、想象、推理并与世界互动。」两个月后,R2S2R 把这句话从宣言变成了可验证的数据。
从 ImageNet 到 R2S2R,李飞飞重复了同一个判断:数据,而不是算法,才是瓶颈。这一次,她把赌注押在了仿真对齐上,让仿真成为机器人数据的策展层,如同当年的标注数据集之于计算机视觉。
参考链接
- (2026-07-28)
- (2026-07-21)
- (2026-06-03)
- (2026-07-29)
- (2026-07-28)
- (2026-07-21)
- (2026-07-28)
- (2026-07-28)
- (2026-08-08)
- (2026-06-22)