AREX Feed Article
World Labs 吞下 SceniX,机器人零真实数据练出双臂——李飞飞的仿真赌注
7 月 21 日,李飞飞联合创办的 World Labs 宣布收购机器人仿真公司 ,官方公告简短克制。一周后,李飞飞与 SceniX 联合创始人 Yunzhu Li 一同现身 ,由合伙人 Martin Casado 主持,首次用 42 分钟拆解了这笔收购的底层逻辑。
:"ChatGPT 可以在互联网上训练,但机器人不能只靠看视频学会推箱子之后发生什么。"这个对比击中了机器人行业最核心的瓶颈:语言模型吃的是互联网上取之不尽的文本,机器人每一次试错都要消耗真实硬件的时间、金钱,甚至可能损坏设备。
「空间智能从来不只是感知和生成世界,而是与它们交互」
:"世界不只是由文字构成的,空间智能从来不只是感知和生成世界,而是与它们交互。"这条推文获得近 2000 次点赞和 216 次转发,远高于她账号的日常互动水平。
SceniX 联合创始人、哥伦比亚大学计算机系助理教授 :"我们创建 SceniX 就是为了弥合机器人学习中的 real-to-sim 鸿沟。与 Fei-Fei、Justin Johnson、Ben Mildenhall 和 World Labs 团队联手,意味着我们能更快地弥合这个差距。"
两位创始人的措辞指向同一个判断。World Labs 的 Marble 平台从文字或图片生成可探索的 3D 世界,面向人类的感知与生成。SceniX 解决的是同一个世界的另一半:这个世界在物理上有多真?机器人在这里学会的动作,拿到真实硬件上还灵不灵?
在播客中,Martin Casado 反复追问一个看似简单的问题:为什么不直接拿视频模型来训练机器人?Yunzhu Li 的回答直指 SceniX 的存在理由:机器人需要跨空间、时间、视角、物理、几何和交互的一致性,不只是看起来逼真的帧。一个视频模型跟丢了物体,就可能教会机器人完全错误的经验。
李飞飞则从另一个方向切入。"仿真和真实数据之间不存在'要么用仿真、要么不用'的二元对立,"她说。真正有效的是仿真、物理规律、学习算法和真实世界反馈共同构成的飞轮:仿真提供规模和反事实覆盖,真实数据提供校准。
从 Marble 到 SceniX:一次始于客户关系的收购
World Labs 于 2024 年 9 月走出隐身模式,定位"空间智能"——一个李飞飞刻意与文本和视频生成式 AI 区分开的方向。旗舰产品 Marble 能将文字、图片或粗略 3D 布局转化为几何一致、可探索的 3D 世界。2026 年 2 月,公司完成新一轮 ,投资方包括 Nvidia。
但 Marble 有一个内在的局限:人类觉得惊艳的生成式 3D 场景,不等于机器人能在里面学到正确策略的训练环境。好看和好用之间,隔着一整层物理一致性。
SceniX 恰好从这道缝里长出来。Yunzhu Li 的研究履历贯穿 MIT CSAIL 的 PhD、斯坦福 SVL 实验室的博士后——后者正是李飞飞领导的实验室。他的团队技术方向很窄也很深:让仿真环境在视觉、几何和动力学三个维度上同时对齐真实世界。虚拟电缆的弯曲方式、箱子被推动时的摩擦、光照变化下策略的鲁棒性,都必须与物理世界一致,而不只是看起来逼真。
两家公司的交集来得务实。李飞飞在播客中透露,World Labs 最初通过 Marble 与 SceniX 建立联系——SceniX 是 Marble 的用户。一个需要更丰富的世界生成能力来扩展仿真场景,另一个需要机器人的仿真基础设施来验证世界的物理可信度。收购发生前,两边已经看到彼此的技术是同一块拼图的两半。
零真实数据训练,双臂连续工作一小时不干预
收购后仅一周,World Labs 公布了 的早期成果。这套引擎分两步,每一步都对着一个机器人学习的老问题。
第一步:Real-to-Sim——从一次真实操作重建对齐的数字孪生。 系统从真实任务中捕获机器人、传感器、场景、物体和任务演示,重建为交互式仿真世界。关键不在于重建看起来像不像,而在于交互结果对不对称。系统针对每项任务选择不同的建模策略:刚性物体用精确几何,电缆等可变形物体需要更复杂的物理建模。验证方式是开环交互对比——在仿真和现实中执行相同的动作序列,对比每一帧的观测、物体运动和最终结果。
团队展示的案例跨越刚体、关节体和可变形物体:双臂装箱、弹性电缆插入孔洞、电源线绕冰箱布线、测试管转移。这些任务的传统仿真一直很难做好,因为涉及持续接触、形变和不可预测的摩擦。
第二步:Sim-to-Real——在仿真中训练,在现实中运行。 一旦仿真与真实世界对齐,它就成为一个可规模化的训练和评估引擎。团队在仿真中系统性地变换物体配置、机器人状态、视角、光照、物理属性和难度,让策略暴露在物理世界中很难或很危险才能遇到的条件下。
核心结果是:双臂装箱任务的策略完全在仿真中训练——零真实世界训练数据——直接迁移到 ALOHA 机器人上运行成功,且在光照扰动下依然稳定。电源线绕冰箱和电缆插拔等任务,在真实机器人上自主运行超过一小时,无需人工干预。
World Labs 强调这套系统策略无关且硬件无关。同一个重建好的数字孪生可以服务不同客户的机器人、传感器和策略栈。一个任务重建一次,就能成为可复用的基础设施。
工厂最容易,家庭最难:先把半结构化场景吃透
李飞飞在播客中为部署路线铺了一张清晰的难度光谱。在 Yunzhu Li 的框架中,工厂处于最容易的一端——环境受控、任务重复、一切都围绕机器设计。仓库、酒店、餐厅属于中间地带,运营方可以控制部分变量。家庭在最难的一端,充满各种不是围绕机器设计的变异。
当 Martin Casado 把话题引向人形机器人的时间表和能效问题时,李飞飞没有给出公共想象中的图景。她把对话拉回到"有分寸的乐观"——她认为这是当前 AI 行业最难做到的事。两年后成功意味着什么?"一批灯塔客户和经过验证的垂直用例,"她说,不是更好的模型 Demo。
Yunzhu Li 补充了一个数据点:团队在约一千人的调查中发现,大约三分之一的受访者希望机器人负责清洁。他以此论证近期的真实市场需求可能来自"无聊但可靠的重复劳动",而非酷炫的舞台演示。
在更宏观的竞技场上,2026 年已成具身智能的爆发年:在 SIGGRAPH 上扩展至边缘部署;;。每一家都在回答同一个问题:如何让 AI 从屏幕走进物理世界。
不造机器人,但要攥住整条链
World Labs 的路径和所有人都不一样。它不造机器人,不推开源模型,不喊人形通用。它买下了一家仿真公司,试图把从世界生成到机器人训练再到真实部署的整条链攥在自己手里。李飞飞对两年后的定义——论文不顶用,付费客户才算数——可能是这个赛道里最清醒的判断。
参考链接
- _