AREX Feed Article
清华×腾讯发布 GeniWorld:用渲染画面替代数值向量,世界模型零样本泛化随机场景,策略成功率从 40.8% 跃至 69%
通用机器人策略在固定场景中表现越来越好,但一旦换背景、换物体、换布局,成功率就断崖式下跌。扩充训练场景意味着不断搭建新的物理环境,成本极高。世界模型试图在「想象空间」里模拟交互来绕开这个瓶颈,但现有方法直接把数值动作向量喂给视频生成模型——这些低维数字没有空间对应关系,还把机器人自身运动和环境动态搅在一起,换个场景就崩。
8 月 6 日,清华大学深圳国际研究生院与腾讯 Robotics X 联合团队在 arXiv 上公开了 ,一个基于视觉动作(visual actions)的可泛化交互式世界模型。它把机器人的数值动作通过 URDF 渲染成稠密的运动画面,再将这些画面与场景视频在潜在空间中通道拼接,让预训练视频生成模型「看见」机器人要做什么。仅用固定场景的有限数据训练后,GeniWorld 在完全未见过的随机环境中仍能生成准确的交互预测,并可作为策略评估器和数据增强引擎,将下游策略在复杂条件下的平均成功率从 40.8% 拉升至 69.0%。
论文标题:GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions 论文链接: 项目主页: 开源地址:暂未开源 核心成绩:仅用固定单一场景数据训练,在高度随机化的未见场景中实现 FID 13.08、FVD 20.15;作为数据增强工具将下游策略 OOD 成功率从 40.8% 提升至 69.0%。
把动作「画」给模型看,而不是告诉它数字
现有动作条件世界模型几乎都走同一条路:把关节角度或末端位姿编成一个低维向量,通过 AdaLN 或交叉注意力注入视频生成模型。这条路有两个硬伤。
第一,数值向量缺乏空间锚定。一个关节角度序列对模型来说只是一串数字,它不知道这些数字在三维空间里意味着机械臂往哪动、碰到什么。第二,低维动作条件把机器人运动和环境动态搅在一起——模型被迫同时学习「手臂怎么动」和「物体怎么被推动」,结果就是对着训练场景过拟合,换个未见过的背景、物体或布局立刻崩溃。
GeniWorld 的设计思路很直接:既然预训练视频生成模型已经学会了强大的时空动态先验,为什么不直接把机器人运动「画」给它看?团队利用机器人的 URDF 模型和正向运动学,从目标相机视角渲染出纯净的机械臂运动画面——只有关节结构在动,不含物体和背景。这个视觉动作序列再通过因果 3D VAE 编码,与原始视频潜在表示在通道维度拼接,送入基于 Wan2.2-TI2V-5B 构建的因果 DiT 模型。
通道拼接的设计保证了视觉动作与视频潜在在空间上严格对齐——每个像素位置的动作信息和场景信息一一对应。相比 ControlNet 式的外部条件注入,通道拼接对预训练骨架的架构改动最小,最大限度地保留了原视频模型的生成先验。训练时,模型只对观测帧加噪并使用流匹配(flow matching)预测速度场,视觉动作作为干净条件信号始终不变——这让模型专注于学习「动作如何驱动场景变化」,而不是纠结于动作本身的编码。
团队还引入了因果注意力掩码,确保每帧预测只能看到历史和当前动作,不能偷看未来。训练中后期,模型被切换为自回归模式——用自己生成的预测帧替代真值作为历史上下文,以此弥合训练与推理之间的曝光偏差。
Clean-to-Random:从一张干净桌子到任意随机场景
为了衡量泛化能力,团队在 RoboTwin 2.0 基准上设计了两组对比:Clean-to-Clean(训练和测试都是干净桌面场景)和 Clean-to-Random(用干净场景训练,直接在高度随机化的场景中零样本评估)。
在域内评估中,GeniWorld 的六个指标全面领先:LPIPS 0.055、PSNR 27.57、SSIM 0.942、FID 5.59、FVD 7.59、EWMScore 61.80。与之对比,基于数值动作的 Ctrl-World 的 LPIPS 为 0.165、FID 9.62。
差距在泛化测试中拉大。在 Clean-to-Random 设置下,场景外观、物体种类、物体摆放和任务空间布局都与训练时截然不同。IRASim 的 FID 和 FVD 直接飙到 174.52 和 191.26,几乎完全失效。而 GeniWorld 保持了 FID 13.08 和 FVD 20.15——仅比域内结果略有下降,与真实观测的偏差仍然很小。
消融实验进一步说明了视觉动作设计的必要性。用相同骨架分别测试数值动作、末端位姿投影、骨架投影和 ControlNet 式条件注入,视觉动作在泛化场景下的 LPIPS(0.144)不到数值动作(0.3659)的一半,FID(13.08)也只有骨架方案(31.78)的约 40%。
定性对比更直观:Ctrl-World 在复杂纹理中出现严重视觉伪影,还会误操作与任务无关的物体;数值动作方案在未见环境中连正确的机械臂运动都生成不了;骨架方案常常产生「隔空抓取」这种物理上不可能的交互。只有 GeniWorld 的稠密视觉动作,让模型即使在全新的随机场景中也能准确还原机器人的运动轨迹和物体交互结果。
5 步采样就够,推理加速 10 倍
通常视频扩散模型需要 50 步甚至更多去噪步骤才能产出可用的画面。但 GeniWorld 的视觉动作条件为生成过程提供了极强的运动先验,团队发现将采样步数从 50 步砍到 5 步,FVD 退化仅约 2%,而数值动作方案在同样条件下 FVD 恶化约 22%。视觉动作条件让模型在仅用 1/10 采样步数时依然保持高质量输出,实现了约 10 倍推理加速。
在真实机器人平台上,团队使用 NVIDIA H20 GPU,以 5 步采样实现了约 8 Hz 的交互推理速率,操作者可以实时遥操作世界模型中的机器人,模型自回归生成对应的视觉响应,形成闭环交互回路。
训练效率同样受益:相同骨架和训练配置下,视觉动作的收敛速度明显快于所有其他动作表示方案,在训练早期就能产出高保真输出。
既是评分器,也是数据工厂
团队在真实的双臂 Xtrainer 机器人平台上验证了 GeniWorld 的下游价值。他们设计了四个操作任务——移碗、叠毛巾、放杯子、开抽屉——用 π₀ VLA 模型在收集的真实示教上微调出策略。
先看策略评估:在 GeniWorld 中跑策略 rollout,与真实世界中的成功率做相关性分析。在标准域内条件下,GeniWorld 评估结果与真实表现呈强正相关。即使加入视觉干扰物,这种相关性依然保持——而 Ctrl-World 在同样干扰下,生成的交互画面中物体已经被严重破坏。
再看数据增强:每个任务仅用 25 条真实示教训练策略,然后通过 GeniWorld 合成额外数据。团队用图像编辑模型(GPT-Image 和 Qwen-Image)修改初始场景帧——把目标物体挪到边角位置、替换为未见过的物体实例、加干扰物、变光照——再通过动作重放或遥操作在 GeniWorld 中生成新的操控轨迹。
仅添加 65 条空间随机化合成轨迹(+ Spatial-Gen),空间重排条件下的成功率从 37.5% 跃至 62.5%;仅添加 65 条多样化场景合成轨迹(+ Diverse-Gen),干扰物条件下从 38.8% 升至 63.8%。同时引入两种数据后,四个 OOD 条件下的平均成功率从 40.8% 提升至 69.0%——空间重排 70.0%、干扰物 72.5%、新物体实例 70.0%、光照变化 52.5%。
即使一个实验室只有有限的环境和示教数据,GeniWorld 也可以在不搭建任何新物理场景的前提下,合成出足够多样化的操控轨迹来提升策略的鲁棒性。