AREX Feed Article
李飞飞团队用像素遮罩打通视频模型与机器人:15 小时数据实现跨本体双向推演,LPIPS 低至 0.0945
把动作翻译成视频模型自己的语言,同一套参数同时做世界模拟和动作生成。
2026 年 7 月 21 日,斯坦福大学李飞飞团队联合马里兰大学、哈佛大学研究者,在 arXiv 上发布了 (MVA)。这项工作的核心方法:把机器人动作渲染成一段像素遮罩视频,其余画面全部涂灰,让预训练视频模型补全缺失的部分。仅用约 15 小时的真实与仿真机器人数据做 LoRA 微调,基于 Wan2.2 14B 的一个 checkpoint 就能同时完成两件事——给定机器人轨迹补全场景反应(正向仿真),给定目标物体轨迹反推机器人该怎么动(逆向动作生成)。在 DROID 数据集上,MVA 的 LPIPS 跑到了 0.0945,而此前最优的 Ctrl-World 是 0.362;换成训练时从未见过的双臂机器人,MVA 依然能稳定输出,Ctrl-World 直接输出静态或损坏的视频。
论文标题:Masked Visual Actions for Unified World Modeling
论文链接:
开源地址: /
项目主页:
核心成绩:用像素遮罩作为统一的动作接口,一个模型 checkpoint 在单臂、定制夹爪、双臂三类未见设备上同时支持前向仿真与逆向动作生成,LPIPS 比此前最优方法低近 4 倍
三种旧方案各自撞墙,视频模型缺的不是脑子是翻译
视频生成模型吞下海量数据后,已经积累了对运动、接触和物体形变的丰富先验。但一到机器人操作场景,问题就出现了:关节角度、末端位移、控制向量——这些机器人世界的"母语",对视频模型来说是一门外语。你没法用摩尔斯电码跟一个美食评委聊菜谱,他懂菜,但不懂点和划。
过去几年,研究者试过三条路。第一条是文本引导,如 UniPi,用自然语言描述任务让视频模型做规划,但文字太模糊,动作精度始终受限于语言。第二条是轨迹点标注,如 CMU 和 Meta 合作的 Track2Act,在画面上标出稀疏的关键点轨迹预测操作,但几个离散的点描述不了一个连续动作。第三条最直接,如 Ctrl-World,把关节角度直接喂给模型——这办法在同款机械臂上效果不错,可一旦换机型,同样的"关节 1 转 30 度"在不同机械臂上摆出的姿势完全不同,模型立刻失效。
总结得精炼:低维控制信号与具体机械结构深度绑定,即使把骨架和末端执行器位姿可视化到图像中,仍难保留完整外形、接触关系和遮挡信息。
MVA 换了一个问法:为什么不干脆用视频模型自己的母语跟它说话?
遮住一条轨迹,让同一个模型学会双向推演
MVA 的做法可以拆成三步。
第一步,用 Meta 的 (Segment Anything Model)把视频里的机器人和操作物体从画面中抠出来,得到它们在每一帧中的像素区域(mask)。机器人和物体都在运动,这些区域随时间连续变化,天然形成了两条运动轨迹——一条记录机器人怎么移动,另一条记录物体怎么变化。没有角度,没有坐标,没有数字,只有色块在画面里怎么游走。这就是 MVA 对"动作"的全部定义。
第二步,把物体运动的轨迹遮住,只留机械臂的运动轨迹,交给视频模型问"接下来会发生什么?"模型盯着机械臂的轨迹推演:手臂这样伸过去、这样一推,被藏起来的物体接下来会往哪儿移动。反过来,把机械臂遮住,模型看到一个杯子从桌子左边滑到右边却看不到是谁推的,它必须反向推理机械臂该怎么伸、怎么动。前者是正向动力学——给定动作推演后果;后者是逆向推理——给定目标反推动作。同一个模型、同一套参数,没有任何切换开关。它做的是什么方向的任务,只取决于你遮住了哪条颜色。
技术上,这一步对应的是条件视频补全(conditional video completion)。在方法部分指出,Wan2.2 14B 编码遮罩后的视频与参考帧,通过拼接(concatenation)注入条件信号——遮罩区域与目标输出在空间上天然对齐,拼接是最直接的注入方式,不需要额外的编码器或控制网络。
第三步,没有从零训练模型。MVA 站在阿里开源的视频生成模型 Wan-Fun-Control 2.2 14B 的肩膀上,仅用 LoRA(秩 256)做轻量适配。训练数据来自 数据集(约 1000 条真实机器人演示)和 仿真环境(约 4000 条样本),总时长约 15 小时,同时纳入了成功和失败轨迹。8 张 H200 GPU 跑了约 10,000 步、4 天就完成训练。
论文还做了两套互补的遮罩构建方案:一是基于 SAM 的视频分割,直接从任意机器人视频中分割出机械臂区域,通用性强但推理时用户难以提供精确遮罩;二是基于 URDF(统一机器人描述格式)渲染,根据已知的相机标定和机器人状态,精确渲染出机械臂的像素轨迹,推理时可以直接输入任意动作的渲染结果。两套方案各有适用场景。
在数据规模上,指出:15 小时指的是机器人视频的总时长,不是训练耗时。作为对比的基础模型 Wan2.2,其预训练消耗的视频数据量远超这个数字数个量级。正是这种"借力"策略,让 MVA 可以用极少的机器人专属数据实现泛化。
LPIPS 跑进 0.0945,换机型照样能用
论文在 DROID(训练域内)和 BEHAVIOR(跨本体)两个数据集上做了定量评测,指标包括 LPIPS(越低越好)、SSIM 和 PSNR。
在 DROID 上,MVA 的 LPIPS 为 0.0945,SSIM 0.887,PSNR 23.74。作为对比,Ctrl-World 的 LPIPS 是 0.362——差了近四倍;Wan-Move(轨迹条件视频模型)是 0.534;纯图生视频的 Wan2.2 I2V 是 0.521。后两者因为根本没有收到有效的动作指令,几乎全线崩溃。论文在脚注中特别说明,Ctrl-World 此前训练时使用了全部 DROID 数据,相当于已经见过 MVA 的测试场景,而 MVA 在这些场景上仍大幅领先。
在训练时从未见过的 BEHAVIOR 双臂机器人(R1 Pro)上,MVA 的 LPIPS 为 0.123,SSIM 0.843,PSNR 22.90。而 Ctrl-World 直接输出静态或损坏的视频,LPIPS 虽然报了 0.196,但视觉上已经完全不可用。
论文还做了一组关键的消融实验:同样的 Wan2.2 基座模型,分别用 MVA 的像素遮罩、末端执行器位姿可视化和机器人骨架可视化三种条件来训练,在 DROID 训练域内三种方法表现接近;一旦换到带有定制 3D 打印夹爪的 Franka 机器人上,骨架条件会把机器人"变回"训练时见过的形态,末端位姿条件会在画面里凭空多塞一台机械臂,而 MVA 照常工作。在 BEHAVIOR 双臂机器人上,MVA 的 PSNR 达 22.90,骨架条件仅 19.58,末端位姿条件仅 19.23。
在下游任务上,论文展示了三种用法。第一,策略评估:在 RoboCasa 中,视频模型对策略成功率的预测与真实环境执行结果的相关系数达到 r=0.982。第二,基于模型的规划(Best-of-N):用 Diffusion Policy 采样 N 条候选动作,视频模型逐条模拟后果,再由 Gemini 3.1 Pro Preview 评分选出最优,六项 RoboCasa 任务的成功率提升幅度在 7 到 26 个百分点之间,且候选数量越多提升越明显。第三,逆向动作提取:在 CoffeeServeMug 任务上,给定目标物体轨迹、经逆动力学模型(IDM)转成动作后,20 次测试成功率达 90%,高于 Diffusion Policy 的 50%、ACT 的 80% 和 SmolVLA 的 85%。
逆向建模是零样本涌出的
论文里有一个出乎研究者意料的现象:MVA 在训练阶段只接收了机器人作为"主动实体"的遮罩条件——也就是说,它只见过"遮住机器人→补全场景"的训练样本。但到了推理时,如果把条件换成物体轨迹(被动实体),模型竟然能零样本补全机器人行为。
这种双向泛化不是设计出来的。论文分析认为,原因在于遮罩条件与视频模型预训练阶段学到的像素表征天然对齐——模型不需要重新学习"机器人"和"物体"的抽象类别关系,它只需要延续预训练时已经形成的"看到一部分像素→补全其余像素"的直觉。相比之下,用骨架或末端位姿作为条件的模型做不到这一点,因为稀疏信号要求模型专门学会从稀疏坐标到稠密画面的映射,这个映射高度依赖训练域内的特定机械结构。
在泛化极限测试上,论文在项目主页展示了一个极端案例:把训练时从未见过的猩猩(orangutan)视频做成遮罩条件输入模型,MVA 依然能"补全"出合理的场景互动——尽管猩猩的运动学和外观与任何训练数据中的机械臂毫无相似之处。论文主页也诚实列出了失败案例:精细接触任务中会出现虚假接触和物体瞬移,参考帧中完全不可见的区域可能产生伪影,夹爪离开后物体偶尔继续运动。
URDF 和分层架构:产业界看到的关键词
当就这篇论文采访深圳韦特嘉机器人 CTO 李琳鑫时,他的关注点几乎不在遮罩设计本身。"这篇文章的核心不在于模型训得好,而在于泛化性的增强。以前大家没有办法解决异构机械手的识别和迁移,它解决了这个问题。"
李琳鑫进一步指出了论文里一个学术界不太关注、产业界却视为要害的细节:URDF。市面上大多数端到端机器人策略(VLA)直接从图像输出关节角度或末端位移,这套输出与特定本体深度绑定——换一台运动学结构不同的机器就完全失效。而 MVA 的思路是"先理解环境,再做 IK(逆运动学)去解算各个轴",中间多了一层中转:视频模型生成的是视觉层面的"手该去哪",再由每台机器自带的 URDF 说明书通过 IK 反算出该摆什么关节角度。
"这个点上和我们正在做的思路基本一样,"李琳鑫说。他提到,今年上半年行业趋势是做分层架构,核心是把"看"(vision)和"动"(action)拆开——看的部分用互联网海量视频训练,动的部分用相对少的机器人数据加运动学计算补齐。MVA 恰好卡在这个趋势的接口上。
这篇论文的作者阵容本身也传递了信号。除了李飞飞,署名栏里还包括哈佛的 Yilun Du——雷峰网在报道中指出,他和李飞飞在具身智能领域长期代表两条不同路线:一个主张让 AI 直接在"看得懂的画面"里思考,一个主张把一切压缩成抽象符号再处理;两人上次合作还是五年前,这次同署一篇论文,从侧面反映出 MVA 可能找到了两条路线都愿意认账的方案。
论文代码已在 以 Apache 2.0 协议开源,模型权重托管在 。论文同时指出,模型在精细接触场景仍可能出现失真,且基于 URDF 渲染动作条件时需要机器人的 3D 模型和相机标定——对于没有 URDF 文件的非标设备,目前只能依赖基于 SAM 分割的遮罩方案。多候选生成的推理成本也不低,每一条轨迹都需要单独跑一次视频生成。