AREX Feed Article
18561 小时合成机器人数据:人大与阿里通义团队用人类第一人称视频训练机器人,跨形态泛化全面提升
把人类第一人称操作视频变成机器人训练数据,这件事之前有人做过,但从未做到这个量级。8 月 3 日上传至 arXiv 的一篇论文中,中国人民大学 AIM3 实验室与阿里通义(Qwen)团队联合提出了 ——一条完整的 ego-to-robot 合成流水线,从约 1,940 小时第一人称人类操作视频中,产出了 18,561 小时覆盖 15 种机器人形态的合成训练数据,这是迄今最大规模的 ego-to-robot 数据集。
论文标题:Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data 论文链接: 项目页面: 开源地址:暂未开源 核心成绩:从约 1,940 小时 egocentric 视频生成 18,561 小时、15 种机器人形态的合成数据,联合预训练(合成数据与真实机器人数据 1:1 混合)在视觉外观、场景布局、形态迁移和任务语义四个泛化维度上一致超越纯机器人数据预训练的基线。
遥控操作再快,也追不上数据需求的膨胀
VLA(Vision-Language-Action)模型在机器人操控任务上持续进步,但每条路都通向同一个瓶颈:数据。Open X-Embodiment、DROID、AgibotWorld 这些大规模机器人数据集极大推动了领域发展,但遥控操作的本质决定了它昂贵、慢、受限于硬件,交互多样性始终打不开。
第一人称人类操作视频是另一个方向。人每天都在操作各种物体,互联网上随处可见的烹饪、维修、手工视频天然包含了丰富的操控先验。但人手和机械手之间的形态鸿沟太大,直接把人类视频丢给机器人策略训练,效果一直不理想。此前有工作在小规模上验证了"动作重定向 + 视觉替换"的思路可行,但能否把这条路扩展到预训练级别、能否系统性地提升 VLA 的分布外泛化能力,此前没有明确答案。
Ego2Robot 的工作就是回答这个开放问题。论文的核心假设是:尽管形态不同,第一人称操作视频中包含可迁移的交互规律,只要对齐得当,就能补充机器人数据欠缺的多样性。
三个模块,让人类视频长出机械臂
Ego2Robot 流水线分三步走:动作对齐(action alignment)、视觉对齐(visual alignment)、质量筛选(quality curation)。它支持两条输入路径——Path A 接收已有手部姿态标注的数据集,Path B 处理无标注的野生视频,先通过 WiLoR 逐帧重建手部姿态、再用 DynHaMR 做时序优化,之后两条路径汇入统一的流水线,并行生成 15 种机器人形态的训练数据。
动作对齐解决的是"手怎么变成夹爪"的问题。对于每一帧检测到的手部,流水线从 21 个手部关键点中提取出紧凑的夹爪表征:用拇指、食指和中指指尖的加权组合定义虚拟指尖,再计算工具中心点(TCP)、夹爪开合宽度和抓取姿态。之后用 Savitzky-Golay 滤波平滑位置、用高斯加权 SLERP 平滑旋转,最后根据不同数据源的动作速度做帧率降采样——ANT 和 EgoDex 降到 60%,EgoVerse 降到 45%,ViTRA 降到 25%——让合成数据的动作速度与真实机器人遥操作数据对齐。
视觉对齐回答一个更棘手的问题:机器人的底座该放在哪?人类视频里没有物理机器人底座可以参照。Ego2Robot 的做法是把这个问题建模为一个优化:在轨迹的空间极值中选取关键帧,在 MuJoCo 中做网格搜索,为每一种机器人形态找到 IK 可行率最高的底座位姿。确定底座后,用 SAM 3 分割手臂区域,ProPainter 做时序一致的视频修复抹掉人手,再在 MuJoCo 中逐帧求解 IK 并渲染机械臂,最后通过深度感知合成把渲染的机械臂放回修复后的场景中。15 种形态——从 Panda、UR5e、ARX-L5 到 Franka、xArm7、Sawyer——各自独立处理同一段视频,产生并行的训练数据流。
质量筛选分三级:L1 在流水线内部过滤 IK 失败、自碰撞和动作异常值;L2 统计层面剔除极端值和突变;L3 用 VLM(Qwen3.5)审计合成视频中机器人动作与原始操作意图的语义一致性。
流水线处理了四个 egocentric 数据源:ANT(7 小时,团队自建的抓放数据集)、EgoDex(732 小时)、ViTRA(249 小时)和 EgoVerse(954 小时),合计约 1,940 小时。经过 15 种形态的并行渲染和质量筛选,最终产出 18,561 小时合成数据——约 9.6 倍的数据放大。这些合成数据与约 6,565 小时真实机器人数据(DROID、AgibotWorld、InternData)混合,构成预训练语料。
视觉泛化提升最显著,Franka 仍然翻不了身
要搞清楚 ego-to-robot 合成数据到底帮了什么忙,需要一个能拆开看的评测框架。现有基准如 RoboTwin 2.0 把多种分布偏移搅在一起给出一个总分,看不出增益来自哪里。论文团队扩展了 RoboTwin 2.0,把扰动按四个维度独立拆开:视觉外观(背景、光照、机器人颜色)、场景布局(桌面高度、干扰物、相机偏移)、形态迁移(零样本切换到 UR5、ARX、Franka)和任务语义(未见过的物体、改写后的指令),共 12 个评测设置,外加一个相机视角更高、更接近 egocentric 视角的外部基准 EBench。
预训练使用了 Qwen3.5-4B 作为 VLA 的视觉语言骨干,搭配 Diffusion Transformer(DiT)动作头,预测 32 步的相机坐标系相对末端执行器动作块。四种预训练配置:纯机器人数据,以及 Ego2Robot 合成数据与机器人数据按 1:3、3:1、1:1 混合。所有配置使用完全相同的超参数——200K 训练步数、batch size 12×8 GPU——处理相同的约 1,920 万帧,确保对比公平。
1:1 混合配比在 7 个评测列中的 5 个上取得最优。在 RoboTwin Clean 设定上达到 68.1%(纯机器人基线 62.2%,+5.9),Randomized 设定 53.5%(基线 50.9%,+2.6)。分维度看:
- 任务语义:54.1% vs 46.2%(+7.9),其中未见物体泛化从 29.3% 升到 39.6%(+10.3),改写指令鲁棒性达到 68.5%(+5.4)。
- 视觉外观:67.3% vs 61.4%(+5.9),其中光照变化下提升 +7.6,背景 +3.7,机器人颜色 +6.4——多样性来自 egocentric 视频的自然场景变化和多形态渲染。
- 场景布局:56.9% vs 52.9%(+4.0),相机偏移鲁棒性提升 +5.9,因为 egocentric 视频天然包含了多样的头部姿态和视角。
- 形态迁移:27.2% vs 23.8%(+3.4),ARX 从 44.1% 提升到 51.2%(+7.1),UR5 在 3:1 配比下达到峰值 31.4%(+11.2)。但 Franka 在所有配比下都不到 7%——论文指出其运动学结构与训练形态差距过大。
EBench 的结果进一步验证了这个趋势。3:1 配比在 EBench 上达到 51.7%(+12.1),说明当评测视角接近 egocentric 视角时,co-training 的收益被放大。
| 预训练配置 | Clean | Rand | Visual | Scene | Embody | Task | EBench |
|---|---|---|---|---|---|---|---|
| Robot-only | 62.2 | 50.9 | 61.4 | 52.9 | 23.8 | 46.2 | 39.6 |
| Ego2R+Robot (1:3) | 61.4 | 51.0 | 61.2 | 52.5 | 21.9 | 49.5 | 47.4 |
| Ego2R+Robot (3:1) | 64.1 | 49.2 | 62.7 | 54.3 | 28.2 | 51.6 | 51.7 |
| Ego2R+Robot (1:1) | 68.1 | 53.5 | 67.3 | 56.9 | 27.2 | 54.1 | 49.8 |
流水线本身值多少?消融实验说清楚了每一环的贡献
剥离机器人数据、只用 ego 数据做预训练的消融实验揭示了流水线各环节的价值。原始 ego 视频直接 co-training 在 RoboTwin Randomized 上只能拿到 28.1%;经过流水线处理后(单形态),提升到 31.7%(+3.6);从 1 种形态扩展到 15 种,进一步提升到 33.5%;再把原始 ego 数据加回来,跳升到 37.3%——论文作者指出,原始 ego 数据在这里相当于第 16 种"形态",进一步丰富了预训练的多样性。
真机实验在 ARX ACone 平台上测试了五个长周期任务——水果入篮、积木入抽屉、叠毛巾、扫垃圾、拧螺丝——每个任务仅收集 20 个遥操作演示。比较三种配置:Robot-only(纯机器人数据预训练 + 遥操作微调)、Mix(Ego2R+Robot 1:1 预训练 + 遥操作微调)、Mix + Ego2R Play(同上预训练,但微调时混入 1:1 的流水线转换 ego-play 数据——来自场景中随手录制约 7 分钟的手部操作视频)。
Mix + Ego2R Play 在所有五个任务上表现最好,"积木入抽屉"相比 Robot-only 提升 +14,"拧螺丝"提升 +13。Mix 单独预训练已经优于 Robot-only,而 Ego2R Play 数据带来了进一步的一致性增益。
不是万能药:只有平行夹爪,渲染也有破绽
Ego2Robot 当前的局限同样值得正视。动作重定向只支持平行夹爪,手指的精细关节运动被全部丢弃,扩展到灵巧手需要全新的映射方案。视觉对齐依赖图像修复和深度感知合成,在严重遮挡或复杂光照下可能引入伪影。评测也仅限于 RoboTwin 2.0 的任务范围,更广泛的任务和形态配置下的泛化能力仍需验证。
方向本身指向一个清晰的图景:如果互联网规模的人类操作视频可以稳定地转化为机器人训练数据,具身智能的数据瓶颈就不再是"雇多少遥操作员"的问题,而是一个数据工程问题。论文团队在结论中的判断是——ego2robot 合成数据补充了机器人数据所欠缺的交互多样性,增益在视觉、形态和语义三个维度上最为突出。但需要注意的是,这仍是单篇论文在作者自行扩展的评测基准上的自报结果,尚未有独立的第三方复现。剩下的,是渲染精度、灵巧手支持和更大范围验证的工程推进。