AREX Feed Article
Simple AI 扔出 16TB 双手操作数据,纯人手采集直逼遥操作,误差不到 3 个百分点
在精密插入任务上,一个完全由人类手持设备采集数据训练出来的策略跑到了 85% 成功率。没有一帧来自真实机器人的遥操作。Simple AI 在 7 月底将这套名为 HiFi-UMI-2K 的数据集,16TB、2000 小时、六个同步相机视角、432 万条处理片段,CC BY 4.0 协议,直接用 LeRobot v3 格式分发。论文同日在 上线。
对比结果更直接:纯 HiFi-UMI 数据后训练的策略,在三套不同模型架构上与真实机器人遥操作数据训练的基线相差最多 3.1 个百分点。VLA 家族两个模型汇总后,HiFi-UMI 组 64.4%(206/320),遥操作组 64.1%(205/320),差距仅 0.3 个百分点。
LeRobot 亲自下场:16TB,即插即用
最先把这个数据集推到聚光灯下的,是 HuggingFace 旗下的机器人开源项目 。8 月 5 日,LeRobot 官方账号发推:"What do you do with 16TB of pure robotic manipulation data? You open source it on HuggingFace。"该推文两天内获得 573 个赞和 71 次转发,社区反馈集中于一点:LeRobot 格式意味着不需要几周的数据预处理,下载就能跑。
Simple AI 联合创始人兼技术负责人 Minglei Li 在 LeRobot 推文下:"Months of hardware/software co-design went in. What it bought: post-training on HiFi-UMI alone matches same-robot teleoperation — three backbones, not one lucky setup."他同时提到,4000 小时的预训练将 10 个未见任务上的动作误差砍掉了 41%,且"欢迎合作,私信开放"。
机器人领域账号 将 HiFi-UMI-2K 的核心发现概括为一句话:高质量人类数据可能让部署中必需的"真实机器人数据锚点"不再必要。
日本机器人研究者 的解释更细致:过去用 UMI 采集的大量数据只能做预训练,最后必须混入少量真机遥操作"锚点数据"做微调;而 HiFi-UMI 问的是反方向——不是减少遥操作比例,而是把 UMI 数据的保真度提到足够高,让锚点直接消失。
拥有 15 万粉丝的技术博主 用一句话总结了冲击力:"you can collect robot training data without robots now."
遥操作的「锚点」——一道被默认的付费墙
机器人学习领域有一条默认公式:手持 gripper 采集的数据 → 预训练用;真实机器人遥操作数据 → 后训练(部署)用。没有后者,策略上不了真机。
这个公式背后是成本。AgiBot World 用 100 台双臂人形机器人在 4000 平方米专用设施里采集了 2976 小时操作数据。RoboMIND 为四种不同机械臂各自搭建了配套的遥操作硬件。每一小时遥操作数据都要消耗目标机器人、遥操作台、熟练操作员三样东西。
UMI(Universal Manipulation Interface)自 2024 年提出以来,让人类手持装有传感器的 gripper 就能采集演示数据,成本远低于遥操作。但此前的共识是:UMI 数据最多用于预训练,部署阶段仍然需要一小撮遥操作数据作为"锚点"。哪怕 ActiveUMI 和 XRZero-G0 已经把遥操作比例压到极低,也没有完全去掉。
HiFi-UMI 问的是一个更彻底的问题:不是降低遥操作的比例,而是把 UMI 数据的保真度提得足够高,让这个锚点直接消失。
3 毫米、40 微秒、200 度:一台没有机器人的数据引擎
Simple AI 团队的回答是硬件与软件从头协同设计。
位姿精度:不同于传统 UMI 将 SLAM 相机装在腕部(那个视角经常被手和物体遮挡),HiFi-UMI 把立体惯性 SLAM 相机装在操作者头部。头戴式立体相机追踪全局轨迹,双手各有一个标记立方体在同一个头戴相机坐标系中被定位。论文报告末端执行器精度达到 3 毫米,无需任何外部追踪基建。
同步精度:所有传感器(六台相机、IMU、编码器、gripper 信号)共享一个 GPIO 硬件触发器,跨传感器时间偏移低于 40 微秒。论文指出,此前的方案多用软件或无线方式对齐数据流,在需要精确协调的双臂任务中引入误差。
视觉覆盖:每只手配备两颗非平行鱼眼相机,水平和垂直覆盖均约 200 度。加上头部立体相机,每段演示提供六个同步视角。
数据引擎:原始采集进入一个六阶段闭环:在线质量监控、离线轨迹重建、整机动力学回放验证、AI 辅助标注、人工核查、统计分析与导出。轨迹重建和回放验证各保持 98% 以上通过率,累积约 96%。这个引擎从超过 2 万小时的原始语料中,筛选并发布了 2000 小时的 HiFi-UMI-2K 子集。
后训练实验在三套模型架构上运行:StarVLA-QwenPI、OpenPI-π0.5、LingBot-VA。HiFi-UMI 后训练与同场景遥操作后训练的差距分别为 -2.5、+3.1 和 -0.6 个百分点,全部在采样噪声范围内。论文特意设置了对 HiFi-UMI 不利的条件:遥操作数据在评估场景中采集,而 HiFi-UMI 数据不在。六个条件共执行了 960 次真实机器人 rollout,评估协议在实验开始前冻结。
没有机器人采集的数据,正在重划谁能上桌
HiFi-UMI 不是孤例。8 月 5 日,,一个预训练在超过 10 万小时 UMI 数据上的机器人基础模型。同一天,Qwen 团队公开了 技术细节,将自我中心视频转化为机器人训练数据。2024 年以来,FastUMI-100K、RDT2 的万小时级语料都在试探同一个方向:能不能把机器人数据的采集成本从"需要机器人"的等式里解耦出来。
但此前所有方案都保留了遥操作锚点。HiFi-UMI 的不同在于它把比较直接做在了同一个机器人、同一套评估协议上,且双方差距落在采样噪声级别。论文写道:"this reframes the question away from mixing ratios."
AI Weekly 指出了一个诚实的边界:"a few points of parity on the paper's chosen benchmark tasks is not the same as parity in a warehouse or a home."85% 的精密插入成功率很强,但在安全敏感场景,剩余 15% 的失败不可忽略。此外,这篇论文不能回答采集设备的成本在计入硬件同步和相机工作后是否真的低于遥操作。它提供的是一个方向,不是一个结论。
最先受益的,是那些本来上不了桌的人
如果一台手持采集设备能为一大类操作技能替代昂贵的遥操作管线,最先受益的不是已经拥有机器的实验室,而是那些从未负担得起这条管线的团队。HiFi-UMI 没有宣称要消灭遥操作。它只是证明了一种可能性:当数据本身足够精确时,采集它的人手里拿的是 gripper 还是机器人,可能不再是一个必须回答的问题。