AREX Feed Article
Reward AI 发布其首个机器人基础模型 OM-1,称仅凭人类操作数据零样本泛化至机械臂与人形机器人
9 月 14 日,Reward AI 在中宣布其首个机器人基础模型 OM-1,称它能零样本泛化到「任何机器人:桌面机械臂、工业机械臂与人形机器人」。公司在帖文中列出的要点包括:直接从人类操作数据学习、不使用遥操作或机器人数据、灵巧度与效率接近人类水平、支持多机器人协作。帖子附有一段演示视频;配套的把整套系统命名为 Omnibody 栈,原则是「One Model, One Data Interface, Any Body」:一个模型、一套数据接口,适配任意机器人本体。
这些能力表述均出自公司单方口径。中称该公司由此结束隐身状态,并把跨本体的零样本泛化声明与「不足 30 分钟演示数据」等说法明确标注为公司主张(company claims)。发布这条消息的 X 账号 @RewardAI_ 创建于 9 月 7 日。
Omnibody Hand:7 个自由度的手与一套数据接口
Omnibody 栈的第一层是数据采集:让人类直接演示,而不是把动作先映射到某台中间机器人上。据该博客,数据、学习与控制是一起设计的,而不是事后拼装;采集端设备 Omnibody Hand 建立在团队此前的工作 DexCap 之上。DexCap 是 2024 年发表于 RSS 的动作捕捉数据采集系统,论文作者包括 Chen Wang、Li Fei-Fei、C. Karen Liu 等。Humanoids Daily 把 Omnibody Hand 描述为「源自 Stanford DexCap 研究的可穿戴 7 自由度动作捕捉设备」,它集成触觉反馈、接近觉传感器、手内全局快门相机与电磁追踪。
7 自由度是功能取舍的结果。博客称他们没有逐关节复制人手,而是保留了三类关键动作:选择接触点、在手中转动物体、在精细捏取与包裹式抓取之间切换。拇指与食指能独立屈伸、完成捏合;中指、无名指与小指在掌指关节(MCP)处联动,配合拇指闭合。为适配不同手型,设备内置远端屈曲机构吸收手指长度差异,换人使用不需要逐人调整。博客还称,采集不需要专门布景或有人盯场,工作、做饭、玩耍这类日常动作本身就能产生模型可学的数据。
把手势变成可用数据的是 One Data Interface:高频触觉、接触前的接近觉、手内全局快门相机覆盖从接近、接触再到稳定抓取的整个过程;手部位姿以视觉-惯性追踪为基础,叠加电磁追踪,补上快速反向运动时视觉刷新率不足的短板。博客给出的对比测试是:把两种追踪器刚性固定在同一结构上,在相隔固定距离的两个机械挡块之间以八种速度移动,每种速度取十次平均,高速下平均过冲误差降低 60%。Humanoids Daily 补充的数字更具体:峰值速度下平均误差从 24.9 毫米降到 9.5 毫米。演示数据同时还记录力,因此一条示范不只包含手的轨迹,也包含沿途用力的多少。
OM-1:不从遥操作学起的通用策略
OM-1 是整套栈的决策核心。博客称它是公司自研的通用机器人策略:直接学习人类操作数据,生成机器人动作时不必绕道某一台中间机器人,也不用遥操作数据或机器人自身经验;架构为高效推理而设计,以跟上人做动作的节奏。训练上,博客称 OM-1 没有预训练与后训练的分界:所有演示都经同一个数据接口、以同一种形式进入,最早与最新的数据在同一条策略、同一个阶段里训练;接入新机器人不需要重新采集数据,人类数据的规模与多样性越大,模型越强。
模型输入是 Omnibody Hand 采集的多模态信号:图像、触觉、指间接近觉与手部位姿轨迹。不同模态按各自传感器的原生采样率处理,而不统一降频,因此高频的触觉与运动线索不会被低频的视觉上下文抹掉;模型还读取这些信号的时间历史,用来判断何时开始抓取、物体是否握稳。输出包含运动方向、速度、力,以及抓取、移动等关键事件的时间点。公司在帖文中称 OM-1「接近人类水平的灵巧度与效率」;博客则称,它能用「不足 30 分钟的数据」学会一个包含复杂动力学与长时程的新任务。
控制层:跑在策略推理之外的另一个时钟
策略推理再快,也有延迟波动;如果执行端停下等待下一次推理,动作就会顿挫。OM-1 的处理方式是把控制从策略中解耦:高频控制层运行在策略之下,把模型输出的动作(包括移动机器人的导航)转换为实际驱动,并吸收每台机器自身的特性。博客称这层控制用强化学习在仿真中训练,覆盖随速度、加速度变化的动力学、外部扰动与系统延迟;它给出的对比是,经典控制器被意外负载推离参考轨迹后无法恢复,而 OM-1 的控制层能顶住扰动、回到参考轨迹。
因为控制层跑在自己的时钟上,策略推理的延迟不会打断机器人运动;代价是相邻两次预测的动作可能衔接不顺,高速下难以察觉的抖动也会破坏执行效果。博客称控制层会在线上优化相邻预测之间的过渡,让抛掷、摆动这类动态动作保持平滑;Humanoids Daily 补充说,它还要吸收未建模的电机回差(backlash)等效应。博客点名的验证场景包括:拉开一扇完全关紧、阻力未知的冰箱门,以及搬起重量不一的快递箱。
演示里的任务:从拔网线到叠衣服
Humanoids Daily 列出的实时演示包括:拔出一根 RJ-45 网线(需要先用触觉持续按压卡扣、再施力拔出);双臂叠衣服、调酒、包装消费电子产品,单件任务周期在 30 秒以内;以及出错后的恢复:物体被推走或拉走时实时调整,一条手臂打滑、另一条自动补偿的多臂配合。报道称这些演示以人类全速实时完成,其配图说明把相关能力概括为「无需针对机器人本体的微调」(without robot-specific fine-tuning)。配图说明还给出了两个场景的具体描述:一台配 Omnibody Hands 的双足人形机器人在传送带上分拣物品并完成多物体交接;一台人形机器人在冰箱门上应对动态阻力,以 1 倍速从搁架上取物。
上述演示均出自公司发布的视频。
数据路线之争:纯视频、上下文学习与人类演示
Humanoids Daily 把这次发布放进物理 AI 的路线分歧中:该用什么数据才真正教得会机器人使用双手。据该报道梳理,以互联网视频为预训练来源的纯视频路线,代表是 Rhoda AI 与 Dyna Robotics 的 Dyna-2;用视频演示或手持夹爪、在不重训权重的前提下引导操作的「上下文学习」路线,代表是 Skild AI 的 S1 与 Generalist AI 的 GEN-1.5;Reward AI 走第三条路:不用遥操作,也不用互联网视频,只用穿戴设备采集的人类真实操作。该报道还梳理了采集硬件上的竞争:Sunday Robotics 的 Skill Capture Glove 用更简单的平行夹爪完成叠衣等家务;X Square Robot 的 TwinDEX 用 9 自由度外骨骼追求与三指机器手严格同构;Reward AI 则声称 2 自由度夹爪会限制接近角度与接触点选择,试图走一条中间路线:接口要足够表达人手的灵巧,又不必与下游本体保持 1:1 的运动学对称。
公司博客还把时间尺度放得更远:博客称,今天采集的人类数据将用于训练「尚未被设计出来的机器人本体」。而按 Humanoids Daily 的判断,更近的一道检验是:实验室里的灵巧演示能否在客户车队上转化为持续稳定的表现;该报道给出的门槛是 99.9% 的正常运行时间。
参考链接
- _