AREXOpen in interactive Feed

AREX Feed Article

AGIBOT 发布 GE-Act 2.0 世界—动作模型,自报数据扩展 100 倍后 G1-OP 零样本成功率升至 44.1%

September 11, 2026

9 月 11 日,AGIBOT(智元机器人)在里宣布推出 GE-Act 2.0(Genie Envisioner Act 2.0),并称这是首个验证预训练与规模扩展路径的“原生”世界—动作模型(WAM)。帖子自报:联合训练数据从 300 小时扩展到 30,000 小时后,G1-OP 机器人上的零样本分布外平均成功率从 17.1% 升至 44.1%,另一款机器人 G2-90D 从 13.4% 升至 31.1%。

发布帖所链接的公布了方法与评估协议;对应的技术报告已提交至 ,提交日期为 9 月 4 日,署名以 AgiBot Research Team 开头。按官方说法,这套模型的可训练生成与动作模块全部从随机初始化开始训练,不继承预训练视频生成器,评估时也不做任务专属微调。

评估设计:四个数据池与零样本、分布外协议

规模研究使用四个逐级包含的数据池:300、1,200、5,000 和 30,000 小时;各组使用相同的预训练模块与训练方案。每个检查点都在两款不同的机器人上评估 100 项原子任务、20 类技能,每项任务在每个机器人、每个规模下各跑 10 次;成功标准预先定义,使用最后一个检查点与固定部署设置,不针对任务调整提示词或挑选检查点。

评估遵循零样本、分布外(OOD)协议:测试使用预训练与联合训练中都没出现过的新物体实例、场景、背景与光照,不做任务或机器人专属微调。项目主页写明,四个数据点只用于比较不同规模,不做曲线拟合,也不外推 30,000 小时以上的结果。

从 5,000 小时扩展到 30,000 小时,性能仍在继续上升;发布帖称 G1-OP 的表现“没有饱和迹象”。

从 39 项到 76 项:成功率提升覆盖的技能组与任务

按技能组拆开,项目主页给出的数字是:提升覆盖 G1-OP 的 19 类技能与 G2-90D 的 18 类技能(共 20 类);成功率非零的任务数,G1-OP 从 39 项增加到 76 项,G2-90D 从 24 项增加到 72 项。

两款机器人在联合训练数据中的占比相差很大:G1-OP 占 50% 以上,G2-90D 不足 2%。项目主页把 G2-90D 随共享数据规模出现的提升表述为“表明更广泛的训练数据可能带来有效的跨本体迁移”,也就是能力可能从一款机器人迁移到另一款;在最大数据规模下,G2-90D 有 10 类技能各自的数据不足 5 小时,其中 4 类不足 1 小时。项目主页还给出技能覆盖与零样本分布外成功率的相关系数:皮尔逊 r=0.80、斯皮尔曼 ρ=0.85。

数据规模也拓宽了操作技能范围:项目主页称,G1-OP 在 30,000 小时规模下开始成功完成扶正、分离物体等动作;发布帖举出的新技能例子是叠毛巾、套叠纸杯、取下笔帽和插花。

指令指代评估:六个维度与偏置冲突测试

同一零样本协议下,项目主页从物体类别、颜色、尺寸、形状、位置、顺序六个维度评估指令指代;论文摘要称,模型对物体类别、颜色、形状和位置指代的解析在至少 90% 的试验中成立。

另一组演示检验显式指令能否覆盖模型从训练中形成的关联:夹爪已经接近一个物体时,训练数据里的常见下一步是抓取它;鞋子摆在鞋盒旁时,模型容易联想到把鞋子放进鞋盒。测试要求模型把伸手方向改到另一件物体,或把杯子放进鞋盒。项目主页称,这类与已进行的操作或惯常场景关联相冲突的指令也能被遵循,并展示了在杂乱场景中按指令选物、用连续单步指令组合出新的长时序任务。

CoAE、SVP、IDM:从零预训练的三个模块

论文把研究空白描述为:世界—动作模型通过预测未来状态来指导动作,可同时利用无动作视频与带动作标注的交互数据;但多数工作直接继承预训练视频生成器,预训练与规模扩展这条路径本身研究不足。论文称,GE-Act 2.0 因此把可训练的生成与动作模块全部改为在操作数据上从零训练。

流程由三个模块依次完成。面向控制的自编码器(CoAE)把每帧 256×384 的相机图像经 64 倍空间下采样压缩成 24 个潜在 token,并保留像素解码器用于检查预测出的未来画面;它还配有三个对齐头,分别匹配冻结的 SigLIP 2 语义特征、V-JEPA 2.1 运动特征和 DINOv3 密集结构特征。同一探针设置下,CoAE 的 token 数只有 DINOv3 与 V-JEPA 2.1 的十六分之一,但动作恢复误差比二者高 13%~31%;项目主页注明,这类探针独立于真机任务评估。

单步视觉规划器(SVP)在一次可微的 MeanFlow 前向计算中生成完整的未来潜变量序列,替代需要多步去噪的传统生成器,让动作损失可以经由预测的未来传回规划器;逆动力学模型(IDM)从观测到的状态转移中恢复动作,先独立训练,再接入同一输入接口。两个模块使用不同的预训练数据:SVP 39,000 小时,IDM 32,000 小时,与规模实验的 30,000 小时联合训练池不是同一批数据。发布帖还提到,2,000 小时失败操作与部署回放被算作训练资产;项目主页对数据互补性的解释是,机器人轨迹可能缺少语言指令,也可能来自失败尝试。

部署时,机器人只执行近期动作范围内的密集动作片段,延伸至任务末端的稀疏预测只在训练中作为辅助监督。

KASO:筛选与记录动作相容的候选未来

一个正确的视觉预测,不一定与记录的动作相容。同一场景、同一指令,机器人可能以多种方式完成任务:生成的未来可能对应其中一种,而示范记录的是另一种;把两者配对训练,逆动力学模型就会收到错位的监督。项目主页把这种不匹配称为“有效性缺口”。

KASO(knowledge-aligned selective optimization,知识对齐选择性优化)的做法是:先生成多个候选未来;再在固定的高噪声流时间点、用相同的动作噪声,分别以各候选和记录视频为条件探测当前 IDM,按两者响应的差异在动作空间里排序。排序发生在动作空间,因此视觉上不同、但对应相同行为的未来仍可能被判为相容。默认配置选取能量最低的候选,保留其噪声以带梯度重现该预测,再采样新的动作噪声与时间点计算损失,同时更新 IDM 与 SVP。候选选择在每个优化步骤重新进行,不是对生成数据集做一次性筛选。

受控真机消融实验在 G2-90D 上进行:所有变体从相同的完整预训练模块初始化,使用相同的 300 小时连接阶段数据(含 30 小时 G2-90D),不针对评估任务微调。在四物体场景中,KASO 与 E2E+PT 的指令跟随得分持平,但 KASO 把更多正确的目标接触转化为成功抓取。项目主页注明,这组结果来自对齐阶段实验,不代表最终模型性能。

104 毫秒的完整流程,与一行“即将开放”

预测未来状态会增加从观测到动作的计算量,项目主页给出的数字是:GE-Act 2.0 在单张 RTX 5090 上以 104 毫秒完成从三路相机观测到 52 个可执行动作的完整流程;这 52 个动作以 30 Hz 执行,对应约 1.7 秒的运动,通过动作分块在消费级 GPU 上支持实时控制。按项目主页的说明,速度来自三处设计:CoAE 的紧凑视觉序列、SVP 的单次生成,以及 IDM 的五步去噪输出。

外部团队要独立复现这些结果,还差项目主页上那份标注“即将开放”的代码。

参考链接