AREX Feed Article
AgiBot把3000小时真机数据炼成世界模型,Genie Envisioner全栈开源
2025年8月,智元机器人(AgiBot)发布了Genie Envisioner——一个将机器人感知、策略学习与仿真评估统一进单个视频生成框架的世界模型平台。平台基于数据集训练,包含近3000小时、超过100万条双臂真机操作片段,覆盖200余种任务和87项原子技能。团队在中承诺开源全部代码、模型权重和benchmark,随后几周内陆续兑现。
该论文已被接收。截至2025年12月,GE-Base预训练权重、GE-Sim模型和GE-Act的评估权重均已上线和ModelScope,完整训练与推理代码托管于。
tphuang:他们开源,因为硬件才是护城河
科技博主 (3.7万关注者)在X平台评论称,中国公司正在将人形机器人竞赛中的"软件秘方"开源,"因为他们相信自己的优势在硬件制造上"。他将Genie Envisioner称为"全球首个开源的真实世界机器人VLA模型平台",认为其视觉中心化路线——直接从语言指令映射到视觉空间——比语言抽象路径更擅长捕捉跨平台的底层物理规律。
(20.7万关注者)以英文报道了此次发布,称Genie Envisioner为"面向真实世界的统一视频生成平台,整合了预测、策略学习和神经仿真"。
技术社区账号 (8800关注者)给出了最紧凑的技术拆解:GE-Base为多视图视频扩散transformer,GE-Act为1.6亿参数动作解码器,GE-Sim支持每小时数千次rollout。
先开源数据,再建评测,最后发布模型
Genie Envisioner不是凭空出现的。2024年12月30日,智元机器人发布了AgiBot World百万真机数据集,依托配备8个摄像头和6自由度灵巧手的移动双臂机器人平台采集,覆盖五大领域、100余种真实场景。2025年5月,EWMBench具身世界模型评测基准率先在释出。
三步走——先开放数据,再建立评测标准,最后发布统一模型平台——构成了一套完整的开源生态布局。与主流的视觉-语言-动作(VLA)路线不同,GE选择了以视觉为中心的技术路径:用视频扩散模型直接捕捉机器人交互的时空与语义规律,而非将视觉输入转化为语言表征后再学习动作策略。
200毫秒、54步、一张RTX 4090
GE-Base是一个指令条件化的多视图视频扩散模型,在LTX-Video架构基础上进行机器人领域自适应预训练。它从语言指令直接映射到具身视觉空间,生成与指令对齐的视频片段来捕捉操作行为的时空演化。模型权重已在HuggingFace公开,分为高频(GE-Base-slow)和低频(GE-Base-fast)两个版本。
GE-Act将视觉表征转化为可执行动作。这个1.6亿参数的flow-matching解码器,在消费级RTX 4090上以200毫秒生成54步关节力矩序列。推理采用慢-快双频架构——5Hz视觉刷新配30Hz控制频率。
跨具身泛化能力是GE-Act最突出的特征。在Dual Franka和Agilex Cobot Magic等预训练中未见过的机器人平台上,仅需1小时遥操作数据做后训练,GE-Act即能执行变形物体折叠和记忆依赖型包装任务,性能超过任务专项基线模型。
GE-Sim将GE-Base的生成动态复用为动作条件化神经仿真器,支持闭环策略评估。通过分布式集群并行化,实现每小时数千次rollout,速度远超真实世界执行。EWMBench则提供了覆盖场景保真度、物理一致性和指令-动作对齐的10任务评测体系。
世界模型从"预测下一帧"走向"承担全部职责"
在Genie Envisioner之前,机器人操作系统由碎片拼接而成:独立的数据采集管线、分离的策略训练流程、定制化的评估工具。每阶段都需要专属基础设施和人工调优,迭代慢、故障难以追溯。
GE把三件事压进了同一个视频生成框架。它不是在已有VLA路线上做增量改进,而是试图重新定义世界模型的职责边界——不仅是"预测下一帧",还要承担感知、策略推理和仿真评估的全部功能。
来自后续开发的信号也指向同一方向。2026年4月,AGIBOT AI Week发布,引入Real2Edit2Real数据工作流和分钟级长程稳定仿真。5月底,,以EWMScore_P 68.26击败Sora和Veo等通用视频生成模型。AGIBOT官方称,这一成绩来自原生世界模型架构,"未使用针对基准的专项系统改造"。
开源不是慷慨,是硬件的赌注
AgiBot的决策逻辑贯穿始终:在具身智能竞争中,大规模真机数据的采集能力、硬件制造的成本控制和真实场景的部署工程,才是难以复制的壁垒。Genie Envisioner的全栈开源,是这个判断的宣言,也是它的压力测试。