AREX Feed Article
164 小时真机 RL 数据开源,智元把人工纠正做成了机器人的新燃料
2026 年 8 月 6 日,智元机器人(AGIBOT) AGIBOT WORLD 2026 第三期数据集——强化学习(Reinforcement Learning)。9,638 条轨迹,164 小时以上真实物理机器人操作数据,14 个任务场景,覆盖工业、商业和家庭环境。以太网线插入、钥匙开锁、条码标签粘贴、螺丝拧紧、台灯端到端包装——每个任务都来自 AGIBOT G2 机器人在真实世界中的完整执行记录。
和此前以"示范"为核心的数据集不同,Theme 3 的技术重心不在"机器人怎么做",而在"机器人做错了之后,人如何纠正它,它又如何从纠正中学会不再犯错"。
社区在等力反馈——从四月首发到现在的三级跳
Theme 3 发布不到 24 小时,尚未出现集中的公开讨论。但 AGIBOT WORLD 的整体开源路线已在具身智能社区积累了关注。
今年 4 月该数据集首次发布时,机器人从业者 Eric Miller 在 上写道:"Open sourcing recovery trajectories changes the training value — failure data teaches robust adaptation. Embodied models improve faster when mistakes become part of the curriculum."(开源恢复轨迹改变了训练数据的价值,失败数据教会模型鲁棒适应。当错误成为训练课程的一部分,具身模型会更快进步。)另一位从业者 Scarlett Lu 评论:"Most real-world deployment issues don't come from success cases, but from edge cases and unexpected failures. The more this kind of data becomes available, the faster real-world robotics will scale."(大多数真实部署的问题不来自成功案例,而来自边缘情况和意外失败。这类数据越多,真实世界机器人规模化就越快。)
上的 AGIBOT WORLD 2026 页面提供了基于 LeRobot v2.1 格式的完整数据结构和多层标注说明。
这些反馈指向同一个缺口:社区不缺"完美示范",缺的是真机试错、力反馈和纠正闭环。Theme 3 正好打在这个点上。
五期路线走到一半,智元在加速什么
AGIBOT WORLD 2026 是一个分五期发布的具身智能数据集计划,全部基于 100% 真实环境采集,使用智元精灵 G2 机器人平台。
2026 年 4 月 7 日,首发。以自由采集模式获取专家示范数据,让机器人通过模仿人类遥操作学习复杂技能,同时保留并标注了错误恢复轨迹。
2026 年 6 月 3 日,上线。从"完美示范"转向捕捉物理交互全貌——抓取失败、碰撞、物体掉落、不稳定接触和液体飞溅。智元当时称,这是为了解决"大多数机器人数据集只展示成功轨迹"的数据缺口。
Theme 3 再进一步:构建 RL 闭环——模型在真机上自主执行策略,偏离时人类接管、调整位姿和力度,再将控制权交还。整个过程被完整记录为可索引的结构化数据。
Theme 3 发布的时间点,恰好与智元启动港股 IPO、首席科学家罗剑岚从合伙人名单中"消失"的新闻重叠。公司罗剑岚"暂未离职,内部岗位调整",但其主导的具身智能大模型路线与数据开源工作能否持续,市场仍在观望。今年 6 月智元宣布第 15,000 台机器人下线,7 月 24 日官宣启动赴港上市。
力/扭矩信号与人工干预:让 RL 不再只活在论文里
Theme 3 在三个技术维度上与先前版本形成了明确区分。
力/扭矩信号入列。 此前 AGIBOT WORLD 的数据以视觉观测和运动轨迹为主。Theme 3 首次将六轴末端力/扭矩信号和关节扭矩信号作为核心数据维度纳入开源——从接近目标、建立接触到施加持续力、完成操作,力的变化全程可追踪。对灵巧手操作任务,数据集还记录了多指协同过程中的反馈信号。RL 策略由此不仅知道"有没有碰到",还能感知"用了多大力、力是否有效"。
人工干预闭环。 一条完整轨迹的标准结构:预训练模型部署到真机 → 自主执行 → 策略偏离 → 人类操作员接管,调整位姿、角度、运动方向或施加力 → 执行恢复,控制权交还模型。智元在公告中写道:"Each takeover can serve as targeted training data for policy refinement and task recovery."(每次接管都可以作为策略精炼和任务恢复的针对性训练数据。)接管区间的起止时间戳被精确标注,支持按需提取纠正片段。
多层标注框架。 数据集沿用 AGIBOT WORLD 的分层标注体系:步骤描述重建任务进程;成功段、错误段、对抗段与干预区间将连续执行转化为可索引、可过滤的结构化数据。按智元的说法:"These annotations show not only the task stage and outcome, but also where execution fails, when a human takes over, and how execution resumes."(这些标注不仅显示任务阶段和结果,还标明执行在哪里失败、人何时接管、执行如何恢复。)
机器人数据集告别「完美示范」
此前行业主流数据集——Open X-Embodiment、DROID 等——以"示范数据"为核心:人类遥控操作完成一次成功任务,模型通过模仿学习复现。这种范式的结构性问题在于,模型从未见过失败,无法从失败中恢复。
AGIBOT WORLD Theme 1 引入错误轨迹保留与标注。Theme 2 进一步纳入碰撞、掉落等物理交互异常。Theme 3 将 RL 训练所需的"试错 → 反馈 → 纠正"循环,从实验室的单次实验变成了标准化的开源数据产品。
力/扭矩信号的加入恰好卡在一个行业痛点上。2026 年 6 月发表于 arXiv 的指出,当前机器人基础模型的中心瓶颈"不仅在于策略学习,还在于缺乏将物理经验转化为机器人可用监督的机制",并将力-扭矩测量列为机器人原生数据的关键组成。Theme 3 的设计——力信号 × 人工干预标注 × 结构化任务分解——同时覆盖了数据接口和部署反馈两个方向。
AGIBOT 自身正经历商业加速与组织震荡的并行。IPO 前夕,首席科学家岗位调整引发外界对技术路线连续性的质疑。但无论动机如何,持续履约开源承诺的客观效果是:全球具身智能社区获得了一批此前不存在的真实世界 RL 训练数据。
一家教机器人从失败中学习的公司
9,638 条轨迹,相比 Theme 1 的百万级规模只是零头。但 Theme 3 的价值不在规模,在类型——它将六轴力/扭矩真机反馈和人工干预标注体系化纳入开源 RL 训练管线,这是此前大规模数据集中没有的结构。教会机器人从失败中学习的公司,自己也在经历一场高风险的调整。两条叙事最终会不会交汇,取决于五期路线图能否如期走完。