AREXOpen in interactive Feed

AREX Feed Article

小米开源机器人基础模型 XR-1:10 万小时真实抓取数据炼成,权重全公开

August 9, 2026

8 月 5 日,小米机器人团队将 Xiaomi-Robotics-1(XR-1)的模型权重、代码、benchmark 评估和部署工具一次性公开到了 和 。这是一个视觉-语言-动作(VLA)基础模型,用超过 10 万小时的真实世界操作轨迹做预训练。项目的技术报告已于 7 月 16 日发布在 上。

不是仿真数据,不是互联网爬取视频。是人类操作员用手持 UMI 夹爪设备,在 1,700 多个家庭、商铺、工厂和户外场景中一条一条采集的物理操作轨迹。

10 万小时约等于 12,500 个八小时班次。这部分不靠买 GPU 堆出来。

「小米把语言模型的缩放定律搬进了机器人」

Cartwheel 联合创始人、前 OpenAI Codex 团队成员 Andrew Carr 在 7 月 21 日发推评论:「xiaomi just brought language scaling to robotics。」他引用论文中的原话——「缩放增益没有任何饱和迹象:模型在预训练阶段消耗更多数据或扩大的同时,后训练后的真实机器人成功率持续提升」——并补充说,Cartwheel 自己也在做同样的事,「看到它在机器人下游发生,很受鼓舞」。

机器人内容聚合账号 Robots Digest 的判断更直接:「LLM 靠互联网文本缩放,机器人将靠交互缩放。XR-1 是迄今最强的信号之一——前沿机器人模型不会只靠聪明的架构胜出,它们会来自收集数量级更多真实世界经验,并把它变成通用机器人基础模型。」

科技投资人 Money Qubit 在长推文中算了一笔账:10 万小时就是 12,500 个八小时班次。「这是机器人学落后于语言模型的最大原因之一——你可以在互联网上预训练 LLM,但你不能在互联网上预训练一个夹爪。」他指出,小米真正的战略动作不是模型本身,而是数据管道——「把模型送出去,建数据管道,建硬件。因为在机器人领域,真正的护城河可能不是模型权重,而是持续收集数百万次有用物理交互的能力。」

上该项目的讨论帖拿到 386 分、270 条评论。一位用户写道:「看到视频里机器人能做洗衣房的工作,我咧着嘴笑个不停。模型至少还和免费啤酒一样自由——我们曾为这样的时代祈祷,这才是机器人该被用来做的事。」

从 XR-0 到 Gemini Robotics 2,路线正在分岔

XR-1 的路线可以追溯到今年 2 月。当时小米发布了 ,一个 4.7B 参数的 VLA 模型,主打实时执行性能,是小米机器人团队首次以开源权重方式进入机器人基础模型赛道。

六个月后,XR-1 的训练数据量级和范式都发生了质变。XR-0 用的是跨具身机器人轨迹预训练;XR-1 则押注「去具身化」UMI 数据的大规模预训练,再用少量真实机器人数据做后训练对齐。

据 The Robot Age 报道,就在 XR-1 开源前不到一周——7 月 30 日——Google DeepMind 发布了 ,一套覆盖全身控制、灵巧操作、设备端适配和多机器人协作的物理 AI 系统。DeepMind 通过 Gemini API 和 AI Studio 开放了推理端点,但核心动作模型和端侧模型仍走早期合作伙伴路径。

两条路线正在清晰分岔:Google 把最强的机器人智能保留在受控的产品栈和合作伙伴计划内;小米把基础模型权重直接丢进公开开发者渠道。The Robot Age 对此评述:「一种方式分发能力,另一种方式把能力集中到产品周围。」

同一篇分析还指出,阿里达摩院发布了 RynnBrain 开源具身基础模型系列,智元机器人(AgiBot)推出了 AGIBOT WORLD 2026 开源具身数据集。中国公司在商用机器人和人形机器人领域,越来越倾向于把模型资产和数据集当作生态加速器发布出去。

预训练学动作,后训练学听话

XR-1 的训练分为两阶段,沿用了大语言模型的范式。

第一阶段:预训练。 目标是让模型暴露在尽可能广泛的真实物理世界中。团队开发了一套自动标注管线——用强视觉-语言模型将长视频切分为固定长度片段,然后为每个片段标注场景状态转移的自然语言描述。10 万小时 UMI 轨迹覆盖了 1,700 多个场景,靠人工标注完全不可行,这套自动化管线是整个预训练能跑通的前提。

预训练展示出干净的缩放行为:数据和模型规模越大,验证动作误差持续下降。官方页面公布的缩放曲线显示,数据量从 12.5% 增加到 100% 时,验证误差从约 0.59 降至约 0.43——数据缩放的效果显著强于模型缩放(2B 到 10B 的降幅更小)。

第二阶段:后训练。 分两条线对齐——具身对齐用 7,200 多小时的真实家庭机器人数据(整理沙发、收拾鞋柜、归置厨具等任务),将通用动作生成能力映射到实际机器人上;指令对齐则让模型从「根据状态转移描述生成动作」切换到「理解自然语言指令并直接执行」。

后训练完成后,XR-1 可以在未见过的环境中、面对未见过的物体实例开箱即用地执行移动操作任务。

四个主流仿真 benchmark 上,XR-1 全部取得最优:RoboCasa365 得分 57.4%,比第二名 46.6% 的相对提升达到 23.2%;RoboDojo 得分 13.93,远超第二名 8.80;VLABench 和 RoboCasa 也分别以 59.1% 和 74.5% 登顶。

更实用的是高效适配能力。在电话打包、打印机换墨、洗衣装载、盒子打包四项新任务上,XR-1 只用平均不到 10 小时的任务演示数据就达到 75% 整体成功率,几乎是 π0.5 基线(40%)的两倍。把数据预算提高到平均不到 40 小时后,整体成功率升至 85%。

开源的是模型权重,押注的是数据管道

XR-1 开源把机器人基础模型从「某个实验室的 demo」变成了可被外部团队检验、复现、改进的共享基础设施。

The Robot Age 的分析点出了关键:「机器人不像聊天机器人,一个团队不可能周末换一个 API。机器人模型必须与摄像头、手、轮子、手臂、电池、中间件、安全案例、设施和人集成。模型层越封闭,第三方就越难理解机器人为什么这样行动,也越难适应当地约束。」

但开源标签也需要审视。机器人领域的「开源」可以包含代码而没有可用权重,有权重而没有训练数据,有训练声明而无法复现评估。XR-1 这次同时发布了代码、权重、benchmark 结果和部署指南,比大多数机器人「开源」声明更实在。

Money Qubit 的分析把话题拉回战略层面:小米的路线是「把模型送出去,建数据管道,建硬件」。XR-1 不是终点——它是数据飞轮的起点。谁有能力持续收集数百万次真实物理交互,谁就可能在下一轮模型迭代中跑赢。

XR-1 开源的时机恰好在 Gemini Robotics 2 发布之后。Google 在推高机器人智能的上限,小米在拉低机器人智能的分发成本。两条路都在往前走,但指向同一个分歧:机器人基础模型最终是少数公司的私有基础设施,还是整个行业的公共层。

缩放曲线没有饱和,这才是真正的信号

XR-1 论文中最值得注意的一句话不在 benchmark 表格里,而在预训练分析中:「缩放增益没有任何饱和迹象。」预训练数据越多、模型越大,后训练后真实机器人的成功率就持续上升。

10 万小时不是终点线,只是第一段跑道。机器人基础模型的缩放故事才刚刚开始,而这个故事的主角不是架构创新——是谁能稳定、持续、规模化地采集真实世界的物理交互数据。

参考链接