AREX Feed Article
小米掏出Xiaomi-Robotics-1,10万小时数据+Apache 2.0全栈开源
北京时间8月5日晚,小米通过官方账号 宣布,将机器人基础模型 Xiaomi-Robotics-1 以 Apache 2.0 许可证全面开源。
这是一个 5B 参数的视觉-语言-动作(VLA)模型,预训练阶段吃进了超过 10 万小时的 UMI(手持夹具)操作数据,覆盖 1,700 多个真实场景;后训练阶段又叠加了超过 1 万小时的跨具身数据。
此次开源不止放出模型权重。官方同步释出了从实机后训练到模型部署的,以及四项主流仿真基准的评测代码。
10万小时是什么概念?一位研究者算了笔账
小米这条官推截至发稿收获超过 1,200 次点赞和 160 次转发。
德州大学达拉斯分校机器人研究员 Yu Xiang 在引用推文中算了一笔直观的账:"100K Hours = 4,166.67 天 = 11.4 年的真实世界轨迹。"他同时指出模型在 RoboCasa365 上取得了 57% 的成功率,并留下一句 "Maybe we're missing something"。
的 Ben Koska 则直接宣布已为该模型提供 Day-0 支持,让用户可以在其平台上对 Xiaomi-Robotics-1 做下游任务定制。
在社区讨论中,"全套管线开源"被反复提及。用户 在回复中写道:"真正的亮点是把后训练到部署的完整管线放出来,而不只是丢几个权重文件。"BotBot Robotics 创始人 Nicolas de Camaret 则注意到模型底层使用了 Qwen3-VL:"Nice it uses Qwen3-VL!!"
论文先发了三周,代码才跟上
本次开源并非突如其来。早在 7 月 16 日,小米机器人团队就在 arXiv 上发布了 Xiaomi-Robotics-1 的(arXiv:2607.15330),详述了模型架构、数据构成和两阶段训练方法。
三周后的 8 月 3 日,上线了后训练、推理和基准评测的完整代码与模型 checkpoint。官方更新日志显示,这是继 7 月中旬技术报告发布后的第二步。
在此之前,小米已于今年 2 月开源了 ,一款 4.7B 参数、聚焦实时推理的 VLA 模型。而今年 3 月发布的 将机器人列为核心应用方向之一。
将这些事件串联起来,Xiaomi-Robotics-1 的全面开源是小米从消费电子向具身智能延伸的最新一步——且这一步踩着开源生态的肩膀:模型使用 Qwen3-VL 作为视觉语言基座,借助 UMI 手持夹具方案采集数据,最终以 Apache 2.0 回馈社区。
绕过机器人贵、数据少的死结
Xiaomi-Robotics-1 最核心的思路,是用一种低成本的方法解决机器人 AI 长期面临的数据瓶颈。
传统机器人数据采集需要让真实机器人一遍遍执行操作,速度慢、成本高,且场景单一。小米的做法是:让工作人员手持装有摄像头的 ,在厨房、办公室、商店、工厂车间甚至户外空间直接操作——全程不需要一台机器人在场。
这 10 万小时的轨迹数据如果全靠人工标注,成本不可想象。团队搭建了一套由强视觉语言模型驱动的自动标注管线,先将长视频切成固定长度片段,再由 VLM 描述每个片段中的场景状态变化。据团队披露,全量标注仅耗时约两周。
模型架构采用了 Mixture-of-Transformers(MoT)设计:预训练的 Qwen3-VL 与 Diffusion-Transformer(DiT)耦合,DiT 与 VLM 层数相同但隐藏维度更小,以兼顾推理速度,可在消费级 GPU 上运行。
在基准评测上,Xiaomi-Robotics-1 在四项主流仿真基准上均达到当时最优:RoboCasa 74.5%(前最优 72.6%)、RoboCasa365 57.4%(前最优 46.6%,提升 23.2%)、VLABench 59.1%(前最优 53.2%)、RoboDojo 13.93(前最优 8.80,提升 58.3%)。
在新任务适应能力上,模型在每任务平均不足 10 小时演示数据的条件下达到 75% 的总成功率,几乎是对比基线 π0.5(40%)的两倍;将数据预算提高到平均不足 40 小时后,总成功率升至 85%。
更关键的是规模效应。预训练阶段,验证动作误差随着数据量和模型尺寸增长而持续下降;后训练阶段,更强的预训练模型带来了更高的真实机器人成功率,且"未见饱和迹象"。
机器人基础模型的"Llama 时刻"?
此前,机器人基础模型的数据方案呈现出几条截然不同的路线:Nvidia 与 CMU、UC Berkeley 的 ENPIRE 项目让 AI 编程智能体自主教机器人抓取;北京智源研究院的 Orca 世界模型从 12.5 万小时无标注视频中学习,试图完全绕过动作标签;Physical Intelligence 的 π 系列则代表了闭源路线。
小米选择了一条中间路径:用自动标注加 UMI 低成本采集解决数据规模问题,用 Apache 2.0 全栈开源解决可复现性问题。这与大语言模型领域 Llama 开源所引发的生态效应有相似的逻辑:降低准入门槛,让更多研究者和开发者能在同一基座上迭代。
AI 领域创业者 Erdal Bektas 在引用推文中概括了这种感受:"先是 Nvidia,然后是 Google,现在是小米……这会是机器人的 ChatGPT 时刻吗?"
答案或许还为时过早。但可以确定的是,当小米选择将 10 万小时真实数据炼成的机器人基座模型以最宽松的许可证交出全套代码——机器人 AI 的竞争规则正在被改写。
数据规模是新的护城河,而护城河正在被填平
小米用 UMI 绕过了机器人硬件的昂贵门槛,用自动标注绕过了人工标注的成本束缚。Xiaomi-Robotics-1 的规模效应曲线仍在上升,而全套代码已经躺在 GitHub 上——这意味着任何一支有想法的团队,现在都可以站在 10 万小时真实数据的肩膀上继续攀登。这道护城河,小米选择了不建。_