AREX Feed Article
小米 MiMo 实时直播 MiMo-V2.6 强化学习训练:单步超 20 亿 tokens,承诺逐项开源细节
在 X 个人简介中写明「现在在做 @XiaomiMiMo,此前在 @deepseek_ai」的 Fuli Luo(X 账号 ,)在沉寂近半年后,于 2026 年 9 月 16 日 18:52(UTC,北京时间 17 日凌晨)发帖宣布:MiMo-V2.6 此刻正处于强化学习(RL)训练运行之中,训练过程正实时直播在 。截至 9 月 20 日发稿,这条帖子已获得 300.4 万次浏览、9,717 次点赞和 4,693 次收藏。
帖子里最具体的数字:这次 run 的单步训练消耗约 20 亿 tokens,由 1,568 条 prompt × 每条 16 个 rollout(采样序列)构成,完全异步。Luo 称团队此次在三个方向做了扩展——算力、环境与 harness(任务执行框架)、以及 grader(判分器)算力——并承诺在未来数周内逐项开源训练细节。「我们相信,RL 是通向自我改进最可扩展、最高效的路径之一。」他在帖中写道,希望这场直播能让研究社区关注扩展 RL 的核心挑战、帮助团队完善训练配方。
沉寂半年后的一条帖子:训练没结束,过程先公开
帖子以一句话开头:「近半年的沉默。我们用它研究了一个问题:RL 到底能扩展到多远。」随后才是核心信息——MiMo-V2.6 正处于 RL run 的中途,三个被扩展的方向分别是算力、环境与 harness(多任务 agentic RL,单次 run 中混合多个 harness)、grader 算力(组内 agentic credit assignment,奖励来自 test-case 与 rubric)。Luo 还写道,团队已经很高兴地看到大量基于详细训练指标的分析。以上均为发帖方单方口径。
直播页面本身可以独立核验。本文抓取了页面源码,其描述栏写明这是「mimo-v2.6-pro 与 mimo-v2.6-flash 两次强化学习 run 的训练指标,直接读自 trainer 的日志」。页面挂在 mimo.xiaomi.com 域名下,其公开配置()中的社交链接指向 。不过截至 9 月 20 日检索,@XiaomiMiMo 官方账号的时间线里,最近一条帖子仍是 9 月 8 日的 MiMo Desktop 邀请制内测公告,没有提及 MiMo-V2.6——这次官宣目前只见于 Luo 的个人账号和这个网页上。
算力、harness、grader:帖子点名的三个扩展方向
第一个方向是算力。宣布的说法是每步约 2B tokens,拆开看是 1,568 条 prompt、每条采样 16 个 rollout,且采样与训练完全异步。直播面板与这组数字吻合:两条 run 的「train batch size × n」一栏都显示 1,568 × 16 seqs,面板固定展示的指标里还包括 partial/avg_staleness(采样结果与训练之间的平均陈旧度)——异步训练需要盯住的正是这个量。
第二个方向是环境与 harness。帖子称之为 multi-task agentic RL(多任务智能体式强化学习):单次 run 中混合多个 harness。面板把每步训练数据按 code、general、cyber、visual、chat 五类数据源展示,另有单独的 harness 维度按 rollouts 数统计——「混合多个 harness」在页面上是一个可见的组成部分,而不只是一句表述。
第三个方向是 grader 算力,即用更多的判分计算做组内 agentic credit assignment(功劳分配),奖励信号来自 test-case(测试用例)与 rubric(评分量规)。grader 在这次 run 里不是抽象概念:9 月 17 日 12:20(UTC)的面板公告写道,pro 训练集群与 grader 部署之间出现网络连接问题,团队为此重启了 run——说明 grader 是与训练集群分开部署的独立环节。
面板上的实时账本:两条 run、294.7 万美元成本
页面同时跟踪两条 run。面板记录显示,两条 run 都在 9 月 15 日启动——pro 于 10:32(UTC)、flash 于 15:16(UTC)——比宣布帖分别早了约 32 小时和 27 小时。也就是说,发帖时训练已经跑了一天多,直播和宣布是「边跑边说」。
本文在北京时间 9 月 20 日 00:20(UTC 19 日 16:20)抓取了面板公开接口(、)并截图。pro 仍标注 in progress(进行中):已完成 25 步、正在跑第 26 步,累计消耗 590 亿 tokens、训练 62.7 万条样本,成本 209.2 万美元(面板费率折合约每小时 2.06 万美元);其 dynsam/avg@n(每条 prompt 多次采样的平均通过率)为 0.626,较第 1 步上升 0.062。flash 则标注 stopped(已停止),面板显示它于 9 月 19 日停止(接口记录的结束时间为当日 02:22 UTC),30 步共历时 3 天 11 小时 5 分,累计消耗 814 亿 tokens、训练 75.3 万条样本,成本 85.4 万美元,avg@n 为 0.644(+0.130)。两项合计,页面顶部的 TOTAL COST(总成本)为 294.7 万美元。
单步规模还在变大。面板事件序列显示,pro 的单步 tokens 从第 4 步的约 20.1 亿增至第 25 步的 30.9 亿,flash 从第 8 步的约 23.5 亿增至第 30 步的 37 亿——两条 run 现在的单步消耗都已高于宣布时的「约 2B」口径。面板 benchmarks 区还挂着三条离线评测曲线:DeepSWE v1.1(mini-swe-agent,avg@3)pro 70.92 分、flash 65.68 分;In-house Coding Bench(avg@3)pro 64.44 分、flash 62.87 分;AutomationBench v1.0.6(avg@3)pro 51.00 分、flash 52.70 分。9 月 16 日的公告称,flash 第 12 步与 pro 第 8 步的 DeepSWE 结果已经更新,「离线评测结果出来后会持续发布」。
六条公告里的中途抢修:OOM、断网与被移除的 cyber 数据集
直播不只是放曲线。截至抓取时,面板公告栏共有六条帖子(),接口数据同时记录了两条 run 的重启次数:pro 12 次,flash 5 次。
几条关键公告还原了这四天的抢修过程。9 月 16 日 20:08(UTC),pro 因一个节点的 VRAM(显存)问题重启;9 月 17 日 02:27,flash 从第 15 步重启,原因是「某数据集上的一类基础设施错误在过去约 3 小时内未被正确检测到」;9 月 17 日 12:20,pro 训练集群与 grader 部署之间断网,run 重启,团队同时决定把 cyber 数据集从接下来的 pro run 中移除——「我们在 rollout 日志里观察到了一些 bad patterns」;9 月 18 日 03:49,pro 在第 17 步重启,原因是 expert load imbalance(专家负载不均)导致的 GPU 显存溢出,「我们已调整训练并行策略」。最新一条公告发布于 9 月 19 日 10:14(UTC):「我们过滤掉了对当前 pro 模型而言相对简单的任务。」六条公告中没有解释 flash 为何停止。
研究者的读数:从参数规模到 sandbox 数量
面板上线后,研究者很快开始读数。Prime Intellect 研究员 Elie()的转述帖获得 2,068 次点赞、18.8 万次浏览,他写出自己读到的规格:直播中的 Pro 为 1T 参数、42B 激活,Flash 为 309B 参数、15B 激活,且页面带有每批数据/harness 组成和大量内部训练指标——参数规模出自他的解读,面板本身未标注。
UC Berkeley 的 EECS 博士生 把它称作「可能是首个公开可见的 W&B trace(Weights & Biases 训练追踪曲线),而且是实时的,来自一次『某种准前沿规模』的 RL run」。他读出的细节包括:每步约 1,500 条 prompt 中 code 占约 1,050 条,其余分给 general、visual、cyber 和 chat;平均交互轮数从约 50 轮往上走,上下文长度从约 8 万 tokens 涨向 10 万以上,而这只是训练初期;活跃 sandbox(沙盒)超过 4 万个。他也提出保留意见——1,568 × 16 的规模「大,但可能不如我预期的大(也许是算力受限?)」。他的结论是:这并非完全开源,但把一次准前沿规模的 RL 训练轨迹公开到这个可见度,已是「朝大规模 agentic RL 基础设施与训练实践民主化迈出的相当有意义的一步」。
另一种反应来自训练一线。(个人简介自述 ex-Google、ex-xAI)写道,这「非常像我在 xAI 和 Gemini 的经历」——这就像驾驶一次 RL run,没有任何 run 是 launch-and-forget 的,真正的问题是「run 进行期间,你能发现并修掉多少基础设施与配方问题」;硬故障最容易发现,如果你觉得没问题,那只是指标不够多、抽查的轨迹不够密。
尚未给出的三样东西:harness 名字、开源清单、权重安排
run 中混合使用的多个 harness 叫什么名字,Wang 指出「并未披露」;训练细节如何逐项开源,Luo 只给了「未来数周」这个范围,没有清单,也没有时间表;MiMo-V2.6 权重本身的发布,这篇帖子只字未提。
页面页脚配置写着「开源是我们看重的价值」(Open is what we value.)。下一份细节是什么、以什么形式出现,宣布里没有给出答案。