AREX Feed Article
小米 MiMo 开源 MiMo-V2.6 Pro 与 Flash 全模态模型,官方称多数 agent 基准比肩 Claude Opus 5 与 GPT-5.6 Sol
北京时间 2026 年 9 月 22 日凌晨 4 时 51 分(UTC 时间 9 月 21 日 20:51),小米 MiMo 官方 X 账号 @XiaomiMiMo 宣布发布并开源 MiMo-V2.6 系列的两款全模态(omnimodal)模型:旗舰 MiMo-V2.6 Pro 与效率档 MiMo-V2.6 Flash,官方称两者经由规模化强化学习(scaled reinforcement learning)构建,Pro 在大多数 agent 基准上与 Claude Opus 5、GPT-5.6 Sol 相当,并以 46 分成为 Artificial Analysis 智能指数上得分最高的开源模型。该帖发布约十小时获得 6,455 个赞和约 66.8 万次浏览。46 分这项成绩已经在 得到确认;「比肩 Claude Opus 5 与 GPT-5.6 Sol」目前仍是厂商自报口径。
开源内容不止权重,还包括技术报告、RL 环境与训练代码。效率档检查点 MiMo-V2.6-Flash-RL 的 披露:稀疏 MoE(混合专家)架构,总参数 309B、每 token 激活 15B,原生支持文本、图像、视频、音频输入,上下文长度 100 万 token。发布数小时内,分发渠道 已上架该系列。
权重、技术报告、RL 环境与训练代码一并放出
列出的开源清单共四件。权重托管在 Hugging Face 与 ModelScope,检查点名为 MiMo-V2.6-Pro-RL 与 MiMo-V2.6-Flash-RL——开放下载的正是强化学习训练后的成品;技术报告以 PDF 形式挂在 里。还写道,这场 RL 生产训练全程直播;推文标语也写着「公开构建」(built in public)。推文同时点名增强的方向:编码、computer use(计算机操作)、3D 推理与创意能力。
Flash 主干 48 层、256 个专家,Pro 总参 1.02T、激活 42B
按 的规格表:稀疏 MoE,总参数 309B、激活 15B(B 即十亿);主干 48 层,其中 39 层滑动窗口注意力(SWA)、9 层全局注意力(GA),路由专家 256 个、每 token 激活 8 个;原生接受文本、图像、视频、音频四种模态,上下文 100 万 token。视觉编码器是 681M 参数的 MiMo ViT(28 层,24 层 SWA 加 4 层全局注意力),音频侧由 308M 参数的 AudioTokenizer 加 127M 参数的音频 patch 编码器组成;另配 5 层 MTP(多 token 预测)投机解码器(DFlash 风格),每次前向预测 7 个 token 用于并行验证。
给出旗舰规格:总参数 1.02T(约 1.02 万亿)、激活 42B,70 层主干(60 层 SWA、10 层 GA),384 个路由专家同样激活 8 个;视觉与音频编码器和 Flash 相同,上下文同为 100 万 token。Artificial Analysis 的模型页把 Pro-RL 权重标注为 MIT 许可的开放权重模型。官方博客的演示里,这款模型能从一张图、一段视频或一句话生成可交互的 3D 场景、在 Blender 中产出 3D 资产、在具身仿真环境中以视觉反馈闭环控制 Franka Panda 机械臂,并用 MiMo-V2.5-TTS 给生成的视频配旁白。
一次跑完四个领域的混合 RL:You Only RL Once
模型卡把训练方案概括为「You Only RL Once」:编码、通用 agent、视觉、网络安全四类任务不分开训练,而是混进同一场强化学习,任务与多个评测框架(harness)放在同一批次里,官方称这样各能力互相促进,策略还能迁移到训练中没见过的框架。对齐训练从「自我纠错」冷启动——模型反思并改写自己跑偏的回答轮次。
官方披露的规模化数字是:每步更新 1,568 条样本、每条样本 16 个 rollout 的完全异步 GRPO(组相对策略优化),单步训练 35 亿~37 亿 token,训练上下文最高 100 万。奖励信号本身也被加码:模型卡解释,二元的通过/失败无法给「都通过了」的解排出高下,于是由一个 agent 评分器在组内比较 rollout——离线用对比 rollout 构建任务专属评分细则并与测试结果融合(Groupwise Reward Synthesis),在线给通过的轨迹重新排序、把优势向更高质量的解倾斜(Groupwise Advantage Redistribution)。模型卡把这个机制标注为「自我改进循环」,称它引导模型走更短的路径、每个任务消耗更少 token。防作弊方面,博客提到训练中途冻结路由器以抑制漂移,并用奖励设计、对抗评估、异常检测和验证器交叉核验来防 reward hacking(模型钻奖励机制的空子)。
混合 RL 结束后还有一步 MOPD2(多前缀多教师 on-policy 蒸馏):把学生自主 rollout 与前缀条件下的单轮 rollout 结合,复用教师轨迹和 SFT(监督微调)示例的历史,让决策点无需重新生成前文就能训练,官方称借此把能力扩展到难以验证的任务上。
这场训练的账本也写在博客里:Flash 与 Pro 各自在不到六天内跑完 30 步 RL、约 75 万条轨迹,花费约 85 万美元和约 262 万美元;训练任务的平均通过率相对提升 25% 和 12%;训练过程中 DeepSWE v1.1 得分分别从 48.8 涨到 65.68、从 58.4 涨到 72.57(模型卡最终评测表给出的数字是 Flash 67.9、Pro 71.9)。
官方评测表:与 Claude Opus 5、GPT-5.6 Sol 互有胜负
智能指数这一项可以独立核实:Artificial Analysis 的 MiMo-V2.6-Pro 页面显示其得分为 46(官方博客给出更精确的 46.32,并注明是 2026 年 9 月的 v4.3 版指数,由 AA-Briefcase、GDPval-AA v2、Terminal-Bench 4.0 等 10 项评测构成),该页还记录了评测开销——共生成 1.4 亿输出 token、花费 206.66 美元。至于「开源模型中最高」,出自小米官方口径:博客称此分超过了 Kimi K3 和 Qwen3.8 Max。同一张官方榜单图上,Claude Fable 5.1(max,带 fallback)与 GPT-6 Astra 均为 53 分,Claude Opus 5 为 51 分,GPT-5.6 Sol 为 47 分。
agent 基准的成绩全部来自小米自己的评测表,两张模型卡的对比列还包括 Claude Fable 5。挑几行看:
| 基准 | MiMo-V2.6 Pro | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|---|
| AutomationBench v1.0.6 | 53.1 | 50.3 | 45.8 |
| Terminal Bench 2.1 | 89.9 | 89.1 | 88.8 |
| Agents' Last Exam | 31.6 | 31.6 | 30.8 |
| GDPval-AA 2.1(Elo) | 1,673 | 1,708 | 1,588 |
| Terminal Bench 4.0 | 34.9 | 49.0 | 39.9 |
| ProgramBench | 26.5 | 37.0 | 25.0 |
| ExploitBench | 47.9 | 70.0 | 78.5 |
| OSWorld-Verified | 82.0 | 83.4 | 83.0 |
Pro 在 AutomationBench、Terminal Bench 2.1、JobBench(62.0,对 Opus 5 的 65.7 和 GPT-5.6 Sol 的 45.4)等行领先或打平;在长时程终端任务 Terminal Bench 4.0、程序合成 ProgramBench 和漏洞利用 ExploitBench 上明显落后,SEC Bench Pro 的 66.3 对 GPT-5.6 Sol 的 79.1 也差出一截。官方博客注明 GDPval-AA 2.1 是 Artificial Analysis 报告的 Elo 分数。「大多数 agent 基准相当」成立与否,取决于把哪些行计入「大多数」。
效率档 Flash 的成绩普遍贴着 Pro,CyberGym 上 Flash 的 95.1 反而高于 Pro 的 94.0。对照前代,跃升幅度最大的是网络安全:MiMo-V2.5 Pro 在 MiMo Cyber Bench 上是 0.0,Flash 拿到 77.2。
定价沿用 V2.5,OpenRouter 已同步上架
称 MiMo-V2.6 系列沿用 V2.5 的 API 定价:
| 模型 | 输入(缓存命中) | 输入(缓存未命中) | 输出 |
|---|---|---|---|
| MiMo-V2.6-Flash | $0.0028 | $0.14 | $0.28 |
| MiMo-V2.6-Pro | $0.0036 | $0.435 | $0.87 |
| MiMo-V2.6-Pro-UltraSpeed | $0.036 | $4.35 | $8.7 |
单位为美元/百万 token,限时免写缓存费,另有 Token Plan 打包方案。UltraSpeed 是 Pro 的超快档:博客称输出速度最高 20 倍,OpenRouter 的模型描述则写「约 10 倍」,并注明它由同一个 1T 的 Pro 检查点构建、质量与原版一致。
分发已经落地:OpenRouter 的小米组织页列出 8 款模型,其中包括 MiMo-V2.6-Pro、MiMo-V2.6-Flash 与 MiMo-V2.6-Pro-UltraSpeed;官方渠道还有 AI Studio、MiMo Code 和 MiMo API 平台,MiMo Desktop 结束早期访问、发布首个正式版并内置这两款模型。模型卡给出 SGLang 与 vLLM 的部署配方。Artificial Analysis 基于小米 API 的实测数字是:输出速度 124.5 token/秒,首 token 延迟 2.34 秒。
一代之间的 26 分跳变,与仍待第三方的评测表
对照官方博客引用的同一张智能指数榜单,小米上一代旗舰 MiMo-V2.5-Pro 是 26 分,一代之隔涨到 46 分。Arena 在发布数小时内跟进,其发帖称 MiMo-V2.6-Pro 首次进入 WebDev 榜单即约列总榜第 10 位、开源模型第 3 位,AutoEval 得分 1,628,与 Claude Fable 5(High)持平。
其余 agent 基准数字目前只有小米自报这一个来源。复核的路径按官方说法已经铺开:技术报告、训练环境和 RL 代码全部开源,博客的原话是让研究者「可以复现并验证这些结果」。官方演示里已经有一个机器可核验的例子——Pro 在未接受 Lean 定向后训练的条件下,完成李-约克定理(Period Three Implies Chaos)主定理的 Lean 4 形式化,超过 6,000 行代码全部通过 Lean 内核验证、无未完成占位。下一个可核验的节点,是第三方用放出的权重、环境和代码,把这些成绩复现到什么程度。