AREX Feed Article
小米 MiMo 负责人罗福利公开 MiMo-V3 核心架构 HySparse2:两级 KV 共享,1M token 下 prefill FLOPs 较 Hybrid SWA 降至约 1/5
北京时间 2026 年 9 月 23 日 22 时 25 分,在 :下一代 MiMo-V3 将采用新架构,其核心 HySparse2 当天以论文形式公开,这是一套采用两级 KV 共享的混合稀疏注意力架构。论文题为《HySparse2: Hybrid Sparse Attention with Two-Level KV Sharing》,,提交记录显示 9 月 22 日挂网。推文给出的对比对象是 MiMo-V2.6 在用的 Hybrid SWA 架构:1M token 时预填充计算量(prefill FLOPs)降至 1/5.02,键值缓存(KV cache)缩小 4.5 倍,MRCR-v2 与 RULER-v2 检索得分更高,AgentPPL 与 LongPPL 两个困惑度指标更低。
这套架构的动机写进了论文摘要:长程、多轮的 agent 通常生成很短的动作,却要处理工具和环境返回的长观测,上下文越滚越大,高效 prefill、紧凑 KV cache、精确长上下文检索必须同时满足。罗福利在推文里的说法更直接:「我们一次性拿到了三个」。这些成绩均出自作者团队的自报对照实验。
论文先于产品:MiMo-V3 的架构核心提前亮相
显示,这份工作由 15 位作者署名,单位为 LLM-Core Xiaomi:Jianyu Wei 与 Yizhao Gao 为共同一作,Shijie Cao 与 Fuli Luo 为通讯作者,Fuli Luo 同时被标注为 Team Lead(团队负责人)。罗福利的 X 简介自述「正在带队 @XiaomiMiMo,此前在 @deepseek_ai」。截至北京时间 9 月 24 日早间,这条推文获 3,402 个赞、296 次转发、871 次收藏,浏览约 20.7 万次。
边界同样清楚:论文公开的是架构,不是产品。推文只说 MiMo-V3「将采用新架构」、HySparse2 是其核心,产品本体的细节并未随论文一并给出。
短动作、长观测:prefill、KV cache 与检索同时成为瓶颈
论文引言把问题拆得很具体:agent 推理是长上下文与多轮交互的叠加,每一轮里,一条很短的动作或工具调用可能换回长得多的搜索结果、执行轨迹或文档,恢复解码前必须先把这些内容 prefill 进模型;观测不断累积,agent 还要在持续变长的历史里检索、组合证据,注意力计算量和 KV cache 存储随之一起涨。用罗福利推文里的话说,prefill 成本、KV cache 体积、检索精度同时落在了关键路径上。
小米团队的前作 HySparse(论文引用为 Gao et al., 2026)已经做过一轮优化:让全注意力层与稀疏注意力层交错排列,每个全注意力层把自己的全局 KV cache 和 top-k block 索引交给后续稀疏层复用,省下计算与存储,也不需要单独训练一个索引器模块。但论文指出,HySparse 的 prefill 仍要跑完全部层,对 agentic 推理来说,缩短 prefill、再压 KV cache、提高检索精度都还有空间。HySparse2 的做法是把 YOCO(Sun et al., 2024)的结构引入 HySparse:YOCO 用 self-decoder(自解码器)构建一份全局 KV cache 供 cross-decoder(交叉解码器)各层共享,prefill 的 cache 构建跑完 self-decoder 即可退出。
外层 KV Bridging,内层 KV Reuse:两级共享各管一件事
HySparse2 沿 YOCO 把主干分成两段:self-decoder 混用全注意力与滑窗注意力 SWA(sliding-window attention),负责局部建模;cross-decoder 混用全注意力与稀疏注意力,负责全局检索。两级共享分别发生在两段之间和每个 hybrid block 内部。
外层是 KV Bridging,而且只桥接全注意力层:cross-decoder 每个全注意力层的 KV cache,由对应 self-decoder 全注意力层的输入隐状态经该层自己的 K/V 投影生成。隐状态来源共享,投影各自独立,各层得到的 KV cache 并不相同;Q 投影仍作用于各层当前的隐状态。这个设计还允许两个 decoder 采用不同的混合比例,一个 self-decoder 全注意力层可以同时给多个 cross-decoder 全注意力层供 KV。内层则是沿用 HySparse 的 KV Reuse:每个 hybrid block 内,稀疏层复用前面全注意力层的 KV cache 和选择索引。
相对前作有两处改动。其一,稀疏选择从 block 级换成 token 级:HySparse2 在每个全注意力层强制选入最近 128 个 token,再从窗口外按分数选 1,024 个全局 token;HySparse 则是在 64-token 的 block 里选 1,024 个全局 token,另配一条独立的 128-token SWA 分支做门控融合。其二,稀疏层砍掉了这条单独的 SWA 分支,把最近 token 窗口强制纳入稀疏选择,局部与全局 token 因此共用同一份 KV cache。
两处改动的连锁后果是:所有 cross-decoder 的 KV cache 都能从 self-decoder 隐状态构造出来,prefill 跑完 self-decoder 即可退出,跳过全部 cross-decoder 层。以论文中的 49 层模型为例,prefill 节点只需部署前 25 层,显存需求近乎减半;在 prefill–decode 分离部署下,prefill 节点只承载 self-decoder 和 KV Bridging 投影,cross-decoder 全注意力 KV 在 prefill 节点算好后传给 decode 节点——投影后的 KV 比源隐状态更小,需要跨节点传输的数据量也更小。全注意力层之所以只保留少数几个,论文的解释是它们兼任索引器,用精确注意力分数为后续稀疏层提供 token 选择,原生端到端训练即可,不需要单独的索引器或辅助蒸馏目标;也正因为全注意力计算昂贵,其占比被刻意压小。
三套 80B-A3B 对照模型里算出的数字
论文的对比在三个 80B-A3B 的 MoE(mixture-of-experts,混合专家)模型上进行:均为 49 层 Transformer、隐藏维度(hidden size)2,048,差别只在注意力设计。三个模型先以相同数据混合、相同日程预训练约 500B token(上下文 32k),再做约 100B token 的轻量后训练:训练混合中加入 agentic 数据,上下文扩到 256k。架构细节上,Hybrid SWA 保留 9 个全注意力层,论文称再少精度会明显下滑;HySparse 与 HySparse2 只用 5 个,仍与全注意力基线大体相当。KV 头数上,Hybrid SWA 与 HySparse 用 GQA(grouped-query attention,分组查询注意力,64 个 Q 头对 4 个 KV 头),HySparse2 用 MQA(multi-query attention,多查询注意力,64 个 Q 头共用 1 组 KV),换来更小的 KV cache 和更好的 token 级稀疏 kernel 效率。
预训练成绩呈现混合画面:通用能力大体持平,HySparse2 在 BBH(64.29)和 MMLU-Pro(37.56)领先,DROP(58.99)则落后于 HySparse 的 63.78;长上下文是明显强项,RULER 90.77、NoLiMa 49.76 均为三者最高,NoLiMa 比 HySparse 高 9.49 分。轻量后训练之后差距拉开:MRCR-v2 均分比 HySparse 高 11.30 个百分点、比 Hybrid SWA 高 6.44 个百分点,RULER-v2 均分分别高 19.81 和 18.65 个百分点;在 256k 处,HySparse2 的 RULER-v2 为 58.45,HySparse 为 32.61、Hybrid SWA 为 35.74。AgentPPL 与 LongPPL 在全部评估长度(至 256k)都低于两个基线。
成本端的数字对应推文里的两个倍数:在 1M token、FP8(8 位浮点)KV 存储口径下,HySparse2 的 prefill FLOPs 较 HySparse 降 2.92 倍、较 Hybrid SWA 降 5.02 倍;KV cache 占用 2.69 GB,对比 HySparse 的 6.72 GB 和 Hybrid SWA 的 12.09 GB——12.09 除以 2.69,即推文所说的 4.5 倍。
掉的分、290B 规模检验与未决问题
去掉单独 SWA 分支后,强制窗口版本与门控 SWA 相比,GSM8K 低 5.08 分、MRCR-v2 低 4.99 分、LongPPL 高 1.50%;论文称之为可接受的取舍——省掉额外投影参数和局部 KV cache,换来 prefill 完全早退。KV Bridging 也做了规模检验:团队另训 290B-A8B 模型约 1.8T token 做有无对照,RULER 仅差 0.31 分,LongPPL 还从 3.6053 降到 3.4202,代价是 DROP 从 71.37 掉到 68.17,BBH、GSM8K 各掉约 1 分。连接方案上,团队比较过 U 形反向连接的 KV Mirror:预训练结束时 KV Bridging 的 RULER 为 87.65,高于 KV Mirror 的 81.28。
数字的口径也要划清:四个评测里只有 AgentPPL 是团队内部基准,在 1,000 条多轮 agent 轨迹上对推理、工具调用、响应三段分别测 byte 级困惑度;其余三项中,MRCR-v2 与 RULER-v2 衡量检索,LongPPL 衡量依赖长程上下文的 token 困惑度。截至发稿,公开渠道可见的证据仍只有论文与推文本身,没有第三方复现或独立评测。论文自己列下的后续工作,包括把预训练阶段用于助收敛的单层 MTP(multi-token prediction,多 token 预测)换成更大的 DFlash 式 drafter,并探索异步起草与验证。而 MiMo-V3 本体以什么规模、何时发布,论文和推文都没有给出。
参考链接
- _