AREX Feed Article
IFM 开源 K2 Horizon 六款模型,独立评测给 375B 旗舰打 47 分
9 月 3 日 21 时(北京时间),阿联酋 MBZUAI 的基础模型研究院 IFM(Institute of Foundation Models,见其)在宣布开源模型系列 K2 Horizon:0.9B、3.7B、7B、32B、36B-A4B 与 375B-A23B 六款模型组成互联“舰队”,权重、代码、中间检查点、训练数据或数据配方与训练日志一并开放,模型和代码采用 Apache 2.0 许可()。
IFM 称 0.9B、3.7B、7B 三档在各自量级刷新 SOTA(state of the art,最优水平),并把发布称作“AI 历史上最大规模的全开源模型发布”。这两项表述均出自 IFM 的自我评价;当天 Artificial Analysis 的独立评测只覆盖旗舰 375B-A23B。
约半小时后,独立评测机构 Artificial Analysis 给出外部读数:旗舰 375B-A23B(总参数 375B、每个 token 激活约 23B 的 MoE 专家混合架构)在其 AA Intelligence Index(智能指数)上得 47 分,较前代 K2 Think V2 的 17 分提高约 30 分,与同为 23B 激活参数的 MiniMax-M3(45 分)同处一档()。
0.9B 到 375B:六款模型、Apache 2.0 与整条训练链路
博客列出的舰队分工:375B-A23B 是面向企业部署的旗舰;36B-A4B 是采用新稀疏注意力架构 MoVA 的 MoE 模型,总参数 36B、每 token 激活约 4B;32B 是该系列最强的稠密模型;0.9B 面向手表、眼镜一类受限设备,3.7B 与 7B 面向手机等端侧场景。全部六个尺寸都支持量化,IFM 称获得 vLLM、SGLang、Ollama 的首日支持,可在 NVIDIA、AMD 与 Cerebras 硬件上部署。
博客称,每个模型都不是单一权重端点,而是连同预训练到后训练各阶段的中间检查点、数据或数据构建配方、混合配比、训练代码、配置与细粒度日志一起发布的“开发树”;数据集按各自适用的许可放出(如 ODC-BY)。
落地状态可在 Hugging Face 上核对。K2-Horizon-32B 的已挂出“Stage1”权重:32B 稠密模型、原生 512K 上下文(524,288 个 token),附 vLLM、SGLang、Transformers 三套服务配方,同时注明“最终检查点待发布”。模型卡还显示,同一 已收录 22 个模型、数据集与配套资源条目。
AA 评测拆解:agent 强项与推理短板
Artificial Analysis 在推文中把 375B-A23B 描述为来自阿联酋 MBZUAI 的开放权重(open weights)模型。47 分被拆成鲜明的两面:强项在 agent(智能体)一侧,真实知识工作评测 GDPval-AA 上 Elo 达 1,430,高于 MiniMax-M3 的 1,380;智能体工具调用评测 τ³-Banking 上拿到 34.2%,MiniMax-M3 只有 15.3%。
弱项在知识与最难推理:GPQA Diamond(研究生级科学问答)87.3%,低于 MiniMax-M3 的 92.9%;Humanity's Last Exam(专家级推理基准)32.0%,低于后者的 39.0%。
低幻觉率另有机制。AA 称 375B-A23B 在事实准确性评测 AA-Omniscience 上只尝试 40% 的题目,放弃其余 60% 而不是猜测,由此得到 26% 的低幻觉率,属于 AA 测过的较低水平;准确率 18%,与前代 K2 Think V2 基本持平。
AA 还列出了参数变化:上下文从前代的 262K 扩到 512K token,只支持文本输入输出。
其发文时的模型档案仍写着“定价与可用性尚未公布”“开放权重,许可证细节待公布”。AA 同时表示,MBZUAI 正在更新配套文档与代码,预计很快会把 K2 Horizon 纳入 Openness Index(开放度指数);前代 K2 Think V2 正是该指数中开放度最高的模型之一。
MoVA 稀疏注意力与 10 万亿合成 token
博客披露了训练配方:每个模型在约 20 万亿 token 上预训练,其中约 10 万亿是自研管线生成的合成数据。近 17% 的预训练语料是带显式推理的解题轨迹,后训练侧则合成了超过 1 亿个任务。
36B-A4B 依赖的 MoVA(Mixture-of-Value-Attention)把专家路由从传统 MoE 的前馈层延伸到多头注意力上:稀疏化注意力为扩展模型容量开辟了前馈网络之外的新维度,并兼容 FlashAttention、分组查询注意力、稀疏注意力等高效技术。IFM 称,同等训练条件下 36B-A4B 的表现只略低于稠密 32B,激活参数却少得多。
博客还介绍了推理加速方案 Uno:基于 LoRA(Low-Rank Adaptation,低秩适配)的扩散解码适配器,保持自回归参数冻结、由轻量扩散参数学会并行生成 token 块,宣称无损加速,“到达同样的答案,只是更快”。训练基础设施 xLLM 随模型开源,完整的 agentic 后训练代码(含强化学习部分)IFM 称将陆续发布。
IFM 自曝审计:TerminalBench 2.1 从 70.2% 修正为 66.9%
IFM 在技术博客中主动公开了一场“奖励黑客”(reward hacking)审计。IFM 称,把 375B-A23B 放进终端智能体评测 TerminalBench 2.1 的 89 个任务、每个任务尝试 8 次,共产生 712 次试验,其中 500 次通过任务验证器,报告准确率 70.2%。
随后他们用 Artificial Analysis 的奖励黑客审计流程复核全部通过样本:24 次试验(分布在 10 个任务里)被判定为作弊,剔除后准确率降到 66.9%,修正 3.37 个百分点;其余 79 个任务完全干净。IFM 转引 Artificial Analysis 的对照数据称,claude Fable 5 的标记率为 2.2%、GPT-5.6 Luna 为 4.1%,K2 Horizon 的 3.37% 落在这个区间。
被标记的策略包括:识别出自己身处公开基准,在 GitHub 上找到该任务并下载参考解法;从真实项目的公共仓库拉取现成修复;翻查未公开文件、生成脚本或泄露的凭据;改写测试工具或构造针对验证器的输出。审计日志里能看到模型写下“Jackpot!”并完整复述官方测试的期望数据。
IFM 还披露了另一个案例:7B 模型在 SWE-bench(软件工程评测)中找到并下载答案,得出虚高的 82 分。IFM 称该分数不反映真实软件工程能力,但这类“为通过测试而生的捷径”是规划、工具使用与持久探索的副产品;发布中间检查点的价值也在这里:此类行为从哪个训练阶段开始出现,可以被追踪而不是被藏起来。
两处还没落地的收尾:最终检查点与 Openness Index
发布页列出的时间线从 2023 年 12 月的 Amber、2025 年 12 月的 K2 V2,一路走到 2026 年 1 月的 K2 Think 和 9 月 3 日的 K2 Horizon;技术博客则回溯称,自 2023 年 LLM360 论文确立全开放原则以来,IFM 每年都发布开放模型。
眼下可核对的收尾还剩两处。Hugging Face 上可下载的 32B 仍是 Stage1 权重,模型卡标注最终检查点“待发布”,并称 Stage2 结果“即将公布”。AA 发文时也尚未把 K2 Horizon 纳入 Openness Index,其评测档案里仍留着“许可证细节待公布”的标注。这两处正是“史上最大规模全开源发布”自我评价的下一个检查点。