AREX Feed Article
OpenBMB 开源 MiniCPM5-2B:独立评测 15 分,项目方自称 23 分
开源 AI 组织 OpenBMB(Open Lab for Big Model Base)9 月 7 日官宣开源 2B 级稠密语言模型 MiniCPM5-2B()。OpenBMB 在推文中称,要把“高智能密度带到边缘设备”,模型在 Artificial Analysis 的 Intelligence Index(智能指数)上以 23 分位居 4B 参数以下开源模型第一,Agentic Index(智能体指数)20 分,34 项基准平均 53.9 分;随权重一并放出的还有 UltraData 系列训练数据、训练配方与 RL 技术栈。
独立评测机构 Artificial Analysis(AA)在官宣前约一小时发布按 Intelligence Index v4.2 口径实测的结果:15 分,是 4B 总参数以下开源权重模型中的最高分,比同区间第二名 Granite 4.2 3B(11 分)高 4 分()。同一个“4B 以下第一”的结论,项目方口径 23 分、独立实测 15 分,中间差 8 分。vLLM 与 SGLang 也在当天先后宣布对 MiniCPM5-2B 的 day-0 支持(;),随后有开发者在单张 RTX 3060 和单台 DGX Spark 上跑出首轮实测(;)。
图:MiniCPM5-2B 与 LFM2.5-2.6B、Qwen3.5-4B、granite-4.2-3B 的分领域能力对比(;平均分 53.9 为项目方自报口径)。
AA 实测的长板与短板
AA 的评测发布于 13:36 UTC(北京时间 21:36),OpenBMB 的官宣推文在 14:36 UTC(22:36)。AA 明确把 15 分标注为 Intelligence Index v4.2 口径下的结果;OpenBMB 的推文只说“在 Artificial Analysis Intelligence Index 上得 23 分”,没有注明版本。两份发布材料都没有解释这个差距的来源。
AA 给出的参照系:对比集中 Ling 3.0 Tiny 得 16 分,只高 1 分,但总参数约为 MiniCPM5-2B 的 3 倍;按 AA 估计,Qwen3.5 9B(Reasoning)同为 15 分,体量约是它的 4 倍。AA 还评价说,作为稠密模型,MiniCPM5-2B 的尺寸优势体现在显存占用而非激活参数算力,这一成绩“在智能得分对总参数量的曲线上立起了新的帕累托最优点”。
它最强的是智能体任务:工具调用基准 τ³-Banking 拿下 21%,与 Ling 3.0 Tiny 并列对比集第一,第三名 Granite 4.2 8B 只有 8%;在 AA 的 GDPval-AA v2 评估中 Elo 831,领跑 4B 以下模型;AA-Briefcase 以 Elo 438 排对比集第二。
短板集中在知识与编码:Humanity's Last Exam(HLE,人类最后的考试)9%、在对比集中列第 7,编码智能体基准 Terminal-Bench v2.1 也是 9%、列第 8,CritPt 得 0%。
AA 特别点出一处失真:AA-Omniscience 的 -12 分来自大量弃答,模型只尝试了 29% 的问题,换来 78% 的不幻觉率,而准确率只有 8%。
它也有 token 效率优势:每个 Intelligence Index 任务平均输出 19,000 token,与 Granite 4.2 3B 并列对比集最低;Ling 3.0 Tiny 花 56,000 token,只多拿 1 分。
名叫 2B,总参数 25 亿
显示,MiniCPM5-2B 总参数 2,516,756,480(AA 记为 2.6B),42 层,标准 LlamaForCausalLM 架构,上下文长度 131,072 token,Apache-2.0 许可;AA 同时确认它是纯文本输入输出模型。
官方仓库的中文 README 把它定位为“面向端侧、本地部署和资源受限场景的 2B 稠密 Transformer”,并说明这是继 MiniCPM5-1B 之后 MiniCPM5 系列的第二款模型()。
同一份 README 还列出,MiniCPM 项目由面壁智能、清华大学自然语言处理实验室、人大高瓴人工智能学院等机构共同开发。
全套检查点与变体同步放出:Base、Midtrain(中期训练)、SFT 与最终版(RL + OPD 后训练)四档权重,外加 GGUF、MLX、GPTQ 量化版和用于投机解码加速的 DSpark 草稿模型。
官方强调,标准 LlamaForCausalLM 意味着主流推理引擎可直接加载,无需自定义内核、无需 fork 模型代码。
模型卡自带的 34 项对比表里,HLE 8.9、AA-LCR 59.0、Terminal-Bench v2.1 8.6 等分数标注 †,注明“来自 Artificial Analysis 官方发布”,其余为内部复现,与 AA 同日公布的数字口径一致。
权重之外:数据、配方与 RL 技术栈一起开源
模型卡列出的开源数据集包括:网络预训练语料 UltraX;L0~L3 分级管理的代码数据 UltraData-Code;含 50 万条 Agent 训练样本的 UltraData-SFT-Agent-2609;8 万条以上、覆盖数学、代码、通用知识与长程推理的 RL 样本 UltraData-RL-2609。官宣推文称,“这次发布不止是模型本身”。
模型卡对训练配方的说明是:训练流程分预训练、中期训练、后训练三个阶段。后训练先用 400B token 的“深度思考 SFT”建立深度思考与通用对话能力,再分方向训练 RL 专家。RL 阶段采用 JustRL II 论文描述的 critic-based 算法,项目方称显著提升训练稳定性。
最后一步 OPD(On-Policy Distillation)把 RL 产出的 16 个专家模型(其中 5 个是 Agent 专家)蒸馏回同一个发布模型:在每个回复位置计算学生与教师 logits 的全词表反向 KL 散度作为优势估计值,蒸馏数据直接复用各 RL 专家的训练 prompt,无需额外构造语料。
按项目方自测,RL + OPD 让推理与通用能力平均提升 10.96 分,Agent 能力提升 6.96 分。
图:MiniCPM5-2B 训练流程:预训练 → SFT → RL + OPD 蒸馏,最终得到发布模型()。
vLLM 与 SGLang 双双宣布 day-0
vLLM 官方于 13:38 UTC(北京时间 21:38)宣布,MiniCPM5-2B 已在 stable 版 vLLM 获得 day-0 原生支持:131K 原生上下文,同一个检查点即可切换 Think/No-Think(思考开与关),通过 vLLM 的 minicpm5 解析器支持工具调用。
vLLM 向 OpenBMB 致谢,称“感谢保持标准 LlamaForCausalLM,并在放出权重的同时开源训练数据”。
SGLang 官方在 14:46 UTC(官宣后约 10 分钟)宣布 day-0 服务支持,放出 RTX PRO 6000、RTX 5090、DGX Spark、Hopper 四类硬件的部署配方,并称在 RTX 5090 上开启 DSpark 投机解码后,batch=1 编码任务单用户解码超过 250 tok/s。这一速度数字出自 SGLang 官方自报。
SGLang 同时引用 AA 的结论,称 MiniCPM5-2B 是“4B 以下开源模型中 Intelligence Index 第一”,并把这次发布称为“向通用模型在端侧 7×24 运行、甚至跑在手机上迈出的又一步”。配合 SGLang 使用的 DSpark 草稿模型 MiniCPM5-2B-DSpark 也随权重放出,官方说明投机解码不改变目标模型输出。
RTX 3060 上的 163 tok/s 与 DGX Spark 上的 32 个子代理
发布当天社区就有人跑起模型,以下数字均为作者自报、单机单次运行。Sensity AI 工程师 Doğukan(@DogukanUrker,按其 X 简介)用一张 RTX 3060 跑 llama.cpp 的 llama-server,全量 offload 到显存。
他的结果是:Q4_K_M 量化解码约 163 tok/s(占用 7.2GB 显存),Q8_0 约 113 tok/s(8.2GB),两种量化 prefill 都约为 5,800 tok/s,131K 上下文可完整加载。他测算权重只有 1.6GB(Q4_K_M)与 2.7GB(Q8_0),其余显存几乎都给了 KV 缓存;缩短上下文后,8GB 显存卡也能装下。
他下一步打算对比两种量化在输出质量上的代价。
个人开发者 Joey(@aijoey,简介自称阿里巴巴与 OpenBMB 的开发者大使,家里有两台 DGX Spark)则在单台 DGX Spark 上让 MiniCPM5-2B 同时驱动 32 个并发子代理并兼任协调者,开启 DSpark 投机解码:全程平均 931 tok/s,单秒峰值 1,364 tok/s,32 条回复流同时推进,30fps 实拍、未加速。
他设想的下一个测试,是让更强的模型担任协调者,拆解任务、分发子任务、检查返回的结果。他在演示说明里写道:“这次跑的是吞吐量,下一个测试才能告诉我结果有多有用。”