AREX Feed Article
蚂蚁 Ling 3.0 Flash 开源:124B 仅激活 5.1B,MIT 协议杀入帕累托前沿
8 月 4 日,蚂蚁集团旗下 inclusionAI 。这个模型有 124B 总参数,每次推理只激活 5.1B——占比约 4.11%。根据独立评测机构 ,Ling 3.0 Flash 在 Artificial Analysis Intelligence Index v4.1.1 上拿到 38 分,比前代 Ling 2.6 Flash 的 14 分高出 24 分,在所有总参数低于 124B 的开源权重模型中排名第一。
许可协议是 MIT。不需要申请,不需要报备,下载下来就能商用。
一台 DGX Spark 跑了 38.7 tok/s,社区自己把路走通了
Artificial Analysis 的分析指出,Ling 3.0 Flash 处于开源权重模型「智能水平—总参数量」的帕累托前沿——没有哪个总参数比它少的开源模型得分更高。在同等体量上,gpt-oss-120b(117B)只得 24 分,差了 14 分。再往上,MiniMax-M2.7 用了 230B 总参数才拿到 39 分。
但真正让社区兴奋的不是跑分,而是「能跑起来」。
8 月 5 日,蚂蚁百灵官方账号 放出了 INT4 和 MXFP4 量化版本,声称两个版本都能在单台 NVIDIA DGX Spark 上完成端到端推理。当天,华为昇腾,首次引入 CANN PyPTO 算子编程框架,并开放了一体化部署方案。
社区开发者 随后开源了一套完整的单卡部署方案。他最初发现官方量化版本在单台 DGX Spark 上无法直接运行——FP4 需要双卡,FP8 显存放不下,INT4 加载后卡在 GPU kernel 里。但他翻进官方的 vLLM fork、接上 KDA kernel 和 MTP draft layer 之后,INT4 版本跑到了 38.7 tok/s,超过了社区常用的 GGUF 方案的 35.2 tok/s,并且完整支持 256K 上下文窗口。
「我让 Hermes Agent 指向这台盒子上的 Ling 3.0 Flash,给了一句话的 prompt,它自己写完了一个完整的贪吃蛇游戏,验证了文件,然后打开就能玩,」他写道,「一个昨天还加载不起来的模型,今天成了这块硬件上最快的路径。」
一周三枪:中国开源模型的密度竞赛
Ling 3.0 Flash 发布的时间点刚好卡在一场密集的军备竞赛中间。
8 月 3 日,阿里 Qwen ,2.4T 总参数、95B 激活参数,在 Artificial Analysis Intelligence Index 上拿到 56 分。8 月 4 日同一天,DeepSeek V4 Flash 0731 「第二强的开源权重模型」,ECI 得分 153,仅次于 Kimi K3。而蚂蚁的 Ling 3.0 Flash 选择了完全不同的路线:不卷最高分,而是卷单位参数产出的智能。
早在 7 月底,蚂蚁百灵就在 中将 Ling 3.0 系列定位为「原生混合线性架构」的首发——从预训练阶段就以 5:1 的比例交替堆叠 KDA(Kimi Delta Attention)线性注意力层和 MLA(Multi-head Latent Attention)层。这和前代 Ling 2.6「先训练再迁移」的做法不同,注意力效率和模型能力从一开始就被一同优化。
Agent Brief 在 8 月 5 日的 中将 Ling 3.0 Flash 与 DeepSeek V4 Flash、Qwen 3.8 Max 并列,称之为「开源权重的权力转移」——前沿能力不再被两家加州公司垄断,而且可以在本地硬件上运行。
智能不是参数堆出来的
Ling 3.0 Flash 在 AA Intelligence Index 上得分 38,与 MiMo-V2.5(38)和 Qwen3.6 27B(38)持平,但激活参数只有 MiMo-V2.5 的三分之一。在 Flash 级开源推理模型中,它排在 DeepSeek V4 Flash 0731(52 分)之后。
Agent 能力是这次升级的重点。在 τ3-Bench Banking 上,Ling 3.0 Flash 拿到 27%,在 Flash 级开源权重模型中排第二,仅次于 DeepSeek V4 Flash 0731(39%),领先 Hy3(23%)和 Inkling Small(19%)。在 GDPval-AA v2 上,它的 Elo 评分达到 1108,而前代 Ling 2.6 Flash 只有 545。
但最值得玩味的数据来自 AA-Omniscience 指数。Ling 3.0 Flash 从 -66 分提升到 -18 分,看起来进步显著。然而拆开来看:底层准确率只从 16% 微升到 18%,幻觉率从 97% 降至 44%,尝试回答率则从 99% 暴跌到 56%。换句话说,它变「聪明」的主要方式是学会了闭嘴——回答更少的问题,但答错时更少胡说。
价格方面,Ling 3.0 Flash 通过 inclusionAI 自有 API 的价格是每百万输入 token 0.075 美元、每百万输出 token 0.22 美元,缓存命中打八折。在 Artificial Analysis 的评估中,它是得分不低于 38 的模型中单价最低的。但每项任务的总成本并不占优:跑完 Intelligence Index 它用了约 2.4 亿输出 token,总花费 73 美元,折算每项任务约 0.02 美元——这个数字落到了「智能—任务成本」帕累托前沿的内部,而非边缘。
模型架构上, 采用 Hybrid-linear MoE 设计:35 层 KDA + 7 层 Gated MLA,512 个路由专家中每次激活 8 个,另加 1 个共享专家和 2 个稠密层。相比前代 1/32 的专家激活比,。按照蚂蚁此前在 中的分析,更低的激活比在同等性能前提下可以换取更高的计算效率杠杆。
在部署层面,模型原生支持 256K 上下文并可扩展至 1M,集成了 SGLang HiCache + Mooncake 分层缓存架构,官方称长输入场景下首 token 延迟可降低 60% 到 80% 以上。在指定 GPU 配置下,平均输出速率可突破 1100 tokens/s。Artificial Analysis 在第三方 API 上观测到的速度则是 353 tokens/s。
MIT 协议 + 单机部署:开源的门槛正在消失
Ling 3.0 Flash 选择 MIT 协议,在当前的模型开源浪潮中是一个明确的信号。MIT 意味着开发者下载后可以直接商用、修改、再分发,不需要任何许可——在众多「开放权重但商用需申请」的模型中间,这是一个实质性的区别。
这一选择放大了量化版本的战略价值。FP8 版本权重约 128GB,INT4 约 62GB——后者可以在单台 DGX Spark 上跑起来,而不再需要昂贵多卡集群。对于「数据不能出域」的金融、医疗和政企客户,生产级的 Agent 模型可以被装进一台工作站里。
蚂蚁官方:云端 API 调用(适合快速验证)、单机私有化(适合数据敏感场景)、高性能部署(适合对延迟敏感的在线服务)。8 月 7 日至 31 日,Ling Studio 上的 Ling 3.0 Flash API 还打了 2.5 折。
昇腾的 0 Day 适配补齐了国产硬件生态。蚂蚁百灵 Ling 系列从一开始就在验证「非 A100/H100 异构计算平台」上的工程可行性,而这次发布证明了这个路线可以跟上速度。
下一个战场不是更大,而是更「醒着」
Ling 3.0 Flash 的真正意义不在于它是不是最强模型——它显然不是,DeepSeek V4 Flash 0731 领先了 14 分。它的意义在于证明了一件事:用 1/12 的激活参数追上前代旗舰,这条路不仅走得通,而且现在就可以下载、部署、商用。
当一个 124B 的模型每次推理只动用 5.1B 参数,而输出质量与 MiMo-V2.5 和 Qwen3.6 27B 同级时,衡量模型的尺度就不再是「总共有多少参数」,而是「每次推理实际点燃了多少计算」。在这个新尺度上,Ling 3.0 Flash 暂时没有对手。