AREX Feed Article
Ling-3.0-flash 开源:只激活 5.1B,124B 模型把自家 1T 旗舰拉下马
12 天,从 API 预览到权重全部交出
8 月 4 日,旗下的 inclusionAI 在 同步开源了 Ling-3.0-flash 的完整权重,MIT 协议。该模型总参数量 124B,每 token 仅激活 5.1B 参数。称其以不到 1/8 的总参数量和 1/12 的激活参数量,在多数 benchmark 上追平或超越自家上一代 1T 级旗舰 Ring-2.6-1T。
次日,团队释出 ,单张 NVIDIA DGX Spark 即可端到端运行。同时提供了 SGLang 与 vLLM 的开箱推理方案。
"HF 链接呢?"——社区催更两周,等来 MIT 开源
Ling-3.0-flash 并非突然空降。7 月 23 日,时,评论区最高频的回复只有一句:"Where weights????"
HuggingFace 产品负责人 :"seems a great fit for local 😊"。推理平台 ,称"Day 0 只是第一步"。从 到 、OpenRouter、Dify 等平台,均在首发当日提供支持。
团队在回复中反复承诺"open weights coming soon"。:"BEATS Ring 2.6???我不信",:"Ring 2.6 本质上是数学 PhD,不是为日常任务设计的"。12 天后,权重兑现。
先上 API 免费跑 12 天,再一口气交出所有权重
这场发布遵循了一套清晰的分层节奏。
7 月 23 日,API 首发。模型上线 OpenRouter,。团队同步放出 7 段演示视频,覆盖 Blender 3D 建模、自主多 Agent 研究团队、Office 文档闭环处理、纯代码设计系统、浏览器内乐器合成、多平台营销文案改写,以及日历调度完整工作流。
8 月 3 日,至 8 月 6 日上午 8 点(PT)。
8 月 4 日,。BF16 和 FP8 版本同步上线。8 月 5 日,INT4 与 FP4 变体发布。同日,。
获得 207 万次浏览、1966 次点赞,是该账号迄今互动最高的单条内容。
不是所有 MoE 都一样:KDA 与 MLA 按 5:1 交替
Ling-3.0-flash 的架构选择与主流 MoE 路线有明确分野。
原生混合线性注意力:模型 Kimi Delta Attention(KDA)与 Gated Multi-Head Latent Attention(MLA)以 5:1 比例交替堆叠,共 35 层 KDA 加 7 层 MLA。KDA 引入细粒度对角门控,MLA 负责压缩 KV 缓存。
极端稀疏 MoE:512 个路由专家,每次仅激活 8 个,外加 1 个共享专家,稀疏比 1/64。推理时实际参与计算的参数量仅 5.1B。
长上下文缓存:模型原生集成 SGLang HiCache 与 Mooncake 分层缓存,物理双池架构配合集群共享 L3 缓存,消除长程交互中的重复计算。官方称长输入场景首 token 延迟(TTFT)降低 60% 至 80% 以上。上下文窗口 256K,训练阶段经历 8K→32K→256K 三阶段扩展。
Benchmark 方面,在 上,Ling-3.0-flash 以 OpenHands 为 agent harness 取得 56.6%,位列 57 个模型中的第 30 名。MathArena AIME 2026 得分 22.7。还列出了内部基准 AntSWEBench 的评估结果,覆盖 Java、JavaScript、Python 等语言及新功能开发、Bug 修复、代码重构等场景。模型默认开启思考模式,推荐采样参数为 temperature=0.6、top_p=0.95、top_k=20。
开源 Agent 模型牌桌上,多了一家中国选手
,这是蚂蚁模型首次出现在该榜单。
从 来看,Ling-3.0-flash(56.6%)与 Poolside 的 Laguna S 2.1(59.4%)、MiniMax M3(59%)同处一档,差距在 3 个百分点以内。榜单前列仍由 Claude Mythos 5(80.3%)等闭源模型占据。
模型已在 Claude Code、Kilo Code、Qwen Code、Hermes Agent、OpenClaw 等多个 agent 框架中得到验证。其基于超过 10,000 个交互式训练环境,覆盖 Coding、General 与 Deep Research Agent 三类任务。
量化变体的精度仍在迭代,社区追问 DeepSWE 分数
Ling-3.0-flash 以 BF16、FP8、INT4、FP4 全量化链发布,SGLang 和 vLLM 均已适配。
但仍有未了之事。,量化模型的效率与精度"仍在演进中"(still evolving),推理实现和量化权重将持续更新。而在 ,多位用户追问 DeepSWE 成绩。