AREX Feed Article
蚂蚁百灵 Ling-3.0-tiny 开源:7.9B 仅激活 1.3B,M4 Pro 跑出 90 tok/s
的动作比官方推文还快。8 月 10 日,vLLM 项目组在 X 上放话:"ready to serve Ling-3.0-tiny with vLLM, always day-0 support😎"。一天后,蚂蚁集团旗下 inclusionAI(蚂蚁百灵)才,同步。
Ling-3.0-tiny 是 Ling 3.0 系列的第二款开源模型。与 8 月 4 日发布的 124B 总参的 Ling-3.0-flash 不同,tiny 把参数总量压到了 7.9B,每 token 仅激活 1.3B——不到 Flash 激活量的四分之一。MIT 协议开源,BF16、FP8、INT4 三种权重一并提供。
vLLM 抢跑,三套推理框架同日就位
vLLM 在模型正式公布前就完成了适配。官方模型卡中给出了完整的 vLLM 启动命令,从克隆 inclusionAI/vllm-ling-v3 分支到 vllm serve 一条龙,tensor-parallel-size 设为 1 即可单卡运行。
同一天就位的还有 SGLang 和 Ollama。SGLang 提供了预构建 Docker 镜像 lmsysorg/sglang:dev-Ling-3.0-tiny,内置 MTP/NEXTN 推测解码和 256K YaRN 上下文支持。Ollama 则走 MLX 路线,通过社区 PR(ollama/ollama#17643)在 Apple Silicon 上跑通,已在 M4 Pro Mac 48GB 统一内存配置上完成验证。
一张 MacBook 上的 90 tok/s
FP8 精度下,Ling-3.0-tiny 在 NVIDIA DGX Spark 上达到约 100–105 tokens/s,在 M4 Pro MacBook 上达到约 86–90 tokens/s。8K 上下文长度下的峰值内存约 8.34 GiB——不需要数据中心级 GPU。
第三方评测平台 Artificial Analysis 给出了更高数字:输出速度超过 160 tokens/s,500 token 响应的端到端延迟约 18 秒(含推理时间)。在 Artificial Analysis Intelligence Index v4.1.1 上得分 25,Agentic Index 得分 16。
模型默认开启 thinking 模式,通过 enable_thinking 参数可按请求关闭:日常任务走快速响应,复杂推理才启动多步思考。推荐采样参数为 temperature=1.0、top_p=0.95、top_k=20。
3:1 交替堆叠,128 个专家中每次只唤醒 9 个
Ling-3.0-tiny 沿用 Ling 3.0 系列的 hybrid-linear attention 架构,但针对轻量化部署做了裁剪。核心设计就三层:
KDA–MLA 交替堆叠。每 4 层为一个 block,前 3 层用 Kimi Delta Attention,第 4 层用 Multi-Head Latent Attention,比例 3:1。KDA 负责长上下文建模效率,MLA 降低 KV cache 开销。
稀疏 MoE。FFN 层嵌入 128 个 routed expert,每个 token 激活其中 8 个外加 1 个 shared expert。7.9B 总参中实际参与每次推理的只有 1.3B。
混合推理。非思考模式下模型直接输出,适合 Agent 工具调用和指令跟随;开启 thinking 后进入多步推理链,覆盖数学、科学推理和编程场景。两种模式共用同一套权重。
从 Flash 到 Tiny:一周之内填满两头
8 月 4 日,inclusionAI 开源 Ling-3.0-flash:124B 总参、5.1B 激活,目标是大吞吐云推理。一周后放出 tiny:7.9B 总参、1.3B 激活,目标直指本地和边缘部署。
两端的部署策略截然不同。Flash 面向高吞吐云推理场景,124B 总参量级决定了它更适合服务端大规模并发。Tiny 则 FP8 原生就在消费级硬件上跑出接近三位数的生成速度,Ollama + MLX 方案让 Mac 用户无需 NVIDIA GPU 就能本地运行一个具备混合推理能力的 MoE 模型。
同一个系列、同一套 hybrid-linear attention 架构、同样的 MIT 许可。两款模型之间,inclusionAI 填上了从 124B 云推理到 7.9B 本地部署的空白。