AREX Feed Article
Inco AI 开源 DFlash2 草稿权重:GLM-5.3-Flash 解码自报提速 2.42×–2.79×
8 月 27 日 23:05(UTC,北京时间 8 月 28 日 07:05),Inco AI 官方 X 账号宣布 "GLM-5.3-Flash is fast. DFlash 2 makes it faster!"("GLM-5.3-Flash 已经很快,DFlash 2 让它更快"),同帖放出 GLM-5.3-Flash DFlash2 投机解码草稿模型的权重链接。
按 的自报口径,在 4×GB300(TP4)上、并发 1 的 GSM8K、MATH-500、HumanEval 三项任务中,解码吞吐较自回归分别提升 2.42×、2.79×、2.62×,接受长度全面超过 GLM-5.3-Flash 自带的原生 MTP。
这是智谱 GLM-5.3-Flash 于 8 月 26 日正式发布后,第三方推理加速生态在一天内给出的开放权重回应。所有性能数字均由 Inco AI 在模型卡中单方自测并公布;SGLang 官方文档也注明,该组合"尚未在 cookbook 验证过的硬件上实测",只作为起点配置。
模型发布次日,草稿权重就位
模型卡开篇就划清边界:该权重是运行在投机解码服务内部的草稿模型,为目标模型生成待验证的 token,不能独立使用。权重页显示其规模为 1B 参数、BF16;目标模型是智谱(zai-org)的 ,即 GLM-5 系列首个原生多模态模型,320B 总参数、18B 激活参数,混合稀疏与线性注意力架构,上下文窗口 1M。
由 Business 认证账号发出,该账号创建于今年 5 月。帖子的时点卡在 GLM-5.3-Flash 官宣次日:确认该模型当日发布、SGLang 提供 day-0 支持,并透露模型此前以代号 ox-alpha 流传。
当晚 18:52,Inco AI 的 Zhijian Liu 在里写道:"Congrats on the release! DFlash 2 for GLM-5.3-Flash is cooking. Very soon!!"("恭喜发布!GLM-5.3-Flash 的 DFlash 2 正在酝酿,很快就好!"),距权重上线不到 29 小时。
许可证方面,权重以 CC BY-NC-ND 4.0 发布,仅限研究与评估用途,禁止商用与衍生,商业授权需联系 。SGLang 文档还提醒,该草稿仓库设有访问门槛,需在模型页申请访问后才能下载。
一次验证七个 token:块扩散、候选路径与两抽头卷积
投机解码的逻辑很直接:小草稿模型猜出一块 token,目标模型一次前向验证整块,猜对越多,一次前向换回的 token 越多。Inco AI 在中解释了它今年 1 月发布的 DFlash 如何把草稿也变成一次并行预测整块,以及 DFlash 2 的两个改动。
一是轻量路径选择器:每个位置保留 top 候选(博客用五层 Qwen3-4B 测量:top 1 命中率 85.4%,但正确 token 落在 top 16 内的概率达 99.5%),给相邻候选对打分后沿最优路径走通全块,只增加 0.6% 的周期延迟。
二是在骨干中插入两抽头动态卷积,抑制草稿质量向块尾衰减,增加 3% 参数、0.7% 周期延迟。
博客称,两个改动合起来让每次验证多产出 20% 以上的 token,跨基准增益 16%–25%,且输出"可证明不变":贪心解码与目标模型逐 token 一致,采样经拒绝采样保持原分布。
GLM-5.3-Flash 模型卡把这一点表述为无损解码,并用接受长度(每请求完成 token 数除以验证步数)给出对比:GSM8K 从 MTP 的 5.06 提高到 5.78,MATH-500 从 4.95 到 5.86。
HumanEval 从 4.70 到 5.32,MBPP 从 4.26 到 4.85,MT-Bench 从 3.71 到 4.03,五项全部高于模型原生 MTP。
2.79× 是怎么测出来的
模型卡的评测段落写明了完整协议。运行环境为 SGLang 加 4×NVIDIA GB300(TP4),目标模型侧用 TRT-LLM DSA 与 FlashInfer TRT-LLM MoE,FP8 KV cache,草稿注意力用 FlashAttention 4。
投机块大小 8,即每验证步提出 7 个草稿 token,与 MTP 的提案数一致;采样采用 GLM-5.3-Flash 官方推荐参数(temperature 1.0、top-p 0.95、默认 Max reasoning effort),最大新 token 数 4096;并发 1 时取 128 个样本,并发 8 和 32 时各取 1024 个。
并发 1 的完整结果是:GSM8K 355.4 tok/s(自回归 146.8,2.42×;MTP 为 1.93×)、MATH-500 438.9(157.5,2.79×;MTP 2.05×)、HumanEval 436.8(166.6,2.62×;MTP 1.94×)。
MBPP 402.2(168.2,2.39×)、MT-Bench 293.2(169.3,1.73×),五项任务的提速区间为 1.73×–2.79×。提速随并发上升而收窄:并发 8 时最高 2.17×(HumanEval),并发 32 时最高 2.01×(HumanEval)。
这些数字全部出自 Inco AI 单方自测。SGLang 的 在解释 DFlash2 选项时写明:该方案用块扩散草稿替代检查点内的 MTP 头,需要携带 PR #36708 的构建,且"此组合尚未在 cookbook 硬件上测量,请视为起点配置"。
从 Qwen 到 GLM:DFlash 2 的第三条战线
GLM-5.3-Flash 不是 DFlash 2 的第一个适配对象。8 月 18 日,Inco AI 发布 DFlash 2 博客与 Qwen3.8-27B、Meta Muse Glimmer 两个草稿器,声称在 Qwen3.8-27B 上达到自回归 2.7–3.4× 的吞吐,在 Muse Glimmer 上为 3.1–4.6×。
博客同时回顾了 DFlash 的生态底子:1 月发布后已集成进 SGLang、vLLM、TensorRT-LLM 与 llama.cpp,NVIDIA 在 Blackwell 上测得最高 15× 吞吐,Google 报告 TPU 上 3× token/s,CoreWeave 的 Kimi K2.7 Code 生产端点默认跑 DFlash,Hugging Face 上 DFlash 系列模型累计下载超过 350 万次。
Inco AI 的 目前列有 5 个条目,GLM-5.3-Flash-DFlash2 是其中最新的一个。官方基准图()显示,GLM-5.3-Flash 在 Terminal-Bench 2.1、DeepSWE v1.1 等六项 agent 基准上与 GLM-5.2、DeepSeek-V4-Vision-Exp、Claude Opus 4.8 等并列对比。
SGLang 给 GLM-5.3-Flash 的低延迟默认路径是 adaptive MTP 5/1/6,即官方加速方案是模型自带的 MTP 头。DFlash2 的定位则是绕开这条官方路径,用训练好的块扩散草稿替代 MTP 头,由第三方给出另一条加速路线。
SGLang 自认 launch partner,量化作者当晚跟进
权重上线约六分钟后,转帖祝贺:"Congrats @inco_ai on launching DFlash 2 for GLM-5.3-Flash! We are proud to be the launch partner"("恭喜 Inco AI 为 GLM-5.3-Flash 推出 DFlash 2!我们很自豪成为首发合作伙伴"),并称已在 cookbook 的 playground 中加入 DFlash 2 选项。
这份支持附带着条件:文档要求特定的 SGLang 构建分支,草稿仓库需要申请访问,组合尚未实测。
Inco AI 一方的说法更激进。(X 简介自称在 Inco AI 工作、任教于加州大学圣迭戈分校,模型卡引用的 DFlash 论文(ICML 2026)作者之一)发帖:"GLM-5.3-Flash, meet DFlash 2. Flash² — 2.8× faster!"("GLM-5.3-Flash,认识一下 DFlash 2。Flash 的平方,快 2.8 倍!")。
他在同一帖里预告 "More to come (really) soon!"("更多东西(真的)很快就来!");2.8× 对应的是 MATH-500 一档的 2.79×。
社区一侧的跟进以量化为先。8 月 28 日 00:47 UTC,在帖中宣布已发布该草稿模型的 GGUF 量化版本:"All sizes, from BF16 to Q2"("从 BF16 到 Q2 全尺寸")。
他还在帖中提醒:"Draft models handle quantization much better than usual, so don't default to Q8_0, try different quants."("草稿模型对量化的容忍度比通常情况好得多,别默认用 Q8_0,可以试试不同档位。")
围绕 GLM-5.3-Flash 的加速由此出现两条路径:官方自带的 MTP 头,与第三方 DFlash 2 草稿。模型卡把自回归、MTP、DFlash 2 放进同一套评测协议对比,并发 1 下 MTP 档的提速区间为 1.36×–2.05×,DFlash 2 档为 1.73×–2.79×。
但 Inco AI 宣称的 2.42×–2.79× 目前仍是其单方自测口径,SGLang 也尚未在自己的硬件上复核。在独立复测出现之前,2.79× 只是 Inco AI 自己的数字。