AREX Feed Article
Inco AI 发布 DFlash 2:Qwen3.8-27B 在 M5 Max 上宣称 70 tok/s、最高 4.6 倍加速
8 月 18 日 22:08(UTC),UCSD 教职人员 Zhijian Liu(据其 X 个人简介,此前在 MIT 攻读博士、任 NVIDIA 研究科学家,现正为 Inco AI 工作)发推宣布 DFlash 2 发布。这是 DFlash 推测解码的下一代:官方称阿里的 Qwen3.8-27B 在 M5 Max MacBook Pro 上达到 70 tok/s,速度最高为自回归解码的 4.6 倍,且输出完全相同;"每轮处理免费获得一个额外的被接受令牌"(Get one more accepted token on every pass, for free)。推文附演示视频和博客链接。
Liu 在推文中说明,DFlash 2 由 Z Lab 起步、在 Inco AI 升级。截至 8 月 19 日凌晨本文写作时,这条推文已有约 28.6 万次浏览、2155 个赞、238 次转推。需要先说明的是:70 tok/s 与 4.6 倍均来自发布方自报,是声明而非独立验证。
官方口径:每轮多 20% 输出,只加约 1% 延迟
Inco AI 于 8 月 18 日发布博客《DFlash 2: Keep Drafting Parallel》,给出完整口径:每次验证轮次多产出 20% 以上的 token,增加的周期延迟约 1%,输出"可证明不变"(provably unchanged),各基准上的增益为 16%–25%。博客称,用今天发布的 Qwen3.8-27B drafter,SGLang 在 batch size 1 下吞吐为自回归解码的 2.7–3.4 倍;为 Meta 的 Muse Glimmer 做的 drafter 则为 3.1–4.6 倍。
推文里的 70 tok/s 和 4.6 倍上限,只出现在 M5 Max 演示口径中:博客配图说明正是"Qwen3.8-27B 在 Apple M5 Max 上经 oMLX 运行 DFlash 2,与自回归解码并排对比"。而在博客和模型卡公布的服务器数据里,Qwen3.8-27B 的最高倍数是 SGLang 并发 1 下的 3.43×。
随博客一起发布两个 drafter:Qwen3.8-27B 版和 Muse Glimmer 版。Hugging Face 模型卡显示,这是一个 2B 参数、BF16 的草案模型,不是独立语言模型,镜像存于 z-lab/Qwen3.8-27B-DFlash2。
模型卡公布的单卡 H200 评测(SGLang、块大小 8)中,并发 1 时 GSM8K 达到 236.1 tok/s(自回归的 3.43 倍),MT-Bench 上 184.0 tok/s(2.67 倍);并发 8 时最高 2.85 倍,并发 32 时滑落到 1.01–1.45 倍。对比基线包括 Qwen3.8 自带的 MTP 和社区 DSpark drafter:五个基准的平均接受长度,DFlash 2 为 4.80,MTP 为 4.28,DSpark 为 3.62。
85.4% 与 99.5%:正确的 token 一直在候选里
DFlash 2 解决的问题要从 DFlash 本身说起。推测解码的做法是:小草案模型先猜一块 token,目标模型用一次前向验证整块,猜对了就一次前向换出多个 token。最初的 DFlash 发布于 2026 年 1 月,论文(作者 Jian Chen、Yesheng Liang、Zhijian Liu,ICML 2026)把"草案"这一步也做成一次前向并行预测整块,不再逐 token 自回归。
DFlash 2 的博客把改进拆成两个问题。第一个是选择:每个位置独立预测时,单点最可能的 token 命中率只有 85.4%,但正确 token 出现在前 16 个候选里的概率高达 99.5%。每个选择单独看都合理,但没有机制把它们串成一条连贯的路径,不连贯的块会在验证时被截断。DFlash 2 保留每位置的前 16 个候选,给所有相邻候选对打分(256 维低秩双线性匹配,带上下文门控),再沿分数走一条贪心路径,并用拒绝采样保持目标分布不变。这套"路径选择器"只增加 2.0M 参数、0.6% 周期延迟;对比之下,已有方法 DSpark 的修正头要加 77.8M 参数、9.6% 延迟,博客称选择器以少约 40 倍的参数、低 16 倍的延迟开销胜出。效果上,选择器在 T=0 时把接受长度从 4.27 提到 4.61、T=1 时从 3.78 提到 4.25,而"神谕"(永远从 top-16 里选对)的上限是 6.79,博客自己说"还有空间"。
块尾衰减:两层卷积换掉十层 Transformer
第二个问题是块尾。博客的数据表显示,无论 top-1 命中还是 top-16 命中,越靠后的位置越差:即使神谕级选择,正确率也会从首位的 99.5% 掉到末位的 87.8%。博客称之为 suffix decay(后缀衰减),归因于草案骨干容量不足:3 层、5 层、15 层模型在首位几乎相同,越往后差距越大,但 15 层要多花 15.2% 的延迟。
DFlash 2 选择加两层动态 depthwise 卷积:每层注意力与 MLP 前后各插一个两 tap(当前位置加前一个位置)的轻量卷积,让信息在块内并行传递。代价是 16.5M 参数(约 3%)、0.7% 周期延迟,效果是 5 层模型把块尾衰减压到接近 15 层水平,第 4、5 层的块内注意力占比从 9.4% 降到 0.5%,局部工作被卷积接走,注意力重新专注读上下文。两个改动合起来,在消融模型 Qwen3.5-4B 上平均接受长度比 DFlash 提高 1.05 个 token(约 21%)、比 DSpark 高 0.48,全部开销只有 1.3% 的周期延迟。
四个引擎今天就能跑,drafter 已上 Hugging Face
博客给出了四个推理引擎的接入方式,全部今天可用:SGLang 用 --speculative-algorithm DFLASH 加 --speculative-num-draft-tokens 8;vLLM 需要拉取 PR 52816 的版本,7 个草案 token;llama.cpp 走 PR 27342,用 Q4_K_M 量化版 GGUF;Apple Silicon 上的 oMLX 则预置了 DFlash 2 支持,模型管理器里块大小设 5、verify mode 选 dflash。模型卡和博客都强调解码"无损":贪心输出与目标模型逐字一致,采样保持原分布。
这套方法不是从零开始。博客回顾,DFlash 自 1 月发布以来已集成进 SGLang、vLLM、TensorRT-LLM 和 llama.cpp;(6 月 23 日)测出 gpt-oss-120b 在 Blackwell 上最高 15 倍吞吐提升;博客还称 Google 报告在 TPU 上每秒多产出 3 倍的 token、CoreWeave 生产环境里的 Kimi K2.7 Code 端点默认运行 DFlash,Meta、Poolside、小米、NVIDIA 都为自家模型发布了官方 drafter,DFlash 模型在 Hugging Face 的下载量已超 350 万次(截至 2026 年 8 月)。DFlash 2 是这个"平行草拟"路线的下一个版本。
社区首批实测:27 tok/s 起步,离 70 还有距离
发布后数小时内社区就开始实测。本地 LLM 引擎开发者 David Dalcu的初步评价是"真的很好,优雅的升级,但需要 M5 Max 的 Neural Accelerator,旧款 Apple Silicon 上收益没那么大,在我的硬件上大概和高度优化的 MTP 差不多"(it's really good, elegant upgrade, but requires M5Max Neural Accel),他还在自己的 GitHub 放了实现 DFlash 2 的测试分支。另一位用户 pengjianqing 在 M5 Pro 48GB 上用 oMLX 测到约 27 tok/s,称"巨大提升"。在 DGX Spark 上,用户 Wësche 转述了 Sol 的初步数字:NVFP4 目标模型下并发 1 时 38.67 tok/s,对照的 MTP3 临时基线 24.59 tok/s,快约 57%;发帖人自己注明"还需要匹配的 MTP 重跑和输出/接受率检查才能算数,C8 正在跑"。
业内也有具名回应。阿里 Qwen 团队研究员 Huiqiang Jiang 评价"Such an amazing speedup";Nebius AI 推理团队的 Samir Khaki 称"Great work by @zhijianliu_ and team!";Liu 本人也在 8 月 19 日凌晨回复阿里 Qwen 官方账号,祝贺 Qwen 团队并附上模型卡链接。中文开发者社区里,unbug 的评价是"天下武功唯快不破,快是最迫切的需求了",并说 60+ tps 的体感好于 Claude 的 40 tps。
把官方口径和社区数据放在一起,落差是明显的:官方报 70 tok/s,而我们核对的社区首批反馈里,Mac 上最快的实测是 M5 Pro 的约 27 tok/s,DGX Spark 上的 38.67 tok/s 也被作者自己标为初步。Dalcu 的结论更直接:收益依赖 M5 Max 的 Neural Accelerator,旧款 Apple Silicon 上"大概和高度优化的 MTP 差不多"。
70 tok/s 是否只在 M5 Max 上成立、旧款硬件能拿到多少收益,在我们能核对的社区反馈里,这两点都还没有官方之外的答案。
参考链接
- _