AREX Feed Article
DiffusionGemma 完整技术报告发布:不到 10% 训练预算,将 Gemma 4 改造成 1500 token/秒的文本扩散模型
这是一份诚实的「能力地图」——Google DeepMind 把改造过程的全部得失都摊在了桌面上。
6 月开源、8 月交卷:一份迟到但诚实的 full report
2026 年 8 月 10 日,Google Gemma 团队在 X 上宣布,正式公开。模型本身早在两个月前的 6 月 10 日就已在 Hugging Face 上,但此前外界只能根据博客长文和模型卡拼凑信息。这份提交至 arXiv(编号 )的技术报告,首次把完整的训练流程、架构选择、逐项 benchmark 数据和已知缺陷一并摊开。
最核心的数字是:DiffusionGemma 在单张 NVIDIA H100 GPU 上达到约 1,500 token/秒的输出速度,每次前向传播(forward pass)平均产出约 20 个 token——而目前最先进的投机解码(speculative decoding)方法只能做到 3-6 个。进一步地,第三方推理服务商 Unsloth 的早期测试表明,在 NVIDIA RTX 6000 上速度可扩展至 2,000 token/秒。
但这份报告与常见的 product launch 博客不同,它更像一张研究路线图。Google DeepMind 明确表示 DiffusionGemma 是「实验性」模型,输出质量低于标准 Gemma 4,目标用户是研究者和需要在本地跑高速推理的开发者。
论文标题: DiffusionGemma Technical Report
论文链接:
开源地址:
核心成绩: 用不到 10% 原始训练 token 预算将 Gemma 4 改造为文本扩散模型,单 H100 达约 1,500 token/秒,建立了文本生成速度与智能的新 Pareto 前沿。
两步改造法:SFT 教模型「看懂噪声」,SD·RL 逼它「又快又好」
传统自回归(autoregressive,AR)语言模型逐 token 生成文本的性质,在低并发场景下会造成严重的 GPU 利用率不足——大量时间花在内存与计算单元之间搬运权重和 KV cache,而非实际运算。投机解码可以将每次前向传播的产出提升到 3-6 个 token,但草稿模型自身的序列瓶颈和后期位置的接受率下降,注定了这种方案的天花板。
文本扩散(text diffusion)绕开了这个瓶颈。它从一个填满随机 token 的 256 token「画布」(canvas)出发,经过约 12 轮迭代去噪,一次性产出整段文本。每一轮中,画布内的所有 token 都通过双向注意力(bidirectional attention)互相参照,而不是从左到右单向依赖。DiffusionGemma 据此将每次前向传播的产出推到了约 20 个 token。
Google DeepMind 没有从零训练一个扩散模型,而是选择了一条成本低得多的路线:直接改造已经训练好的 Gemma 4 26B A4B(Mixture-of-Experts,激活参数 3.8B,总参数 25.2B)。改造过程分为两个阶段,总消耗不到原始 AR 模型训练 token 的 10%:
第一阶段:监督微调(SFT)。 模型学习处理两类输入——提示词和先前已生成的 clean canvas(通过因果 attention 编码为 KV cache),以及当前需要去噪的 256 个噪声 token(在扩散过程中使用双向 attention)。训练目标是让模型从噪声 token 中还原出原始文本。报告显示,去噪性能在训练早期迅速提升,随后进入对数线性增长。思考模式(thinking mode)的收敛尤其依赖长 SFT——模型初期会频繁陷入 token 重复循环,需要大量训练才能维持连贯的推理链。
第二阶段:采样器蒸馏与强化学习联合训练(SD·RL)。 SFT 之后的模型在大量去噪步数下质量尚可,但一旦压缩到低步数——也就是实际高速推理需要的条件——生成质量就急剧崩塌。传统的做法是把奖励驱动的对齐和步数压缩分成两个独立阶段,DiffusionGemma 则把它们合并到了一个在线学习流程中。一步梯度更新同时作用于两个目标:最大化奖励信号以提升回答质量,以及压缩去噪轨迹以减少前向传播次数。
SD·RL 的训练动态还有一个巧妙的自课程效应。训练早期,模型预测熵高,自适应停止(adaptive stopping)机制迟迟不触发;随着模型信心提升、熵降低,自适应停止越来越早地介入,训练分布自动向更短的去噪轨迹偏移。因此即便奖励指标趋于饱和后,继续 SD·RL 训练仍然有意义——持续的熵降低直接转化为更快的推理速度。报告数据显示,SD·RL 将 GPQA-Diamond 和 LiveCodeBench-v6 的综合得分提升了约 10 个百分点,同时将每次前向传播的产出从约 5 个 token 翻了两番至近 20 个。
速度翻 4 倍,AIME 掉近 20 分:质量与速度的真实账本
报告最引人注目的或许不是速度数字本身,而是团队把质量损失也完整公开了。在中,DiffusionGemma 与 Gemma 4 26B A4B 的逐项对比如下:
| Benchmark | DiffusionGemma 26B A4B | Gemma 4 26B A4B |
|---|---|---|
| MMLU Pro | 77.6% | 82.6% |
| AIME 2026(无工具) | 69.1% | 88.3% |
| LiveCodeBench v6 | 69.1% | 77.1% |
| Codeforces ELO | 1429 | 1718 |
| GPQA Diamond | 73.2% | 82.3% |
| Tau2(三次平均) | 56.2% | 68.2% |
| MMMU Pro(视觉) | 54.3% | 73.8% |
| MATH-Vision | 70.5% | 82.4% |
差距最悬殊的是 AIME 2026:DiffusionGemma 的 69.1% 比 Gemma 4 的 88.3% 低了 19.2 个百分点。视觉任务上的差距同样显著——MMMU Pro 掉了近 20 个百分点,MATH-Vision 低了约 12 分。唯一的例外是 HLE(无工具),DiffusionGemma 反而以 11.0% 略微领先 Gemma 4 的 8.7%。
报告指出了几个导致质量损失的原因:模型并非为扩散训练从头设计,而是事后改造;训练周期相对较短;SD·RL 阶段优先优化速度而非峰值质量;架构、训练数据和超参数都直接继承自 Gemma 4,未必对扩散最优——将这些总结为改造方案的结构性代价。在低步数条件下,SFT 模型会落入 token 重复循环——模型开始写出合理的推理链然后突然陷入「token、token、token」式的反复——SD·RL 训练大幅缓解了这个问题,但报告承认偶尔仍会发生。
速度优势也有明确边界。每步前向传播处理 256 个 token 带来了约 3.2 倍的每步延迟增长(主要来自 MoE 层——单个 token 只激活 8 个专家,而 256 个 token 的画布平均激活约 84 个专家)。DiffusionGemma 的吞吐相对 Gemma 4 的倍数大致等于 TPF 除以这个开销因子。当并发请求数足够高时,自回归模型通过批处理重新获得吞吐优势,扩散模型的低延迟红利逐渐消失。
模型学会了纠错:扩散意外的三个副产品
改造过程还产生了一些计划外的能力。
双向推理与自我纠错。 自回归模型必须在对推理链有完整把握之前就「commit」第一个输出 token——报告中一道数学题的例子:Gemma 4 一上来输出「-1」,推导过程中意识到正确答案是「-25」,只能在后面补上修正。DiffusionGemma 由于整个画布的 token 在每次去噪步中都可以互相参照,能够在最终输出确定之前修正早期的错误。这一特性在需要全局一致性的任务上尤为明显:根据技术报告,经过少量微调后 DiffusionGemma 能够成功求解数独题目,而基础 Gemma 4 完全无法完成该任务——因为数独的每个格子都依赖「后面」格子的取值,自回归模型无法在填写第一个数字之前通盘考虑。
涌现性的简洁输出。 SD·RL 训练意外地鼓励模型产出更短的回答——最终 checkpoint 的生成长度约为 SFT checkpoint 的一半。这不是通过显式的长度惩罚实现的,而是「更低的预测熵 → 更早触发自适应停止 → 更少的去噪步数 → 更高的奖励信号」这个循环的副产品。短回答进一步放大了速度优势:更少的 token 加上更少的去噪步数,使得 DiffusionGemma 在整个评估集上所需的前向传播总数不到 Gemma 4 AR 基线的 5%。
保留了自回归能力。 因为 DiffusionGemma 与 Gemma 4 共享完全相同的 transformer 架构,最终权重可以直接加载回原始架构进行标准 AR 生成,性能虽有轻微下降但仍保持在 SFT checkpoint 与扩散模式之间。这种双模能力为未来的混合解码路由提供了可能:根据延迟约束和任务复杂度动态切换生成模式。
一张开放的研究路线图,而非生产替代品
报告结尾的语气克制得近乎保守。团队罗列了多项已知限制:扩散微调带来的 AR 能力退化(尽管轻于预期);偶尔出现的 token 重复循环;中提到多模态任务中模型有时会忘记正确关闭推理段落,导致 benchmark 分数被人为拉低;速度优势仅限于低并发场景;架构和训练配置并非为扩散从头优化。
但这份克制的坦诚恰恰是报告最有价值的部分。Google DeepMind 选择把一整条研究路线的全部得失写成技术报告、附上 Apache 2.0 权重一并开源。报告明确写道:希望这份开放权重能为后续的离散扩散基础研究提供一个「白盒基线」。
社区的反应印证了这种价值。模型发布仅数周,已经被用于两个截然不同的下游场景:创业公司 Interfaze 用它做多语言自动语音识别,研究团队 Van Puyvelde 等人则用它生成交互式放射学报告草稿。Unsloth 则验证了 DiffusionGemma 在数独求解等需要双向注意力的任务上的微调潜力。
如果这份报告有一个核心结论,那应该是:文本扩散在今天的 AI 版图里并不是自回归模型的替代者,而是一个在特定约束下(本地推理、低并发、对延迟极度敏感)确实有意义的工程选项。将已有 AR 模型改造成扩散模型的成本远低于预期——不到原始训练预算的十分之一——这意味着更多团队有能力进入这个方向进行实验。至于文本扩散能否在保持速度优势的同时追平质量差距,报告没有给出答案,但它提供了目前最完整的一套追问工具。