Google DeepMind将Gemma 4用不到原预算10%的成本改装为扩散模型,256 token并行生成,吞吐量约1500 token/秒,benchmark质量略逊自回归模型。
Google DeepMind 没有从零训练一个新模型,而是对 Gemma 4 进行了改装,将其转化为扩散模型。刚刚发布的技术报告解释了它的工作原理以及其中的权衡。
Google DeepMind 在 6 月中旬将 DiffusionGemma 作为模型发布,如今又跟进发布了技术报告。与标准语言模型逐 token 生成文本不同,DiffusionGemma 以 256 个 token 为一块进行并行精炼,类似于图像 AI 从噪点中还原图片的过程。在 Nvidia H100 加速器上,该模型达到约每秒 1500 个 token 的速度。
从零训练新模型并非必要之举。据报告称,团队从现有的 Gemma-4-26B-A4B 出发,仅用不到原始训练 token 预算 10% 的资源就将其转化为了扩散模型。
DiffusionGemma 的输出速度是 Gemma 4 模型和此前扩散模型的几倍,同时保持了相当的精度。| 图片:Google

第一步中,模型从示例数据中学习重建含噪文本块。随后是强化学习和采样器蒸馏的联合阶段,Google 称之为 SD·RL。强化学习通常能提升答案质量,而采样器蒸馏则让模型可以用更少的计算步骤完成任务。Google 将两者合并为单一流程。
Google DeepMind 并非从零训练 DiffusionGemma,而是通过两个训练阶段将完成的 Gemma 4 模型进行转化。| 图片:Google

据报告称,这种结合方法使推理基准测试的质量平均提升了 10 分,同时将每个计算步骤的 token 数量提升近四倍。作为副作用,DiffusionGemma 的答案长度缩短了约 50%,进一步提升了速度。
标准语言模型在完成推理之前就必须对答案的第一个数字做出承诺。在报告的一道数学题中,Gemma 4 以 "-1" 开始回答,在推导过程中意识到正确答案是 "-25",随后在后面追加了修正。DiffusionGemma 并行展开答案和推理过程,因此可以在输出定稿之前修正错误。
与自回归模型不同,DiffusionGemma 可以在后续去噪步骤中修正早期的错误答案。| 图片:Google

数独求解基于同样的原理,因为每个格子的值取决于后续的格子。经过最少的微调后,DiffusionGemma 正确解决近 85% 的谜题,而基模型在此任务上完全失败。据报告,JSON 或代码修复等结构化输出仅需两到三次精炼步骤即可完成,因为大多数 token 已经由输入决定。
DiffusionGemma 还保留了其原始逐词生成文本的能力,允许用户根据任务切换两种模式。
DiffusionGemma 在质量基准测试中落后于自回归基模型 Gemma 4,但在输出速度上领先,达到约每秒 1500 个 token。| 图片:Google

绝对性能未能超越自回归基模型。Google 指出了其中多重原因。DiffusionGemma 并非从一开始作为扩散模型训练,而是事后改装而来。后续训练阶段相对较短,而第二步 SD·RL 优先考虑速度而非峰值质量。架构、训练数据和其他设置也继承自原始 Gemma 4 模型,这些对于扩散模型而言未必是最优的。
模型偶尔会陷入重复循环,反复生成同一个单词。这是激进缩减计算步骤的产物。在多模态任务中,DiffusionGemma 有时会忘记正确关闭推理部分,从而人为拉低了基准测试分数。
速度优势也主要适用于单用户场景。一旦约 32 个并发请求同时打到模型上,标准语言模型就会在吞吐量上迎头赶上。
Google 明确将 DiffusionGemma 称为实验性模型,并表示发布的目的是加速文本扩散研究,同时为社区提供一个资源高效适配的基础。
该模型已被初创公司 Interfaze 用于多语言语音识别,并在一项关于交互式放射学报告生成的研究项目中使用。Google 此前已在 Hugging Face 上基于 Apache 2.0 许可证发布该模型。其前身是 Google 于 2025 年 5 月演示的 Gemini Diffusion。