Google DeepMind 发布 DiffusionGemma,采用离散扩散替代传统自回归生成,在单卡 H100 上达到约 1500 tokens/秒,显著快于同规模 Gemma 4 自回归方案。
Google DeepMind 本周发布了 DiffusionGemma,一款使用离散扩散而非传统逐 token 循环生成文本的开源语言模型。
这听起来像是论文细节,但当你看到推理数字时就不一样了。报告称 DiffusionGemma 在单块 H100 上平均每次前向传播约 20 个 token,输出吞吐量约为每秒 1500 个 token。同等条件下,使用多 token 预测的 Gemma 4 自回归基线约为每秒 303 个 token。
这个数字值得关注。不是因为所有模型都要变成扩散模型。而是因为 LLM 推理中那个无聊的瓶颈依然是瓶颈,而这是目前对这个问题最清晰的攻击路径之一。
自回归模型容易理解。模型写下一个 token,再写下一个,再下一个。这种从左到右的约束也是一种代价。即使有推测解码,目标模型仍然需要验证一个草稿序列,而有效的加速取决于它接受多少草稿。
DiffusionGemma 尝试了另一种方案。它从 Gemma 4 26B A4B 起步,然后微调成文本扩散模型。它不是一次提交一个 token,而是在 256 个 token 的画布上并行去噪一个块。报告显示,实际上它使用约 12 步去噪,所以每次前向传播约处理 20 个 token。
这将工作从"为每个 token 移动权重和缓存"转向"每步消耗更多算力,但减少步数"。在现代加速器上,这可能是正确的权衡。
如果你主要通过聊天窗口与 LLM 交互,这很容易被低估。对于一个阅读单个答案的人类来说,每秒 500 个 token 和每秒 1500 个 token 都感觉是"足够快"。但对于 Agent 系统,差异就远不止表面那么简单了。
Agent 在循环中消耗延迟。搜索、总结、检查、打补丁、运行测试、修改。一个向模型提问二十次的工作流不仅关心最终答案质量,还关心尾延迟、每用户吞吐量,以及机器是否在 GPU 闲置时等待内存搬运。
这就是为什么我喜欢这个发布比又一个新的基准排行榜更值得。DiffusionGemma 不是在说"我们找到了更好的聊天机器人人格"。它说的是推理的形态可以改变。
代价是真实存在的。扩散模式在原始能力上并没有超越 Gemma 4 AR 基线。在报告的表格中,DiffusionGemma 在 AIME 2026 上得分 69.1,而 Gemma 4(MTP)为 88.3;在 LiveCodeBench v6 上为 69.1 对 77.1;在 GPQA Diamond 上为 73.2 对 82.3。模型更快了,但不是魔法般地更聪明了。
局限性部分也难得地具体。作者指出了输出较短、偶尔出现 token 结巴、多模态思考标签问题,以及吞吐量优势在高 batch 大小时会衰减的事实。在大约 32 个并发用户以下,DiffusionGemma 可以在吞吐量上获胜。超过这个数字,每 token 更高的算力成本让自回归推理可以追回来。
所以实际的理解不是"扩散取代自回归"。而是"路由变得有趣了"。
对于低并发、延迟敏感的工作,扩散解码可能是正确的模式。对于困难推理、长输出或高 batch 推理,自回归解码可能仍然是更安全的默认选择。DiffusionGemma 保留 AR 模式正是为了这个原因。有用的系统可能是混合的,而不是意识形态的。
这符合 LLM 基础设施的发展方向。赢家很少是一种模型模式到处通用。是一个知道何时为准确性付费、何时为速度付费、何时一个更短、更弱的答案是正确工程决策的路由器。
开源部分也很重要。封闭的扩散文本 API 有趣,但不能让开发者检查或适配多少。一个 Apache 许可的模型,在 Hugging Face Transformers 和 vLLM 中有参考支持,给社区一个真实的基线,可以分析、拆解、微调和与通常的 AR 堆栈比较。
炒作版本说文本扩散是 LLM 的未来。
有用的版本更小。逐 token 解码并非神圣不可侵犯。它是一个有着非常昂贵代价的设计选择。DiffusionGemma 提醒我们,AI 剩下的一些最大收益可能来自改变管道,而不是来自制作另一个稍微大一点的模型。
我会选择这种进步。它不如新的基准桂冠那么华丽,但它是那种可以让 Agent 工作流不再像等待一台非常昂贵的打字机的东西。
你会首先在哪里使用这个更快但稍弱的模式?