DiffusionGemma:文本生成速度提升 4 倍
Google DeepMind 推出 DiffusionGemma 技术,文本生成性能翻 4 倍。若应用到编码和内容生成工具,可显著提升效率。
Google DeepMind 推出 DiffusionGemma 技术,文本生成性能翻 4 倍。若应用到编码和内容生成工具,可显著提升效率。
我们最新的开源实验模型在专用 GPU 上实现了高达 4 倍的推理加速,为探索对速度敏感的交互式本地工作流开创了新局面。
今天,我们推出 DiffusionGemma,一个探索文本扩散的开源实验模型,这是一种异常快速的文本生成方法。这个 26B 专家混合 (MoE) 模型在 Apache 2.0 许可证下发布,它超越了典型自回归 LLM 的逐 token 顺序处理方式。相反,它同时生成整块文本,在 GPU 上实现高达 4 倍的文本生成加速。
基于 Gemma 4 家族领先业界的参数效率和尖端 Gemini 扩散研究,DiffusionGemma 集成了一个新颖的扩散头,旨在最大化生成速度。虽然自回归 Gemma 4 模型仍是高质量生产输出的标准,DiffusionGemma 为探索对速度敏感的交互式本地工作流(如行内编辑、快速迭代和生成非线性文本结构)的研究人员和开发者而设计。
构建实时交互式 AI 应用的开发者经常面临本地推理的延迟瓶颈。DiffusionGemma 直接解决这些挑战,但存在一些关键权衡:
闪电般快速的推理:通过将解码瓶颈从内存带宽转移到计算,DiffusionGemma 在专用 GPU 上生成速度快 4 倍。(单个 NVIDIA H100 上 1000+ tokens/秒,NVIDIA GeForce RTX 5090 上 700+ tokens/秒)。
硬件占用易于接受:作为一个 26B 总参数的专家混合 (MoE) 模型,推理时仅激活 3.8B 参数,DiffusionGemma 在量化后可轻松适应高端消费级 GPU 的 18GB VRAM 限制。
双向注意力:每次前向传播生成 256 个 token,允许每个 token 参与到所有其他 token。这为非线性领域(如行内编辑、代码填充、氨基酸序列或数学图等)提供了重大优势。
智能自我修正:模型迭代地精化自己的输出,允许它一次性评估整个文本块以实时修复错误。
实验状态与生产建议:由于 DiffusionGemma 优先考虑速度和并行生成,其总体输出质量低于标准 Gemma 4。对于要求最大质量的应用,我们建议部署标准 Gemma 4。
你可以通过微调来改进 DiffusionGemma 在特定任务上的性能。在下面的例子中,Unsloth 微调了 DiffusionGemma 来玩数独——自回归模型难以完成的任务,因为每个 token 都依赖于未来的 token。DiffusionGemma 的双向注意力使这变得容易得多。
微调后的 DiffusionGemma 求解数独。
虽然 AI 研究社区多年来一直在探索基于扩散的文本生成,但将其应用于大型模型仍然是一个挑战。DiffusionGemma 通过改变模型使用硬件的方式来改变这一点。
大多数语言模型的行为像打字机,从左到右逐个 token 生成。在云中,这很高效,因为服务器可以将数千个用户请求批处理到一起以共享硬件负载。但当在本地为单个用户运行时,这种逐词过程会让你的专用 GPU 或 TPU 未被充分利用——它大部分时间只是等待下一个"按键"。
DiffusionGemma 扭转了这种低效。它不是顺序预测单词,而是同时起草整个 256 token 段落。通过一次给计算机处理器更大的工作块,DiffusionGemma 充分利用了硬件潜力。它将模型推理从单个顺序打字机升级为大规模印刷机,同时印刷整个文本块。
DiffusionGemma 文本到 3D SVG 演示,由 Hugging Face 提供。逐步生成。
这意味着 DiffusionGemma 的加速是为本地和低并发推理设计的。在高 QPS 云服务中,自回归模型可以部署以有效饱和计算,因此 DiffusionGemma 的并行解码收益递减,可能导致更高的服务成本。在单个加速器上的低至中等批大小时,吞吐量优势最强。
类似于从视觉静态开始并迭代地精化为清晰图像的 AI 图像生成器,DiffusionGemma 将此应用于文本:
画布:模型从随机占位符 token 的画布开始。
迭代精化:模型进行多次传递,锁定正确的 token 并用它们作为上下文线索来精化其余部分。
最后打磨:文本收敛为高质量输出。
因为模型可以在生成时处理整个段落,它解锁了新的模型行为模式,如完美地关闭复杂 markdown 格式或近实时生成和渲染代码。
下载权重:在 Hugging Face 上访问实验模型权重(在宽松的 Apache 2.0 许可证下发布)。
集成和学习:在我们的 DiffusionGemma 开发者指南中了解更多。或深入阅读 DiffusionGemma 可视化指南以了解底层机制。
使用你最喜欢的开发工具:使用 MLX、vLLM(集成由 Red Hat 支持)和 Hugging Face Transformers 高效地部署模型。为了快速实验,我们正在发布一个使用 Hackable Diffusion 的微调教程,一个为可组合性设计的模块化 JAX 工具箱。你也可以使用 Unsloth 和 NVIDIA NeMo 探索微调。此外,llama.cpp 的官方支持即将推出。
体验优化性能:我们与 NVIDIA 合作优化他们的硬件堆栈,确保与消费级设置的兼容性(为 GeForce RTX 5090 和 4090 GPU 量化)以及在企业系统上的高性能(Hopper 和 Blackwell 使用高级 NVFP4 内核),包括用于本地桌边部署的 NVIDIA DGX Spark 和 DGX Station,以及为 AI 专业人士的 RTX PRO。NVFP4(4 位浮点)的原生支持加速了计算吞吐量,允许模型以近无损精度更快运行。
按你的方式尝试:在桌面专用 GPU 上运行,或通过 Gemini Enterprise Agent Platform Model Garden 或 NVIDIA NIM 在云中运行。