前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8394
  • AI编程提速了,为什么工程效率没有?
  • 甲骨文OpenJDK社区明令禁止提交AI生成代码
  • AI护栏的失效模式永远是"放行"
  • 124B MoE模型本地运行指南:96GB机器跑Ling 3.0 Flash
  • Cursor修复路径遍历时忽略符号链接(CWE-22)
  • AI Agents入门指南:构建9种专业Agent实现零云成本编程
  • 你比较的不是模型,而是契约:Agent评估的七个隐藏层
  • 10个开源项目助你安全构建AI Agent技能
  • 你的AI Agent技术栈在解决错误的问题
  • DeepMind WeatherNext 开源:台风路径强度同时预测
  • 面向智能体的接口设计:CLI与API之后是什么
  • Tailwind CSS v4:Rust引擎重写与架构升级
  • 自动化工程师口述:什么最先出问题
  • LongHorizon-Harness:AI Agent 长时间任务恢复框架
  • 模型路由与级联:如何砍掉 LLM 账单而不降质量
  • TryHackMe Guestbook靶场:AI提示词注入攻击实战
  • HER Hackathon #2:给 astron-agent 集成 Langfuse 可观测性
  • 本地LLM调用限额失效:4.2倍超额的技术复盘
  • CLAUDE.md 正确用法:不是项目知识库,而是会话级指令集
  • 零依赖零云费用:用SQLite内置向量能力搭建语义搜索
  • Google用不足10%预算将Gemma 4改装成扩散模型,速度达1500 token/秒
  • GPT-5.6+Fable破解25年数学难题
  • llama.cpp 新增 CUDA 融合优化:Nvidia GPU 推理速度提升
  • LLM Agent 稳定性实战:错误处理与重试设计
  • Google DeepMind权力收编,哈萨比斯或出走
  • 自我进化AI Agent通过了自己的测试——但代码从未运行过
  • Cloudflare Kitesurf:专为AI Agent打造的云浏览器
  • 2026医疗AI多智能体协调实战手册:60%项目失败的原因
  • PyTorch 实现 Model DNA:如何验证LLM是否真正从零训练
  • AI 模型 Token 成本周刊:GLM 5.2 降价超 80%
  • SAP因AI成本飙升暂停大部分差旅和招聘
  • AI 能力自建还是调 API?工程决策框架
  • 如何设计 Agent 不会误用的 MCP 工具
  • 错误信息是给 AI Agent 看的 API:设计原则变了
  • 从零构建可观测的Agent执行图
  • AI生成CSS的代价:失控的任意值与设计系统崩塌
  • 16-32GB显存本地编程模型实测:哪些真能跑代码补全和重构
  • AI工作路由策略:如何混用开源与前沿模型
  • 给Claude Code写AGENTS.md合同,告别过度干预
  • 在确定性领域规则上构建AI产品
  • 零成本 AI 资讯聚合站:Next.js + GitHub Actions + IndexNow
  • AI 编程智能体需要交接合同而非更多提示词
  • Cursor Rules实战:让AI编程助手不再写垃圾代码
  • 让AI编程助手少写垃圾代码:规则文件写法指南
  • 用DAP协议让AI Agent直接控制调试器
  • Go语言大文件写入:FADV_DONTNEED避免OS页缓存耗尽RAM
  • Agent Skills:让AI编程助手「学会」团队规范的新范式
  • 在 Vercel Sandbox 中安全运行 AI 生成代码
  • Hugo+Cloudflare Pages免费方案:为AI爬虫提供Markdown原文
  • 我简化GitHub Copilot多Agent编队的过程与收获
  • Laravel AI搜索实战:SQL、向量检索与混合方案的适用场景
  • 已加载 51 / 8394
8.0
热点
AI SCORE
模型发布2026-08-09 18:01

Google用不足10%预算将Gemma 4改装成扩散模型,速度达1500 token/秒

The Decoder#Google#扩散模型#开源
Editor brief · 编辑速览

Google DeepMind将Gemma 4用不到原预算10%的成本改装为扩散模型,256 token并行生成,吞吐量约1500 token/秒,benchmark质量略逊自回归模型。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Google DeepMind 没有从零训练一个新模型,而是对 Gemma 4 进行了改装,将其转化为扩散模型。刚刚发布的技术报告解释了它的工作原理以及其中的权衡。

Google DeepMind 在 6 月中旬将 DiffusionGemma 作为模型发布,如今又跟进发布了技术报告。与标准语言模型逐 token 生成文本不同,DiffusionGemma 以 256 个 token 为一块进行并行精炼,类似于图像 AI 从噪点中还原图片的过程。在 Nvidia H100 加速器上,该模型达到约每秒 1500 个 token 的速度。

从零训练新模型并非必要之举。据报告称,团队从现有的 Gemma-4-26B-A4B 出发,仅用不到原始训练 token 预算 10% 的资源就将其转化为了扩散模型。

DiffusionGemma 的输出速度是 Gemma 4 模型和此前扩散模型的几倍,同时保持了相当的精度。| 图片:Google

散点图,X 轴为每秒输出 token 数,Y 轴为 LiveCodeBench-v6 和 GPQA-Diamond 平均精度。DiffusionGemma 26B A4B 位于约每秒 1250 token、精度约 71% 处,远在 Gemma 4、Mercury 2、LLaDA 2.1 Flash 和 Nemotron Diffusion 的右侧。

两个训练阶段平衡质量与速度

第一步中,模型从示例数据中学习重建含噪文本块。随后是强化学习和采样器蒸馏的联合阶段,Google 称之为 SD·RL。强化学习通常能提升答案质量,而采样器蒸馏则让模型可以用更少的计算步骤完成任务。Google 将两者合并为单一流程。

Google DeepMind 并非从零训练 DiffusionGemma,而是通过两个训练阶段将完成的 Gemma 4 模型进行转化。| 图片:Google

流程图,展示了从 Gemma 4 26B A4B 经过划掉的预训练步骤、监督微调作为第一步、采样器蒸馏与强化学习作为第二步,最终得到文本扩散模型 DiffusionGemma 的路径。

据报告称,这种结合方法使推理基准测试的质量平均提升了 10 分,同时将每个计算步骤的 token 数量提升近四倍。作为副作用,DiffusionGemma 的答案长度缩短了约 50%,进一步提升了速度。

双向推理让模型能够自我修正

标准语言模型在完成推理之前就必须对答案的第一个数字做出承诺。在报告的一道数学题中,Gemma 4 以 "-1" 开始回答,在推导过程中意识到正确答案是 "-25",随后在后面追加了修正。DiffusionGemma 并行展开答案和推理过程,因此可以在输出定稿之前修正错误。

与自回归模型不同,DiffusionGemma 可以在后续去噪步骤中修正早期的错误答案。| 图片:Google

表格,展示了数学问题前 12 个 token 的五次去噪步骤。颜色强度表示模型置信度,最初错误的数字 1 先后变为 15,最终变为正确答案 25。

数独求解基于同样的原理,因为每个格子的值取决于后续的格子。经过最少的微调后,DiffusionGemma 正确解决近 85% 的谜题,而基模型在此任务上完全失败。据报告,JSON 或代码修复等结构化输出仅需两到三次精炼步骤即可完成,因为大多数 token 已经由输入决定。

DiffusionGemma 还保留了其原始逐词生成文本的能力,允许用户根据任务切换两种模式。

DiffusionGemma 在质量基准测试中落后于自回归基模型 Gemma 4,但在输出速度上领先,达到约每秒 1500 个 token。| 图片:Google

四个条形图,比较了 DiffusionGemma、带 MTP 的 Gemma 4 AR、LLaDA 2.1 Flash、Nemotron Diffusion 和 Mercury 2 在推理与知识、编码、指令遵循与 Agent 行为以及输出速度方面的表现。

推理差距与多用户限制依然存在

绝对性能未能超越自回归基模型。Google 指出了其中多重原因。DiffusionGemma 并非从一开始作为扩散模型训练,而是事后改装而来。后续训练阶段相对较短,而第二步 SD·RL 优先考虑速度而非峰值质量。架构、训练数据和其他设置也继承自原始 Gemma 4 模型,这些对于扩散模型而言未必是最优的。

模型偶尔会陷入重复循环,反复生成同一个单词。这是激进缩减计算步骤的产物。在多模态任务中,DiffusionGemma 有时会忘记正确关闭推理部分,从而人为拉低了基准测试分数。

速度优势也主要适用于单用户场景。一旦约 32 个并发请求同时打到模型上,标准语言模型就会在吞吐量上迎头赶上。

Google 明确将 DiffusionGemma 称为实验性模型,并表示发布的目的是加速文本扩散研究,同时为社区提供一个资源高效适配的基础。

该模型已被初创公司 Interfaze 用于多语言语音识别,并在一项关于交互式放射学报告生成的研究项目中使用。Google 此前已在 Hugging Face 上基于 Apache 2.0 许可证发布该模型。其前身是 Google 于 2025 年 5 月演示的 Gemini Diffusion。

Original source

本文由 AI 翻译整理自 The Decoder,原文版权归原作者所有。

阅读英文原文
上一篇
零依赖零云费用:用SQLite内置向量能力搭建语义搜索
下一篇
GPT-5.6+Fable破解25年数学难题