前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8356
  • OpenAI披露第三方网络安全评估事件并强化安全护栏
  • 我用 Claude Code 将一周任务压缩到两天:复杂表单实战复盘
  • Amazon Bedrock 原生集成 Web Search:LLM 实时联网检索
  • Cursor开源MoK:GB300 NVL72机架上的确定性MoE训练大内核
  • AI 门控测试的"绿戏"陷阱:把假数据打在网络层才能真测
  • Agent身份扫描暴露真相:你的Agent系统不过是脆弱胶水代码?
  • 多Agent研究工作流的静默失败:失败看起来像成功
  • OpenAI 内部路线图:今年秋季 Codex 将显得「原始」
  • MCP Servers + Agents:让Claude Code告别"中间人"状态
  • ChatGPT Work亿级用户Agent架构解析
  • OAuth 2.0 的隐含假设正在被 AI Agent 打破
  • LLM记忆不是聊天历史:如何设计能改进未来决策的记忆系统
  • OpenAI Astra证明10条数学定理,token成本2000美元
  • AI写的代码review发现不了webhook重试bug
  • 融合 NeetCode 150 与 Blind 75 的面试题模式追踪表
  • Agentic 软件工程使人类上下文成为瓶颈
  • CopilotKit 开源 Channels SDK:一套代码把 AI Agent 接入 Slack/MS Teams
  • llm CLI工具发布0.32版本
  • 15分钟构建生产级MCP服务器:无需SDK
  • 为何 AI 编程助手在大型代码库中频频迷失
  • DiffusionGemma 为何快:离散扩散打破自回归从左到右的顺序约束
  • AI 编程助手的批准对话框正在欺骗你:GhostApproval 符号链接漏洞详解
  • Claude Code Subagent 失效?先改 description 字段
  • 用本地 LLM 在打开陌生代码库前先做安全 triage
  • Agent记忆不是聊天历史:工作记忆与长期记忆的本质区别
  • Google Cloud推统一AI模型路由API
  • 实测:我的代码Agent对我技术栈的了解只有40%
  • 基于AWS Bedrock AgentCore的自动化网页洞察提取
  • AI账单是分布式系统问题,不是模型定价问题
  • AI 模型能包揽软件全流程,但几乎都不该那样用
  • 字节 SeedRealtime:原生音视频全双工大模型发布
  • SGL-Diffusion全栈性能优化:AR+DiT推理加速实践
  • GitHub Spark将于8月底正式停用
  • DeepSeek V4 Flash登顶OpenRouter,价格仅为GPT-4的5%
  • obstat库:让Agent决策日志写在执行之前
  • Evals是AI时代的CI:对Agent产出建立验收层
  • 前沿AI模型主动突破沙盒:能力跃升而非漏洞
  • 测试全过但核心检查从未运行:AI写作循环中的认证失效陷阱
  • SAST工具专为AI代码设计:umbra静态扫描
  • Agent交接契约:解决多Agent状态丢失问题
  • AI 代码编辑器横评:Cursor vs VS Code + Copilot vs Windsurf
  • Swarm EventBus 解析:用 35+ Go 包构建事件驱动 AI Agent 系统
  • MCP 协议详解:AI Agent 互操作性的标准基石
  • Cursor vs Copilot vs Windsurf:三大 AI 编辑器真实使用对比
  • 持久化执行:分布式事务外如何保证步骤只执行一次
  • AI 内存需求激增,存储架构同步升级
  • pgvector vs Pinecone vs Qdrant:何时该用专用向量数据库
  • 你的 AI agent 在测试上撒了谎
  • 阿里Qwen3.8-Max发布:开源外套下的API商业模式
  • 面向工程师的实用Prompt工程模式
  • 开源项目:把团队代码规范封装成 Claude Code/Codex Agent 技能
  • 已加载 51 / 8356
8.0
热点
AI SCORE
模型发布2026-08-05 00:43

DiffusionGemma 为何快:离散扩散打破自回归从左到右的顺序约束

dev.to · AI#Google#DiffusionGemma#大模型
Editor brief · 编辑速览

Google DeepMind 发布 DiffusionGemma,采用离散扩散替代传统自回归生成,在单卡 H100 上达到约 1500 tokens/秒,显著快于同规模 Gemma 4 自回归方案。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Google DeepMind 本周发布了 DiffusionGemma,一款使用离散扩散而非传统逐 token 循环生成文本的开源语言模型。

这听起来像是论文细节,但当你看到推理数字时就不一样了。报告称 DiffusionGemma 在单块 H100 上平均每次前向传播约 20 个 token,输出吞吐量约为每秒 1500 个 token。同等条件下,使用多 token 预测的 Gemma 4 自回归基线约为每秒 303 个 token。

这个数字值得关注。不是因为所有模型都要变成扩散模型。而是因为 LLM 推理中那个无聊的瓶颈依然是瓶颈,而这是目前对这个问题最清晰的攻击路径之一。

自回归模型容易理解。模型写下一个 token,再写下一个,再下一个。这种从左到右的约束也是一种代价。即使有推测解码,目标模型仍然需要验证一个草稿序列,而有效的加速取决于它接受多少草稿。

DiffusionGemma 尝试了另一种方案。它从 Gemma 4 26B A4B 起步,然后微调成文本扩散模型。它不是一次提交一个 token,而是在 256 个 token 的画布上并行去噪一个块。报告显示,实际上它使用约 12 步去噪,所以每次前向传播约处理 20 个 token。

这将工作从"为每个 token 移动权重和缓存"转向"每步消耗更多算力,但减少步数"。在现代加速器上,这可能是正确的权衡。

如果你主要通过聊天窗口与 LLM 交互,这很容易被低估。对于一个阅读单个答案的人类来说,每秒 500 个 token 和每秒 1500 个 token 都感觉是"足够快"。但对于 Agent 系统,差异就远不止表面那么简单了。

Agent 在循环中消耗延迟。搜索、总结、检查、打补丁、运行测试、修改。一个向模型提问二十次的工作流不仅关心最终答案质量,还关心尾延迟、每用户吞吐量,以及机器是否在 GPU 闲置时等待内存搬运。

这就是为什么我喜欢这个发布比又一个新的基准排行榜更值得。DiffusionGemma 不是在说"我们找到了更好的聊天机器人人格"。它说的是推理的形态可以改变。

代价是真实存在的。扩散模式在原始能力上并没有超越 Gemma 4 AR 基线。在报告的表格中,DiffusionGemma 在 AIME 2026 上得分 69.1,而 Gemma 4(MTP)为 88.3;在 LiveCodeBench v6 上为 69.1 对 77.1;在 GPQA Diamond 上为 73.2 对 82.3。模型更快了,但不是魔法般地更聪明了。

局限性部分也难得地具体。作者指出了输出较短、偶尔出现 token 结巴、多模态思考标签问题,以及吞吐量优势在高 batch 大小时会衰减的事实。在大约 32 个并发用户以下,DiffusionGemma 可以在吞吐量上获胜。超过这个数字,每 token 更高的算力成本让自回归推理可以追回来。

所以实际的理解不是"扩散取代自回归"。而是"路由变得有趣了"。

对于低并发、延迟敏感的工作,扩散解码可能是正确的模式。对于困难推理、长输出或高 batch 推理,自回归解码可能仍然是更安全的默认选择。DiffusionGemma 保留 AR 模式正是为了这个原因。有用的系统可能是混合的,而不是意识形态的。

这符合 LLM 基础设施的发展方向。赢家很少是一种模型模式到处通用。是一个知道何时为准确性付费、何时为速度付费、何时一个更短、更弱的答案是正确工程决策的路由器。

开源部分也很重要。封闭的扩散文本 API 有趣,但不能让开发者检查或适配多少。一个 Apache 许可的模型,在 Hugging Face Transformers 和 vLLM 中有参考支持,给社区一个真实的基线,可以分析、拆解、微调和与通常的 AR 堆栈比较。

炒作版本说文本扩散是 LLM 的未来。

有用的版本更小。逐 token 解码并非神圣不可侵犯。它是一个有着非常昂贵代价的设计选择。DiffusionGemma 提醒我们,AI 剩下的一些最大收益可能来自改变管道,而不是来自制作另一个稍微大一点的模型。

我会选择这种进步。它不如新的基准桂冠那么华丽,但它是那种可以让 Agent 工作流不再像等待一台非常昂贵的打字机的东西。

你会首先在哪里使用这个更快但稍弱的模式?

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
为何 AI 编程助手在大型代码库中频频迷失
下一篇
AI 编程助手的批准对话框正在欺骗你:GhostApproval 符号链接漏洞详解