Seed Diffusion——LLM 并行推理的新路径
探讨通过并行扩散策略加速 LLM 的学习和推理速度,试图突破传统顺序处理的瓶颈。理论性较强,实际应用途径待观察。
探讨通过并行扩散策略加速 LLM 的学习和推理速度,试图突破传统顺序处理的瓶颈。理论性较强,实际应用途径待观察。
2025 年 8 月 4 日,字节跳动 Seed 团队与清华大学 AIR 研究院发布了一项研究预览,立刻在 AI 圈引发热议:Seed Diffusion——一个基于离散状态 diffusion、专注于代码的大规模语言模型,而且速度快得毫不掩饰。
arXiv 摘要开门见山:
“Seed Diffusion Preview 在 H20 GPU 上实现了每秒 2,146 token 的推理速度,同时保持了有竞争力的性能……在代码模型的速度—质量 Pareto 前沿上建立了新的 SOTA。”
如果你一直关注 AI 的发展方向,就会知道这不仅仅是一个亮眼的数字——它体现了 AI 正在向更高效率和更强适应性转变。更大的模型未必总是更好;真正更智能的工作流,往往来自那些重新思考模型输出生成基本原理的架构。
传统 LLM(比如 GPT 风格的 Transformer)就像一位打字缓慢的人——每次只输出一个 token。Seed Diffusion 则彻底颠覆了这种方式,它更像一条并行运转的文本装配线。它采用两阶段训练课程:先进行基于 mask 的破坏阶段,再进行基于 edit 的扰动阶段,以学习序列的全局结构。再结合 constrained-order learning、on-policy optimization 和 block-level sampling,最终得到一个能够以大规模并行分块方式生成 token 的系统。
这并不只是实验室里的技巧。对于实时编程这类工作流,超高速推理意味着等待输出的时间更少、迭代想法的时间更多——无论你是在交付一项功能、调试一个棘手的函数,还是向长期记忆层输入信息(我们在《Someday Is Already Here》中讨论过这一点),让你的 AI 助手能够即时回忆并适应当前情境。
Seed Diffusion 的速度达到每秒 2,146 token,大约是同等规模 Transformer 模型的 5.4 倍。这并不只是为了“刷赢 benchmark”,而是在创造一种 AI 工具能够即时响应的体验——就像与一位同事结对编程,你甚至还没打完字,对方就已经补全了你的想法。
这与我们一直在讨论的 AI 扩展成本问题一脉相承:强大的原始算力当然很好,但当速度与效率跨过某个临界点时,就会催生全新的工具类别。对于 Pieces 这样的团队来说,更快且高质量的生成能力,可能正是被动响应式助手与主动式助手之间的分水岭——后者能够在你的工作流进行过程中,主动呈现恰到好处的上下文。
这股热潮并没有停留在字节跳动内部。Nando de Freitas 称 Seed Diffusion 的速度快得惊人,并暗示 diffusion LLM 在某些使用场景中可能与 Transformer 分庭抗礼。
AI Native Foundation 则从更宏观的角度评价它:
一项“重大进展……展现了 diffusion 模型超越 autoregressive 方法的潜力”。
而对于长期、由记忆驱动的 AI 工作流来说,这正是关键所在:借助 Seed Diffusion 这样的模型,上下文检索与信息综合可以快到让你的 AI 伙伴呈现出连续工作的感觉——它不再是一台走走停停的机器,而是自然、流畅地融入你的工作。这与我们探讨 NVIDIA 对 SLM 的愿景时所谈到的跨越如出一辙:更小、更快的模型,依靠的不是暴力堆算力,而是与现实任务更好地融合。
诚然,AI Twitter 很喜欢亮眼的速度数据,但 Seed Diffusion 并不只是一条转瞬即逝的头条新闻。它以实际成果证明,diffusion 架构不仅能用于图像或视频生成,在语言领域同样具备竞争力。对于所有思考如何构建可扩展、自适应 AI 系统的人来说,这一点意义重大——其中也包括那些需要长期维护个人或团队记忆的工具。
对从业者而言,这并不是一个抽象的“AI 未来”故事,而是在邀请我们重新思考:速度与上下文的结合,将如何塑造下一代 AI 工作流。Seed Diffusion 这样的模型,或许正是连接两类模型的桥梁:一端是我们一直在使用的庞大、缓慢的通才模型,另一端则是我们真正需要的敏捷且高度相关的助手。