介绍基于扩散过程而非自回归的大语言模型架构,号称性能提升,但具体优势和工程可行性需深入验证。
如果你熟悉 AI 生成图像,你可能听说过扩散模型。它们从噪声开始,逐步细化成连贯的图像。
那么,有人就想到了一个聪明的点子:如果我们对文本也这样做会怎样?这正是扩散语言模型(dLLMs)做的事!与传统 LLMs(如 GPT-4 或 Llama 3.2)一次预测一个 token 不同,dLLMs 生成整个文本序列,并通过多个步骤来细化它;这意味着更快、更结构化、更"聪明"的文本生成。
虽然不是同类中的第一个[^1],但 Mercury 是首个商业规模的 dLLM。它最近由 Inception Labs 发布,已经吸引了大量关注!为什么?因为它在 NVIDIA H100 上可以每秒生成超过 1000 个 token —— 性能远超传统模型,同时保持高质量。如果你曾经等待过缓慢的 AI 响应,你就知道这为什么是个大事件。
对于开发者来说?有 Mercury Coder,一个优化用于编写代码的版本。基准测试表明它的性能与 gpt-4o-mini 和 Claude 3.5 Haiku 相当,但速度快 10 倍。想象一下获得即时代码补全,同时保持高质量 —— 这是个游戏规则改变者!
除了速度,dLLMs 还提供其他一些优势:
更好的推理;由于它们通过多个步骤细化文本,它们可以在生成响应时发现错误并改进连贯性。
多模态潜力。扩散模型已经驱动了文本转图像、视频和音乐 AI —— 所以想象一个统一的 dLLM 能做什么。
更多控制。结构化生成意味着更好的函数调用和更可靠的输出。
dLLMs 的推出标志着 AI 开发的重大转变。它们有潜力革新聊天机器人、代码生成和长篇内容创作。扩散模型将图像 AI 提升到了新的水平,对文本也可能做到同样的事。
想要了解更多?访问 Inception Labs 网站了解详情!
你怎么看?dLLMs 是下一个大事件,还是只是另一个 AI 实验?让我们在评论中讨论吧!
图片来源:https://inceptionlabs.ai 文章作者:BestCodes
[^1]: 并非同类中的第一个:其他非商业规模的 dLLMs 已经被开发出来。见例如:https://arxiv.org/abs/2310.17680