GPT-5.6 Sol通过Cerebras硬件实现约750输出tokens/秒,比标准模式快14倍。作者分析指出,Agent循环中每个步骤都累积延迟,高速使生成多候选方案、自我验证等原本不可行的设计变为可能。
OpenAI 本周为 GPT-5.6 Sol 开放了 "Ultrafast" 模式的有限预览,基于 Cerebras 硬件,跑出了约每秒 750 个输出 token 的速度——比标准模式快最多 14 倍。这个数字很容易被归类为"不错,聊天更快了",然后翻篇。我觉得这低估了它带来的改变。
在单次聊天中,速度只是体验优化。在 agent 循环里,速度是能力倍增器——两者的区别才是关键所在。
单次 completion 的延迟最坏不过让人烦躁。但 agent 不会只做一次 completion,它做的是一条链:读取上下文、做决策、调用工具、读取结果、再做决策、可能还要回退重试。每一步都要交延迟税,税收会累积。十步任务用正常速度,跑完够喝杯咖啡;同样任务 14 倍速,只需几秒。
这不只是少等待的问题。它改变了哪些 agent 设计值得去做。当每次模型调用在时间上变得廉价,你就能负担得起那些以往根本无法忍受的循环:生成五个候选方案再选最优、每次工具结果返回后重新规划、在展示给你之前对 agent 自己的输出跑一遍验证。这些都会让你的调用次数翻倍,而所有这些都受制于:你能在整个流程感觉崩溃之前堆叠多少延迟。把单次调用延迟降低 14 倍,那些"理论上更好但太慢"的模式就只是更好。
我之前论证过,模型外围的框架比模型本身更重要。速度其实是框架的一种隐藏属性——它决定了你能在人类放弃等待之前,让循环做多少"边想边说"、重试和自我检查。
另一方面值得注意的,是这个速度从何而来。它不是常规 GPU 上的软件把戏——而是 Cerebras,一种为此专门构建的完全不同架构的芯片。之所以强调这一点,是因为它指向了下一波增益的来源。
模型质量正在趋同,价格也在下降。差异化的前沿正在转向推理层——专用硅片、投机解码、路由、服务层的技巧。"同一个模型,截然不同的运行特性"会成为反复出现的头条,这意味着你选择 provider 时,所选的不再是模型本身,而是他们运行模型的方式。延迟、吞吐量和速度下的成本成为一等的选择标准,不再是脚注。
暂时还不会动手——这只是有限预览,在预览级可用性上构建会让你最终不得不重写。但我会开始按照这个速度会广泛到来来设计,因为它确实会。
具体来说:如果你因为觉得多轮 agent 模式太慢而一直回避,请近期重新审视这个判断。今天"延迟成本太高"的验证循环和 N 选一设计,就是明天的默认方案。准备好用廉价快速推理的团队,已经有了为此设计的循环;仍在做单次调用的团队,将会把收益拱手相让。
如果你的工作负载中,单次调用延迟正是阻止你加入自我检查或重新规划步骤的原因,那这个负载就是最先指向快速推理的那个。对你来说,是哪一个?我在收集"如果调用快 10 倍我就加这个循环"的例子。