OpenAI 联合 Cerebras 硬件推出 Ultrafast 模式,吞吐量较标准模式提升 14 倍,目标场景为事件响应、金融、电商等延迟敏感型企业应用。
OpenAI 于 8 月 13 日推出 GPT-5.6 Sol 的 Ultrafast 模式,号称速度提升 14 倍,达到每秒 750 个 token。该预览版由 Cerebras 硬件驱动,面向延迟敏感的 Enterprise 工作负载。
Ultrafast 模式比标准 GPT-5.6 Sol 快 14 倍
号称峰值吞吐量为每秒 750 个输出 token
由 Cerebras 晶圆级 AI 硬件合作提供支持
截至 2026 年 8 月 13 日,预览版仅对小范围客户开放
面向事件响应、客服、金融、电商场景
OpenAI 新的 Ultrafast 模式标志着这家实验室在推理速度策略上的一次转变。公司没有选择缩小模型或部署专用变体,而是让 GPT-5.6 Sol 保持完整能力,同时将吞吐量提升至每秒 750 个输出 token——比标准处理快 14 倍。据 TechCrunch 报道。
该功能由 OpenAI 与芯片制造商 Cerebras 的合作提供支持,Cerebras 专注于晶圆级 AI 加速器。这不是蒸馏也不是量化 tricks,而是对旗舰模型的原始硬件加速。公司将其价值定位为"每秒更多有用工作",这个表述预示着模型质量与响应时间之间旧有权衡的告别。
为何延迟成为新战场
对于企业买家而言,速度的逻辑很简单:更快的推理意味着高吞吐量工作流中更低的单次完成成本。OpenAI 正将 Ultrafast 定位用于事件响应、客服、金融市场分析和电商——这些领域里,几百毫秒的额外延迟直接转化为收入损失或告警遗漏。
Anthropic 的 Claude 也有快速模式,但并未达到相同吞吐量。TechCrunch 指出,Claude 的加速选项未能达到 OpenAI 宣称的每秒 750 个 token。这一差距至关重要,因为 Anthropic 一直在代码和 Agent 工作流方面赢得企业信任,而 token 吞吐量直接影响任务完成时间。
预览版目前仅对小范围客户开放。OpenAI 表示将"随着容量增长"扩大访问权限,但未披露定价或正式可用日期。公司也未说明该模式背后使用的是哪种 Cerebras 硬件配置,以及每秒 750 个 token 是峰值还是持续速率。
这次发布与其说是新模型,不如说是基础设施杠杆。OpenAI 实际上在将 Cerebras 的晶圆级工程能力货币化,而无需收购芯片制造商。这场合作为 OpenAI 提供了差异化的速度宣称,同时 Cerebras 获得了一个旗舰客户证明点——这段关系与此前 OpenAI 与 Groq 之间从未达成协议的讨论如出一辙。
值得注意的是时机。OpenAI 早在 8 月 11 日就推出了 GPT-5.6-Cyber,距今仅两天,显示出将旗舰模型分割为专用部署模式的更广泛意图。Ultrafast 是性能细分;Cyber 是安全细分。策略是在不同企业痛点上销售相同的基础模型,而不是强迫客户在速度和能力之间二选一。
对于开发者和运维人员而言,实践问题是 Ultrafast 是否改变了 Agent 工作流的成本方程式。如果 14 倍加速在生产环境中成立,那么在 GPT-5.6 Sol 上运行的类 Claude Code 工作流可以以一小部分实际时间完成多步骤任务。这将给 Anthropic 带来压力——要么匹配吞吐量,要么单独以推理质量来证明溢价合理。
OpenAI 以 14 倍速度和 750 tokens/s 推出 GPT-5.6 Sol 的 Ultrafast 模式,由 Cerebras 提供支持。
预览版仅对小范围客户开放,面向延迟敏感的企业工作流。
关注 OpenAI 的下一次容量扩展公告,以及 Cerebras 是否披露具体硬件配置。如果 Anthropic 以更快的 Claude 模式或自己的吞吐量基准回应,速度之争将从营销宣称走向可衡量的企业 SLA。同时关注 Ultrafast 定价是否高于标准 GPT-5.6 Sol token。

最初发表于 gentic.news