OpenAI联合Cerebras推出第三档推理模式,GPT-5.6 Sol最高达750 output tokens/s,形成Standard/Fast/Ultrafast三层定价结构,标志速度成为独立产品特性。
OpenAI 发布了其全新「Ultrafast」模式的预览版,其旗舰模型 GPT-5.6 Sol 可实现每秒最高 750 个输出 tokens。
这一推理加速来自 Cerebras,后者于今年早些时候与 OpenAI 签署了一项百亿美元级别的合作协议。该服务初期仅通过 OpenAI API 向 GPT-5.6 Sol 的部分客户提供使用权限。OpenAI 计划随容量增长逐步扩大访问范围。有意加入的企业可通过表单登记以获取最新动态。
更快的输出开辟了新用例
OpenAI 表示,Ultrafast 旨在将小型模型的速度与大型推理模型的完整能力相结合,从而实现该公司所称的「每秒更高的工作效率」。例如,在事件响应期间,工程师可以在故障仍在发生时对日志、代码变更和报告进行分析,帮助他们准确定位原因并实时准备修复方案。OpenAI 已内部将此模型用于此目的。
OpenAI 还介绍了其他几个应用场景。在金融领域,该模型可以在市场条件仍在变化时评估市场信号并标记可疑交易。在客户支持场景中,复杂查询可以实时解决,即便找到答案需要多个步骤或系统。在电商领域,它可以在犹豫不决的买家放弃购物车之前回答产品问题、检查库存水平并提供个性化推荐。
视频:在 Ultrafast 模式下生成 3D 仓库模拟器,左侧显示
研究是 OpenAI 重点关注的另一个领域。之前需要过夜批量运行完成的实验可以转变为交互式工作会话,让团队能够测试一个想法、查看结果、调整方法,然后重新启动下一轮运行,而不打断自己的工作流程。
OpenAI 将 AI 速度转化为定价杠杆
OpenAI 已在推理速度上实现了分层货币化。通过 API,它提供了一种「Fast Mode」,以大约两倍的价格为 GPT-5.6 Sol 提供更低的延迟和最高 2.5 倍的速度。Ultrafast 则增加了一个第三层——更快、也可能更贵的层级。
这一逻辑与 AWS 等云服务商的模式如出一辙,后者长期以来对同等服务收取更高的性能档位费用。OpenAI 正在将这一模式应用于 AI 推理。如果速度成为各行业的瓶颈,这种分层模式将使 OpenAI 直接从更快推理所创造的收益增长中分得一杯羹。
AI 新闻,不追热点——人工精选
订阅 THE DECODER,享受无广告阅读、每周 AI 时事通讯、六期年度专属「AI Radar」前沿报告、完整档案访问权限,以及评论区域参与权。