OpenAI 为 GPT-5.6 Sol 新增 Ultrafast 模式,声称延迟降低 14 倍,面向语音助手、实时客服、多步 Agent 管道等低延迟场景。
OpenAI 近日为 GPT-5.6 Sol 模型预览了一款全新"Ultrafast"(极速)模式,宣称响应速度最高可达标准模式的 14 倍。该消息以预览形式发布,而非完整版本发布,目标使用场景是此前因响应延迟过高而难以部署大语言模型的领域。
根据预览内容,Ultrafast 模式主要面向需要几乎即时回复的应用场景——语音助手、在线客服聊天,以及实时 Agent 流水线。在这类流水线中,单个用户请求可能在最终答案返回前触发多轮连续的模型调用,即便每轮调用只有微小延迟,累积起来也相当可观。OpenAI 的表述表明,该模式正是为了解决这种延迟叠加效应而设计。
关于提速的具体实现方式,预览资料中并未完全披露。撰写本文时,OpenAI 尚未公开 Ultrafast 模式究竟是使用了 GPT-5.6 Sol 的蒸馏或量化版本、不同的服务基础设施,还是两者结合。此外,该模式是否会采用与标准 GPT-5.6 Sol 不同的定价策略、是否会在上下文窗口或功能集上有所缩减——这些都是其他厂商此前推出"快速"模型层级时伴随的权衡——目前也都未得到确认。预览公告中未提及定价及正式可用时间。
该预览不包含独立基准测试数据,因此"14 倍"这一数字目前应视为 OpenAI 自身声明,而非第三方验证结果。历史上,模型厂商引用的速度倍数在很大程度上取决于所测量的具体任务、提示词长度和输出长度,企业实际业务负载中获得的速度提升往往比宣传数字更为保守。
对于已在生产环境中运行 GPT-5.6 Sol 的企业——无论是用于工单分类、销售线索评分,还是内部运维 Copilot——务实的下一步是等待正式发布或获得授权的早期试用机会,再做架构层面的决策。将延迟敏感的workflow切换到预览阶段的模式存在风险:预览功能可能在不遵循正式版本通知周期的情况下变更行为、定价或可用性。正在评估语音或实时聊天自动化的团队,应将此次公告视为未来几周内重新审视供应商选择标准的理由,但不应将"14 倍加速"视为适用于自身特定提示词模式的保证,除非 OpenAI 发布更完整的技术文档或该模式退出预览状态。
除"预览"外,公告未给出任何发布 timeline,OpenAI 也未表明现有 GPT-5.6 Sol 客户中有哪些(如果有的话)将在更广泛发布前获得早期访问权限。