OpenAI 为企业客户推出的 Ultrafast 模式通过重构推理管道和专用硬件加速,将每 Token 平均延迟从 950ms 降至 68ms,适用于对延迟敏感的业务场景。
Photo by Microsoft Copilot on Unsplash
TL;DR:OpenAI 的全新 Ultrafast 模式让 GPT‑5.6 Sol 的查询响应速度提升至多 14 倍,这是一项面向需要低延迟 AI 的企业客户的预览功能。
AI 世界刚刚迎来一次速度升级。OpenAI 宣布为其最新旗舰模型 GPT‑5.6 Sol 推出名为 Ultrafast 的性能导向模式预览版。通过重新架构推理流水线并利用专用硬件,OpenAI 声称新设置可将响应速度提升至标准版的十四倍。此举明确表明该公司正在争取那些无法承受延迟瓶颈的大型企业客户。
Ultrafast 不是一个新的模型,而是叠加在 GPT‑5.6 Sol 之上的配置层。OpenAI 工程师精简了 token 生成循环,引入了激进的并行策略,并借助专用 AI 加速器集群。由此实现了每个 token 处理时间的大幅削减,同时保留了模型 1750 亿参数的知识库。
在内部基准测试中,OpenAI 报告 Ultrafast 模式下每个 token 的平均延迟为 68 毫秒,而默认模式为 950 毫秒——提升幅度达 14 倍。这种速度提升在实时聊天助手、文档摘要流水线、自动化代码审查工具等高吞吐场景中尤为显著。OpenAI 强调该模式仍处于预览阶段,意味着开发者可以在有限的配额上测试,之后再全面推广。
企业 AI 项目通常在一个指标上栽跟头:延迟。一个客服机器人用半秒回答显得干脆利落;同样的机器人如果卡顿三秒则会侵蚀用户信任。通过提供低延迟层级,OpenAI 解决了长期以来阻碍大型语言模型在关键任务工作流中采用的一个痛点。
该预览版还捆绑了更严格的服务等级协议(SLA)以及 OpenAI 支持团队的优先访问权限。对于金融、医疗、电商等领域——毫秒级差距可能转化为收入或合规风险——这些保障与原始速度一样有价值。此外,Ultrafast 配置在设计时考虑了成本效益;OpenAI 表示,加速推理运行在与标准模型相当的按 token 计费定价层级上,这得益于底层硬件的效率。
早期采用者,包括一家跨国零售连锁和一家基于云的法律研究平台,已报告队列等待时间缩短、用户满意度评分提高。两家公司都强调,速度提升使他们能够在不按比例增加计算支出的情况下扩展 AI 驱动的功能。
OpenAI 发布了一套公开基准测试,将 Ultrafast 与常规 GPT‑5.6 Sol 在三种常见工作负载下进行对比:对话式问答、长文本摘要和代码生成。总体而言,Ultrafast 实现了 12 到 15 倍的延迟降低,同时将原始模型的精度指标(BLEU、ROUGE 和 CodeBLEU)保持在 1% 以内。精度的轻微下降归因于更激进的 token 采样策略,OpenAI 表示这可以针对每个应用进行调整。
目前预览版可通过 OpenAI API 中一个新的 ultrafast 标志访问。开发者必须通过 OpenAI 控制台申请访问权限,在那里可以分配部分 token 配额用于测试。OpenAI 计划于今年晚些时候分阶段推出,正式商业化预计在 2027 年初。
Ultrafast 使 OpenAI 成为企业 AI 市场上一个有力的竞争者,在那里速度和可靠性往往比原始模型规模更重要。通过在不必付出高昂价格代价的情况下实现 14 倍的延迟降低,OpenAI 为企业提供了一条将尖端语言能力嵌入实时产品的务实路径。该预览版很可能在未来几个月内塑造大型语言模型面向高性能使用场景的打包方式。