GPT-5.6 SolUltrafast 模式达 750 token/s,比 Fable 5 快 11 倍;Humanity's Last Exam 只需 11 小时完成。
OpenAI 和 Cerebras 联合发布了 Ultrafast Mode,这是一款推理加速层,使 GPT-5.6 Sol Ultrafast 成为 API 中可用的最快前沿模型,输出速度高达每秒 750 个 token。该公告于 2026 年 8 月 13 日发布,标志着前沿实验室首次在其自有基础设施内以这种速度提供旗舰模型。
在此之前,使用大模型必须在智能和速度之间做出取舍。Ultrafast 则承诺消除这种两难困境,尤其适用于分秒必争的场景:生产事故响应、网络攻击抵御,或者那些不再需要用户切换标签页等待回复的 Agent。
Cerebras 与 OpenAI 于 2026 年 8 月 13 日联合推出 Ultrafast Mode,率先在 OpenAI API 中可用。GPT-5.6 Sol 在 Ultrafast 模式下可达每秒 750 个 token 的输出速度,且不损失质量。根据 Artificial Analysis 的数据,这一速度比 Fable 5 快 11 倍,比 Opus 4.8 在 Fast 模式下快 5 倍。在 Humanity's Last Exam(2500 道题)中,Ultrafast 在 11 小时 11 分钟内完成全部作答。Fable 5 完成同一考试需要 78 小时 27 分钟,慢近 7 倍。在 GDP-Val 基准测试中,Ultrafast 实现端到端 5.6 倍加速,且质量不衰减。访问权限目前为限量预览,将随容量增长逐步扩大。速度优势源于 Cerebras 的 Wafer-Scale Engine:每芯片 44 GB SRAM,无外部 HBM。
公告发布于 Cerebras 官方博客,由 Joyce Er 署名,标题为《Accelerating GPT-5.6 Sol Ultrafast with OpenAI》。文中解释称,Ultrafast Mode 是一种新的服务级别,率先在 OpenAI API 内推出,运行于 Cerebras 硬件之上。目前访问权限限于精选客户群体,随安装容量增长逐步扩大。
汇总一切的数字是:每秒 750 个 token 的输出速度。根据 Artificial Analysis 报告的数据,GPT-5.6 Sol 在 Ultrafast 模式下运行速度比 Claude Fable 5 快 11 倍,比 Claude Opus 4.8 在 Fast 模式下快 5 倍。这一对比并非针对任意模型:Fable 5 和 Opus 4.8 当前是复杂代码和分析任务中最常用的两款推理模型。
为证明速度并未以智能为代价,Cerebras 用 GPT-5.6 Sol Ultrafast 运行了 Humanity's Last Exam(HLE)考试。HLE 汇集了 2500 道博士级别的化学、经济、文学等学科题目,意在让当前任何模型都难以全部轻松解答。Ultrafast 在 11 小时 11 分钟内答完了全部 2500 道题,使用的是带 xhigh 推理级别的 Codex。Claude Fable 5 搭配 Claude Code 和同级推理能力,耗费 78 小时 27 分钟(超过三天连续计算)才达到可比的精度。
换言之:Fable 5 需要整整一个周末完成的工作,Ultrafast 在一个工作日内就完成了,精度相当,速度快了近七倍。
Cerebras 在这一领域并非新面孔。该公司多年来一直押注于与传统 GPU 不同的架构:不是用外部网络连接小芯片,而是制造单一芯片,使其与整片硅晶圆等大(wafer-scale),从零开始设计用于无瓶颈地移动 AI 数据。这一方案此前已用于为 Llama 等开源模型以及最近的代码模型提供快速推理。
此次公告的新亮点是与 OpenAI 的直接合作,在 OpenAI 自有基础设施内加速一款闭源前沿模型。此前,极致推理速度(每秒数百 token)通常是中型开源模型的专利,由 Groq 或 Cerebras Cloud 等专业提供商运行。将同等速度应用于具有 GPT-5.6 Sol 推理质量的闭源前沿模型,是一次质的飞跃。
公告引用了 Cerebras 博客中的两段声明。OpenAI 产品负责人 Rohan Varma 将其概括为让 AI 跟上你思考、编程和协作节奏的方式。OpenAI 研究员 Jeffrey Wang 指出,以前需要几分钟的任务现在在切换任务之前就完成了,这在实际上消除了并行 Agent 会话之间切换上下文的成本。Cerebras 的晶圆在芯片上保留了 44 GB SRAM。
速度背后的技术原因在于 Cerebras 如何解决数据移动问题。在传统 GPU 中,每个 token 的生成都迫使模型权重从芯片外的 HBM 内存反复搬运到计算芯片。模型越大,这种往返旅行就越重:瓶颈不在于芯片能计算多少,而在于喂数据需要多久。
Cerebras 从芯片的物理设计入手解决这一问题:在每片晶圆上直接封装 44 GB SRAM——芯片上最快的内存——将模型权重保留在那里,不再移动。Token 流经模型的各层,在晶圆之间流水式分布(pipelined),无需频繁中断去外部取权重。Cerebras 声称,随着模型增长,这一设计扩展性相当可观,使其在未来前沿模型中保持速度优势。
flowchart TD
A["Pesos del modelo"] --> B{"Arquitectura"}
B --> C["GPU: HBM externa"]
B --> D["Cerebras: SRAM en el wafer"]
C --> E["Transferencia repetida por token"]
D --> F["Pesos residen on-chip"]
E --> G["Cuello de botella de ancho de banda"]
F --> H["Tokens fluyen sin interrupcion"]
| 模型 / 模式 | 报告速度 | 与 Ultrafast 对比 |
|---|---|---|
| GPT-5.6 Sol(Ultrafast,Cerebras) | 最高 750 token/s 输出 | 基线 |
| Claude Opus 4.8(Fast 模式) | Anthropic 未公布 | 据 Artificial Analysis 慢 5 倍 |
| Claude Fable 5 | Anthropic 未公布 | 据 Artificial Analysis 慢 11 倍 |
在 GDP-Val 基准测试(衡量具有实际经济价值的知识工作任务的测试,包括法律报告、财务模型、工程报告)中,Ultrafast 实现了端到端 5.6 倍加速,与 GPT-5.6 Sol 标准模式相比质量没有下降。该测量由 Cerebras 于 2026 年 7 月 31 日使用 GPT-5.6 Sol 和 GPT-5.6 Sol Ultrafast 在 Codex 中以中等推理级别进行。
💭 关键点:收益不仅是原始速度:GDP-Val 衡量的是具有实际经济价值的任务,历史瓶颈基本上就是等待模型写完。
要确认你的账户是否有访问权限,最简单的方法是列出已启用的模型:
curl https://api.openai.com/v1/models \
-H "Authorization: Bearer $OPENAI_API_KEY" \
| grep -i "ultrafast"
此命令列出你账户中已启用的模型;如果你有 Ultrafast 预览版访问权限,会看到带有 ultrafast 后缀的模型标识符。在访问权限持续受限期间,缺少该标识符就是确认你的账户尚未启用的最直接方式。
Ultrafast Mode 目前仍是限量预览版,因此第一步是从 Cerebras 官网申请访问权限,或等待 OpenAI 在你的账户中启用。与此同时,你可以提前准备好代码,以便在功能激活之日立即使用,方式与你在标准模式下使用 GPT-5.6 Sol 的 SDK 完全相同。
安装 OpenAI 官方 SDK 在 Windows、macOS 和 Linux 上步骤一致,因为它基于 pip 或 npm 运行:
# Windows (PowerShell), macOS 和 Linux
pip install --upgrade openai
# Node.js 替代方案,三系统指令相同
npm install openai
SDK 安装完成后,调用模式不变:你继续使用 responses.create,只需指向 OpenAI 在你的账户启用时为 Ultrafast 变体分配的模型标识符。一个实际用例,客户端测量每秒 token 数:
import time
from openai import OpenAI
client = OpenAI() # 从环境变量读取 OPENAI_API_KEY
inicio = time.perf_counter()
respuesta = client.responses.create(
model="gpt-5.6-sol-ultrafast", # 预览版名称可能变更
input="Resumi en 5 puntos el ultimo incidente de produccion.",
reasoning={"effort": "medium"},
)
duracion = time.perf_counter() - inicio
tokens_salida = respuesta.usage.output_tokens
print(f"{tokens_salida / duracion:.1f} tokens/segundo")
最后这个 print 是最直接的方式,可以在自己的账户上确认运行的是 Ultrafast 还是标准模式:如果数字在每秒数十个 token 左右,那你仍在使用 Standard;如果接近每秒数百个 token,那你已经在用 Ultrafast。
公告中引用最多的应用场景是事故响应:运营 Web 服务的团队可以使用 Ultrafast 在损失宝贵分钟数(影响 SLA)之前找到宕机根源并部署修复。对于需要检测并遏制活跃攻击者的安全团队,这一点更为紧迫。推理速度在时钟倒计时对抗中尤为关键。但最有趣的改变并非速度本身,而是速度所解锁的可能性:Agent 不再强迫用户切换任务。如果 Agent 需要几分钟才能回复,用户会打开另一个标签页,失去思路,之后再回来查看结果。如果 Agent 在几秒内回复,用户可以保持专注与其协同工作。这正是 OpenAI 的 Jeffrey Wang 在公告中描述的:以前需要等待的任务现在在切换上下文之前就完成了。
⚠️ 注意:Ultrafast 并非在所有场景下都取代标准模式。Cerebras 明确表示,Ultrafast 适合用于关键路径上的工作,而标准处理则用于并行化常见任务——在这些场景中,单个响应的延迟不如总成本重要。
这一细节至关重要:并非所有任务都需要每秒 750 个 token。批量运行数百个摘要、索引文档或分类工单等工作,总批处理性能比单个响应延迟更重要,标准模式仍然是成本效益更高的选择。
目前 Ultrafast Mode 仍是限量预览:Cerebras 表示,随着已安装晶圆容量的增长,访问权限将逐步扩大,但尚未给出全面可用日期。该服务级别的每 token 价格也尚不可知,考虑到这种计算能力比标准推理更昂贵,这是合理的。
有一点是明确的: 如果这种晶圆级架构在模型增长时保持速度优势——如 Cerebras 所言——那么对业界其他玩家(Nvidia、Groq、AMD)而言,问题将不再是单个芯片能容纳多少智能,而是能在不丢失智能的情况下维持多少每秒 token 数。
亲自试试:在 Cerebras 官方公告页面申请预览访问权限,并提前准备好上面的代码片段,以便在账户激活之日立即使用。
📖 Telegram 摘要:在 Telegram 查看摘要
什么是 Ultrafast Mode?
这是一种面向 GPT-5.6 Sol 的新型推理服务级别,率先在 OpenAI API 中推出,运行于 Cerebras 的 Wafer-Scale Engine 硬件之上。可在不牺牲质量的前提下生成最高每秒 750 个 token 的输出。
它与标准模式的 GPT-5.6 Sol 有何不同?
模型相同;变化的是推理基础设施。Ultrafast 运行在 Cerebras 芯片而非 GPU 上,优先考虑单个响应的最低延迟,而非大批量处理的总成本。
我现在可以使用 Ultrafast Mode 吗?
只有属于预览版精选客户群体才能使用。Cerebras 和 OpenAI 计划随安装容量增长逐步扩大访问权限,但尚未确认全面可用的日期。
什么是 Humanity's Last Exam?
这是一套包含 2500 道博士级别学科题目(化学、经济、文学等)的考试,旨在衡量 AI 模型与人类可验证知识极限的距离。
Cerebras 是否与 Nvidia GPU 直接竞争?
不完全在同一领域:Nvidia 以 GPU 主导训练和通用推理,而 Cerebras 凭借其晶圆级芯片专注于低延迟推理,面向每次响应速度至关重要的 workloads。
什么类型的任务最能受益于 Ultrafast?
那些处于问题关键路径上的任务:生产环境宕机诊断、安全事件响应,以及需要实时工作而用户无需在等待时切换任务的 Agent。
参考资源
📱 你喜欢这个内容吗?加入我们的 Telegram 频道 @programacion,每天发布技术、AI 和开发领域最相关的内容。每日快速摘要,新鲜内容天天有。