OpenAI GPT-5.6正式发布,三档定价Sol $5/$30、Terra $2.50/$15、Luna $1/$6,Sol在Agentic benchmark创SOTA,详细解析各档能力边界与提示缓存规则。
GPT-5.6 是 OpenAI 于 2026 年 7 月 9 日全面上线的新一代模型家族,包含三个层级:Sol(旗舰版,每百万 Token 5 美元/30 美元)、Terra(均衡日用版,每百万 Token 2.5 美元/15 美元)、Luna(快速低价版,每百万 Token 1 美元/6 美元)。Sol 在 Agents' Last Exam 和 BrowseComp 等 Agent 评测基准上创下了新的最优成绩,同时 OpenAI 正在通过价格策略积极抢占竞品的市场份额。
命名是新的,但战略并非新事:一款前沿模型解决难题,一款主力模型支撑日常大量任务,一款廉价模型服务规模化场景。真正的新意在于 OpenAI 此次直接瞄准了 Agent 工作负载——长时间运行、调用工具、多步骤任务——以及目前在其他平台每 Token 付费更高的每一个团队的钱包。
本指南将逐一解析每个层级的实际能力、评测成绩与 Claude 和 GPT-5.5 的对比、新 Prompt 缓存规则对 API 账单的影响,以及如何根据工作负载选择合适的层级。
GPT-5.6 于 2026 年 6 月 26 日开启预览,2026 年 7 月 9 日全面上线三个层级:Sol(旗舰)、Terra(均衡)、Luna(低价)。
Sol 在 Agents' Last Exam 上得分 53.6,领先 Claude Fable 5(带自适应推理)13.1 分;BrowseComp 得分 92.2%。
价格极具竞争力:Sol 每百万 Token 5 美元/30 美元,Terra 2.5 美元/15 美元,Luna 1 美元/6 美元。
新的 Prompt 缓存机制引入了显式缓存断点,缓存生命周期最短 30 分钟;缓存写入按输入价格的 1.25 倍计费,缓存读取仍保持 90% 折扣。
OpenAI 称其为"迄今最强大的网络安全模型",专门针对威胁建模、代码审查、打补丁和蓝队演练做了优化。
GPT-5.6 是一个包含三款大型语言模型的家族——按能力从低到高依次为 Luna、Terra 和 Sol——于 2026 年 6 月 26 日开启预览,2026 年 7 月 9 日通过 API 和 Codex 全面发布。根据 TechCrunch 的报道,此次发布是在美国政府审查完成后进行的,该模型家族围绕企业工作、编程、科学研究和网络安全场景设计。
三层级的结构与团队实际使用模型的方式高度吻合:
Simon Willison 的早期分析指出,Terra 提供了与 GPT-5.5 相当的性能,同时价格大约便宜一半——这才是真正的重磅消息。大多数生产流量并不需要前沿模型,而是需要"去年前沿模型"的能力但只要一半的价格,而这正是 Terra 的定位。

Sol 在 Agent 基准测试上取得了最先进的结果:Agents' Last Exam 53.6 分(领先 Claude Fable 5(带自适应推理)13.1 分)、BrowseComp 92.2%、OSWorld 2.0 62.6%。在 Agent 编程方面,Sol Ultra 在 Terminal-Bench 2.1 上达到 91.9%,基础版 Sol 为 88.8%——略高于 Claude Mythos 5 的 88.0%。
各公开数据呈现的模式高度一致:最大的提升不在静态问答,而在长时程任务——也就是模型需要跨多个工具调用连续运行数分钟乃至数小时的那种任务:
Agents' Last Exam(覆盖 55 个领域的专业工作流):Sol 53.6——创历史新高,也是该评测套件中领先 Anthropic 幅度最大的一次。
Terminal-Bench 2.1(Agent 编程):Sol Ultra 91.9%、Sol 88.8%、Claude Mythos 5 88.0%、GPT-5.5 88.0%。在最高区间,编程基准的差距已经缩小到小数点后。
BrowseComp(网络研究):92.2%,业界最优。
OSWorld 2.0(计算机使用):62.6%,业界最优——但绝对数值也表明完全自动化还有很长的路要走。
两个需要如实说明的注意事项。第一,这些数字均为发布时厂商自报数据,独立复现的结果通常会略低一些。第二,Sol、Mythos 5 和 GPT-5.5 在 Terminal-Bench 上的差距不到一个百分点——对于编程任务,模型选择越来越取决于价格、延迟和生态,而非原始能力。我们在之前的 Claude Sonnet 5 Agent 设计分析中也提到了同样的趋同动态。
GPT-5.6 的每 Token 价格已经很有竞争力,但对 API 账单影响更大的是缓存机制。GPT-5.6 引入了可预测的 Prompt 缓存,支持显式缓存断点,缓存生命周期最短 30 分钟。缓存写入按未缓存输入价格的 1.25 倍计费;缓存读取保持 90% 折扣。
根据 BenchLM 的定价追踪器,对于任何运行 Agent 的人来说,这比标价更重要。Agent 工作负载每个会话需要重新发送相同的、不断增长的上下文十几次甚至数十次——系统 Prompt、工具定义、对话历史。在缓存读取享受 90% 折扣且缓存生命周期保证 30 分钟的情况下,长时 Agent 会话的有效成本相比简单按 Token 计费可以下降数倍。
显式断点模型是一个值得注意的转变:不再依赖提供商自动缓存来对齐你的 Prompt 结构,而是现在可以精确标定稳定前缀在哪里结束。如果你在 API 之上构建应用,将稳定内容(工具定义、指令、少样本示例)放在第一个断点之前,是目前最高性价比的成本优化手段。
缓存写入 1.25 倍的附加费是值得仔细阅读的细则:对于短小的单次请求(永远不会有缓存命中),GPT-5.6 的缓存反而可能让你多花钱。大量用在 Agent 和聊天场景;对于无状态的批量任务则跳过缓存。
对于一线开发者来说,有三点格外突出:
Codex 在上线第一天就支持全系列。所有三个层级都已在 OpenAI 的编程 Agent 中可用,OpenAI 声称 Sol 在编程任务上比前代产品高出 54% 的 Token 效率——当一个 Agent 在大型代码库上迭代时,Token 效率的提升会快速叠加。OpenAI 一直在稳步完善其开发者生态,包括收购了 uv 和 Ruff 的母公司 Astral。
Terra 是默认的生产首选。GPT-5.5 级别的质量但只要一半价格,这件事改变了每一个 AI 驱动产品的成本基线。如果你正在用中档模型运行助手、RAG 管道或 AI 编程工具,Terra 是新的基准。
价格战是结构性的,而非促销性的。OpenAI 面临营收压力——Anthropic 今年早些时候在营收和估值上均已超越 OpenAI——其应对策略是在每单位能力成本上展开竞争。预计 Anthropic 和 Google 将在几个月内做出回应。今天将技术栈锁定在某一家的定价上是错误的,保持模型层的可切换性。

OpenAI 正在明确地将 GPT-5.6 定位为其"迄今最强大的网络安全模型",瞄准防御性工作:威胁建模、代码审查、打补丁和蓝队演练。这一定位——以及发布前完成的美国政府审查——反映了整个行业目前所处的阶段。自主 AI 攻击已不再是理论概念,今年我们见证了 JADEPUFFER(首个自主 AI 勒索软件)的出现,相关分析有记录。厂商们现在正在竞相证明其前沿模型对防御者的帮助大于对攻击者的帮助,"网络安全模型"正在成为一个一等产品类别,而非系统说明文档中的一个注脚。
诚实的决策树比营销宣传的简短得多:
从 Terra 开始。对于 80% 的生产用例——聊天、RAG、编程辅助、摘要——GPT-5.5 级别的质量配合 2.5 美元/15 美元的价格是最佳成本/质量平衡点。
只在 Agent 场景升级到 Sol。Sol 的优势在于长时程 Agent 工作。如果你的工作负载是多步骤的、工具密集型的、无人值守运行的,基准测试的差距是真实存在的,5 美元/30 美元的价格也值得。对于单轮任务,你只是在用旗舰价格买主力输出。
将大量流量路由到 Luna。分类、提取、审核和简单聊天,1 美元/6 美元——配合路由器将 Terra 置于其后,让每个请求花它该花的钱。
GPT-5.6 是什么?
GPT-5.6 是 OpenAI 于 2026 年 7 月 9 日发布的模型家族,包含三个层级:Sol(旗舰)、Terra(均衡)和 Luna(低价)。专注于 Agent 能力——长时间运行、调用工具的工作流——以及编程和网络安全,通过 API 和 Codex 在上线时向所有开发者开放。
GPT-5.6 Sol、Terra 和 Luna 有什么区别?
Sol 是能力最强、价格最高的(每百万 Token 5 美元/30 美元),专为 Agent 和高难度推理构建。Terra(2.5 美元/15 美元)以大约 GPT-5.5 级别的质量但只有一半的价格,适用于日常生产工作。Luna(1 美元/6 美元)是最快最便宜的,面向高Volume的简单任务。
GPT-5.6 多少钱?
每百万 Token:Sol 输入 5 美元/输出 30 美元,Terra 2.5 美元/15 美元,Luna 1 美元/6 美元。在新的显式断点缓存系统下,缓存读取享受输入价格 90% 的折扣,而缓存写入按输入价格的 1.25 倍计费。
GPT-5.6 比 Claude 更好吗?
在厂商基准测试上,Sol 在 Agents' Last Exam 上领先 Claude Fable 5 分 13.1 分,在 Terminal-Bench 2.1 上以 88.8% vs 88.0% 略微领先 Claude Mythos 5。编程差距不到一个百分点,因此对大多数团队来说,决定因素是价格、延迟和工具链,而非原始基准分数。
现在就能用 GPT-5.6 吗?
可以。三个层级均于 2026 年 7 月 9 日通过 OpenAI API 和 Codex 全面可用,此前 2026 年 6 月 26 日开始了限量的预览阶段。
GPT-5.6 更像是一份定价与包装的声明,而非单一模型发布:顶部是前沿 Agent 能力,中间是半价 GPT-5.5 质量,底部是 1 美元的模型——全部包裹在奖励结构化 Prompt 的缓存规则中。我们的判断:Terra 是三个层级中最具影响力的,因为它重新设定了整个行业必须匹配的价格基线。基准测试的王座每个季度都会易手;但主力层级 2 倍的成本下降将永久改变预算结构。
如果你基于这些模型做开发,不要听我们的一面之词——在自己工作负载上跑你自己的评测。2026 年最好的模型是在你的任务上以你的价格点胜出的那个。