OpenAI GPT-5.6以家族形式发布(多版本针对不同场景),标志其从聊天机器人向工作场所Agent平台的战略转型,7月9日全面可用。
AI 模型曾经是逐一发布的。你等待下一个,它带着一篇博客文章和一套基准测试到来,然后循环往复。GPT-5.6 于 2026 年 7 月 9 日公开发布,在几个重要方面打破了这个模式:它是一个模型家族而非单一模型,在不寻常的政府监管环境下发布,并标志着 OpenAI 正在将自身定位从聊天机器人制造商转变为工作场所 Agent 平台。无论你是好奇的读者、企业主,还是只想理解新闻标题含义的人,本指南都会涵盖 GPT-5.6 实际上是什么、它能做什么,以及如何推断接下来可能发生什么。
GPT 代表 Generative Pre-trained Transformer(生成式预训练变换器),这是驱动 OpenAI 语言模型的底层架构。版本号 5.6 将此次发布置于 GPT 系列的第五代主版本,比 GPT-5.5(2026 年 4 月发布,代号"Spud")领先一步,并在此前数月发布的 GPT-5.4、GPT-5.3-Codex 和 GPT-5.2 的基础上演进。如果发布节奏让你觉得很快,那确实很快:OpenAI 已从每年一个大版本转变为每六到八周大约一个版本。
GPT-5.6 是一个大语言模型,意味着它接受文本(和图像)作为输入,基于训练期间学到的模式预测接下来应该出现哪些 token,并生成类似人类的文本作为响应。这一代真正值得注意的不仅是原始能力的跃升,还有模型打包和销售方式的结构性变化。
前几代通常只提供一个旗舰模型,辅以可选的"思考"或"pro"模式。GPT-5.6 作为三个真正不同的层级发布,每个层级针对成本-速度-能力曲线上不同的定位点。从能力最强到最经济实惠排列,分别是:Sol、Terra 和 Luna。
Sol 是旗舰产品,为最难的问题构建:复杂的编码 Agent、长周期研究、网络安全任务、生物学,以及任何正确性比成本更重要的任务。Terra 是均衡的中层,在保持与上一代最佳产品竞争性能的同时大幅降低成本。Luna 是最快且最经济的选择,适合高容量、低延迟敏感的应用,如聊天机器人或内容分类。
命名约定本身是有意设计的。数字(5.6)标识代际,而天体名称标识 OpenAI 打算在未来各代中沿用的持久能力层级。用户现在选择的不是一台旋钮调高或调低的单一模型,而是一个层级。
在 GPT-5.6 到达普通公众之前,它经历了一个异常严格的预览期。2026 年 6 月 26 日,OpenAI 向一小群可信合作伙伴开始了有限预览,这一举措是作为其与美国政府持续接触的一部分。OpenAI 表示,根据政府要求,其在发布前预览了模型能力和计划,共享了参与合作的合作伙伴名单。2026 年 7 月 9 日随后进入公开发布。
对于任何试图预测 AI 部署未来如何运作的人来说,这是一个有意义的时刻。监管机构越来越多地在模型面向公众之前就参与进来,而不仅仅是在之后。预览窗口不是营销手段;它反映了围绕具有实质性网络安全能力的模型的实际政策压力。随着模型变得越来越强大,这种压力只会增加。
OpenAI 将 Sol 描述为在编码、知识工作、网络安全和科学领域设置了新的最先进成果,同时使用明显更少的 token 就能达到这些结果。Token 效率很重要,因为它直接转化为任何大规模运行模型的人的成本和速度。
在独立基准测试中,Sol 在编码任务中获得了特别强的评价。在 Artificial Analysis Coding Agent Index 上,使用最大推理的 GPT-5.6 Sol 获得了 80 分,位居当前追踪领域的前列。在特定网络安全评估中,Sol 的 ExploitBench 分数达到了 73.5%,而同等输出 token 预算下 GPT-5.5 为 47.9%。其 SEC-Bench Pro 分数为 71.2%,GPT-5.5 为 45.8%。
Sol 还支持约 105 万 token 的上下文窗口,每次请求最多可输出 128,000 个 token。对于企业层级,一些报告指出有效上下文窗口更高。当模型需要在响应前阅读整个代码库、一份长法律文件或数月的研究时,这个规模很重要。更大的上下文窗口意味着模型可以在工作记忆中保留更多相关信息而不会丢失。
Sol 并非不可战胜。在一些最难的编码和推理基准测试中,竞争的前沿模型仍然占据优势。GPT-5.6 押注的是能力和成本的组合:定价使前沿级别的工作对更多团队来说在经济上变得可行。
GPT-5.6 在所有三个层级使用按百万 token 计费的定价。在 2026 年 7 月 30 日降价后,目前的费率如下:Sol 每百万 token 输入 5.00 美元、输出 30.00 美元,Terra 费率明显更低,Luna 最经济。所有层级的缓存输入 token 费用显著降低,这有利于重复使用相同系统提示或上下文的应用。
作为参考,一百万 token 大约是 75 万个英文单词。大多数单独对话使用的只是其中的一小部分。这些价格对于每天运行数千或数百万次交互的开发者和企业最为重要。
在 ChatGPT 内部,访问遵循订阅层级。免费用户在 7 月底的一次更新后获得了 Luna 访问权限,让最广泛的受众尝鲜 GPT-5.6 这一代。付费计划解锁 Sol 和完整的 Agent 功能。
ChatGPT Work 于 7 月 9 日与 GPT-5.6 同时发布,是 OpenAI 发展方向的产品化表达。与标准 ChatGPT(响应单个提示)不同,ChatGPT Work 获取一个目标,跨 Slack、Notion、Google Drive 和 Microsoft 365 等连接工具收集信息,自主完成多步骤任务,交付成品如电子表格、幻灯片、报告和文档。它支持计划审查模式,让用户在执行前批准步骤,支持定期任务调度,以及大量集成库。
Agent 能力的转变反映在模型本身。Sol 的 Ultra 推理模式默认协调多个 Agent 跨并行工作流,OpenAI 在其开发者平台扩展了编程式工具编排,允许模型编写和运行小程序来编排工具和过滤中间数据,而不是将每个工具响应路由回模型。这些变化使多步骤自主工作流在实践中更加可靠。
这是迄今为止最清晰的信号,表明 OpenAI 的竞争战场已从"哪个聊天机器人给出最好的单次回答"转向"哪个平台能够以最少的人工干预完成最复杂的真实世界任务"。
GPT-5.6 引入了 OpenAI 迄今为止在网络安全能力上架构上最重要的方法。该家族的多用途模型在发现和修复漏洞方面明显优于前几代,但 OpenAI 自己的测试表明,它们更擅长防御任务,而不是可靠地对强化目标执行端到端攻击。
对于经过审查的安全专业人员,OpenAI 以两层方式运营 Daybreak 计划。Daybreak Blue 提供 GPT-5.6 Sol 访问权限,系统级网络护栏针对合法的防御工作调整,包括漏洞发现、安全代码审查、恶意软件分析和事件响应。Daybreak Red 提供单独批准访问 GPT-5.6 Cyber,这是一个针对授权漏洞研究利用验证和渗透测试而定制的模型。
这两个层级之间的能力差距是显著的。在涵盖利用链、身份验证绕过和权限提升的内部测试中,GPT-5.6 Cyber 对 95% 的高级请求做出了响应。在默认防护下,标准 Sol 对相同请求的响应率为 1.5%。在 OpenAI 用于评估风险的 Preparedness Framework 下,GPT-5.6 Cyber 被列为高能力但低于临界阈值。
这个临界阈值很重要,因为它直接关系到接下来的发展。OpenAI 单独承认,其即将推出的模型,内部称为 Astra,可能达到临界阈值,这一发现导致公司暂停了一些内部工作,并在任何公开发布之前对模型施加更严格的控制。
2026 年 8 月 13 日,OpenAI 宣布预览 Ultrafast 模式,这是由 Cerebras 硬件驱动的新 API 服务层级,适用于 GPT-5.6 Sol。Ultrafast 以标准处理速度最高 14 倍的速度运行 Sol,每秒生成最多 750 个输出 token。这里的意义在于前沿级智能以前所未有的速度可用,而这之前需要降级到更小或更专业的模型才能实现。Ultrafast 处于有限预览阶段,尚未广泛可用,但它指向一个速度不再是你为获得能力模型而需要做出的权衡的未来。
对 AI 变得明智意味着从被动吸收公告转向主动形成关于轨迹的预测。以下是如何通过这个视角解读 GPT-5.6 的图景。
首先,模型家族结构几乎肯定是永久性的。为每项任务运行单一整体前沿模型的经济性比运行与任务复杂度匹配的层级模型要差。预计每个主要实验室都将收敛于这个模式。
其次,公开发布前的政府预览是关于 AI 治理如何演变的一个数据点。这不是由失败引起的延迟;这是 OpenAI 和监管机构之间商定的深思熟虑的过程。未来此能力层级或更高层级的发布经历类似审查的可能性很高且在上升。
第三,Astra 的情况是最重要的悬而未决的问题。一个可能在网络安全能力方面达到临界阈值的模型,正被搁置同时 OpenAI 在更严格的控制下研究它。它的公开发布时间仍然真正不确定,OpenAI 已表示在满意护栏之前不会发布。无论 Astra 成为 GPT-5.7、GPT-6 还是完全不同的东西,OpenAI 本身尚未决定。
第四,向 Agent 工作的转变是真正的竞争。ChatGPT Work 不是一项功能;它是一种商业模式。未来 12 到 18 个月的问题不是哪个模型在基准测试中得分最高,而是哪个 Agent 平台赢得足够的信任以在企业内部无人监管运行。这种信任建立缓慢、失去迅速,它同样依赖于可靠性和安全性,而不仅仅是原始能力。
纵观每个 GPT-5.x 发布的模式,是更快的迭代、更广泛的能力和更低的单位智能成本。GPT-5.6 符合这个模式。形成的有趣预测不是下一个模型是否会更好,因为它几乎肯定会更好。有趣的问题是 AI 能做什么和组织准备部署什么之间的差距会以多快的速度缩小,以及哪些护栏将塑造这个差距。
GPT-5.6: Frontier intelligence that scales with your ambition | OpenAI
Previewing GPT-5.6 Sol: a next-generation model | OpenAI
Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed | OpenAI
Expanding Daybreak as the Cyber Defense Window Narrows | OpenAI
Improving GPT-5.6 Sol in ChatGPT and expanding access to Luna | OpenAI
OpenAI launches its new family of models with GPT-5.6 | TechCrunch
OpenAI built a model it doesn't want most people to use | The New Stack
GPT-5.6 Sol: Benchmarks, API Pricing & Review | Coursiv Blog
Claude Opus 5 vs GPT-5.6 Sol: Benchmarks & Pricing | DataCamp
GPT-5.6 Sol: Benchmarks, Pricing & API Access Guide 2026 | EdenAI
OpenAI API Changelog | OpenAI Developer Docs
GPT-5.6 Week One: Usage Pools, Access Tiers, Rollout Fixes | Digital Applied
ChatGPT New Features July 2026: GPT-5.6, Work Agent & What Changed | AI Business Weekly
GPT-5.6 Cyber: OpenAI's Specialized Security Model and Daybreak Program | SOCFortress / Medium
GPT-6 (Astra) tracker | Dr Alan D. Thompson / LifeArchitect.ai
OpenAI GPT Model Release Timeline | hidekazu-konishi.com
GPT-5.6 Sol Benchmarks, Pricing & Speed (August 2026) | BenchLM.ai