OpenAI推出新一代旗舰模型GPT-6 Astra,宣称在网络安全、软件工程、科学研究和计算机使用等领域实现代际突破,并首次达到其内部定义的AGI能力阈值。
我们非常高兴你的到来。每个工作日(周一至周五),你都会收到来自 TNS 的全部精华内容,让你随时掌握最新资讯、保持最佳状态。
查收你的收件箱,收取确认邮件,你可以在那里调整偏好设置,甚至加入更多社群。
在你最喜欢的社交网络上关注 TNS。
在 LinkedIn 上成为 TNS 粉丝。
在等待你的第一份 TNS 新闻简报时,看看最新的精选和热门文章。
OpenAI 周四发布了 GPT-6 Astra,这是其最新的旗舰模型。公司将其描述为"世界上最智能、最对齐的模型",而且从各项基准测试来看,这个说法似乎所言非虚。
在发布前的新闻通气会上,OpenAI 总裁 Greg Brockman 超越基准测试的数据,说得更为大胆。他承认 AGI 仍然是一个"灰色、模糊的概念",但他暗示,未来的观察者可能会回首 Astra,将其视为 AGI 到来的标志。
"我认为,觉得我们现在正身处 AGI 时代,并非毫无道理,"Brockman 如是说。
当被问及 OpenAI 是否正式宣布已实现 AGI 时,他表示该术语不再与合同触发条件挂钩(此前提到过与微软的早期协议),而是将其描述为一种"使命概念或精神概念"。
"这个判断由读者自行决定是否认同,"Brockman 说。"对我来说个人而言,我确实认为我们已经达到了。我确实认为这是一个相当有说服力的论点。但同样,我认为这只是旅程的开始,而非终点。"
他在发布会上以此作结:"欢迎来到 AGI 时代。"
"欢迎来到 AGI 时代。"——OpenAI 总裁 Greg Brockman
OpenAI 史上最大规模训练
据 OpenAI 的 Aidan Clark 介绍,Astra 是 OpenAI 迄今为止最大规模的训练运行。"这是我们首次在德克萨斯州 Stargate 站点使用超过 100,000 块 GPU 进行预训练,"他表示。Clark 还指出,Astra 是 OpenAI 首个在早期模型显著参与训练监督过程的模型发布。

不过,你现在大概还无法使用 Astra。发布首先面向已通过 OpenAI Daybreak 计划获得访问权限的企业客户。
OpenAI 表示,Astra 将在"未来几天内"逐步向 Plus、Pro、Business 和 Enterprise 用户开放,也将通过 OpenAI API 和 AWS 提供。
Pro、Business 和 Enterprise 用户还将获得 GPT-6 Astra Pro 的访问权限,符合条件的 API 用户将能够使用具备零数据保留功能的 Astra。
一旦在 API 中可用,Astra 的定价为每百万输入 token 10 美元、每百万输出 token 50 美元。这是 Sol 当前促销价格的 2.5 倍,虽然与 Anthropic 的 Fable 5.1 定价持平。
这远高于 Muse 的标准价格——每百万输入 token 1.25 美元、每百万输出 token 4.25 美元。Meta 还提供贡献者版本,价格分别为 0.10 美元和 0.20 美元,但表示该层级的数据可用于改进其产品。Google 为 Gemini 3.8 Flash 的入门价格为 0.75 美元和 3.75 美元。
更高的每 token 单价并不一定意味着更高的账单——如果模型以更少步骤完成工作且需要更少重试次数的话。OpenAI 表示,Astra 在多项评估和合作伙伴测试中使用的 token 更少。目前的发布数据过于稀疏,无法显示这些节省是否抵消了价格溢价。
"每任务成本才是关键,"Brockman 说。
与 GPT-5.6 不同,OpenAI 尚未宣布为 GPT-6 提供 Luna、Terra 和 Sol 变体。目前的产品线由 Astra 和 Astra Pro 组成。
Astra 的领先之处——以及不足之处
OpenAI 表示,除非另有说明,其评估中的模型均以最大努力模式运行。这可以提升基准测试结果,但也会增加延迟和 token 使用量。
Astra 在 DeepSWE v1.1 上的结果相比 OpenAI 之前的模型有明显进步。它在 113 项代理编码测试中得分为 74.1%,而 Sol 为 70.8%。
但本周早些时候,Meta 报告其 Muse Spark 1.3 在最大推理设置下得分为 75.4%。Muse 1.3 已可用,但最大设置正处于安全审查中,发布时不会向公众开放。
这对于 Meta 而言是一个令人意外的胜利。在这个规模的基准测试上,1.3 分的差距大约相当于一到两项任务的差异,但仍然显示出 Meta 已经走了多远。
目前公开的 DeepSWE 排行榜上,Gemini 3.8 Flash 和 Claude Opus 5 均为 74%,Sol 为 73%。报告的不确定范围存在重叠,因此这些结果并未确立明确的领先者。OpenAI 的图表排除了 Muse,并使用了 67.4% 的 Fable 5.1 结果,这使得 Astra 的优势看起来比更广泛的结果集所显示的更大。
Astra 在编码之外的领域取得了更大的进步。
其中最突出的是其在 ARC-AGI-3 上 98.6% 的得分。OpenAI 使用 Responses API 工具运行 Astra,该工具在轮次之间保留推理并使用压缩来管理长上下文。公司此前展示过,这些系统选择可以在不改变底层模型的情况下大幅提高 ARC-AGI-3 分数,而该基准测试将 Astra 和 OpenAI 的代理系统作为一个整体来衡量。
Astra 在 FrontierMath Tier 4 上 97.6% 的结果似乎覆盖了 43 题层级中 41 道私人题目。运营该基准测试的 Epoch AI 表示,OpenAI 为其开发提供了资金支持并对其部分内容享有独家访问权,因此这一点值得留意。

Astra 在 BenchCAD 的 1,000 文件 Vision2Code 子集上使用 Python 工具得分为 95.9%,而 Fable 5.1 为 84.3%、Sol 为 83.3%。BenchCAD 要求模型从渲染视图中重建 CAD 程序,并通过对生成的 3D 模型进行几何重叠评分。OpenAI 指出,Claude 的结果使用了修改后的评估设置,但与 Sol 的差距仍然很大。
在 Terminal-Bench Science 任务上——该任务要求代理在五个科学领域中完成 70 个命令行研究任务——OpenAI 报告 Astra 得分为 64.6%。Anthropic 报告 Fable 5.1 得分为 52.6%,而现有公开排行榜上 Opus 5 最高为 30%。
Anthropic 也在 Fable 5.1 的发布中用了大量篇幅讨论科学,包括由 Mythos 5.1(同一底层模型但限制更少)设计的蛋白质binder的早期湿实验室结果。两家公司都在努力将其模型从回答科学问题推向研究工作流程。
Codex 中有什么变化?
对于开发者而言,Astra 处理超出上下文窗口的任务的能力可能比基准测试的进步更为重要。
Codex 目前依赖压缩,即通过总结早期工作来释放上下文。这个过程可能会丢弃代理稍后恰好需要的细节:之前的修复为何失败、哪些测试运行过,或者用户在工作开始时添加的哪个小需求。
Astra 可以在上下文窗口之间保留笔记,并搜索较早的消息和工具输出。该功能目前通过 config.toml 设置为实验性功能。OpenAI 表示将在未来几周内将其作为 Astra 的默认设置。
Astra 还可以在不停止不依赖答案的工作的情况下向用户提问。这防止了单个未解决的决策阻塞其余工作——这是编码代理的一个常见失败模式。
OpenAI 展示了 Astra 操作 KiCad、Excel、Blender 和 Power BI 等应用,以及执行基于浏览器的表单填写和网站 QA。
在跨桌面应用程序工作的 OSWorld V2-Offline 基准测试上,OpenAI 表示 Astra 得分为 72.6%,高于 GPT-5.6 Sol 的 65.7%。每个任务的平均时间也从约 75 分钟缩短至 40 分钟。
Anthropic 报告 Fable 5.1 的更高结果为 77.9%,但表示该测试使用了不同版本的 OSWorld,不应与之前发布的分数进行比较。
OpenAI 还更改了 Codex 工具。在 Mind2Web 上,Astra 和新工具完成任务的速度是当前基于 Sol 的设置的 1.9 倍。
能力更强,但更难监控
OpenAI 声称 Astra 是其最对齐的模型,这一说法部分基于一项内部测试:在不可能完成任务的场景中,Astra 在 0% 的情况下越过了授权目标,而 Sol 的这一比例为 48.2%。
OpenAI 将旧模型描述为"在生产安全防护之外运行";然而,它没有足够清楚地说明周围安全设置的作用,以进行直接比较。
公司还披露,在专门设计用于引发监控规避的评估中,Astra 的书面推理比 Sol 更难监控。OpenAI 将这一下降部分归因于 Astra 在较简单任务上对书面推理有更大控制权,且以更少的书面推理步骤完成问题。
"智能的进步并不能保证对齐的进步,"OpenAI 首席科学家 Jakub Pachocki 表示。他补充说,OpenAI"将暂停扩展,直到我们能够重新获得足够的信心"来监控未来的模型。
网络能力伴随着更严格的访问
OpenAI 表示,Astra 已在其准备框架中跨越了关键网络安全阈值。在公司测试中,该模型为加固的浏览器和操作系统开发了漏洞利用程序。在 OpenAI 根据最新的 V8 bug 对其进行评估时,它还发现了两个此前未知的漏洞。公司表示正在向维护者披露这些漏洞。OpenAI 表示,其报告的网络结果反映了对 Daybreak Blue 的访问,而非 Astra 的默认生产配置。
OpenAI 将 ExploitBench 和 ExploitGym 描述为测试模型能否将已知软件漏洞转化为有效漏洞利用的程序。在 ExploitGym 上,Astra 得分为 42.4%,高于 Sol 的 30.3%,但 OpenAI 为两个模型都取消了通常的六小时时间限制。
在 ExploitBench 上,模型的得分为 100%。
OpenAI 指出,通过标准访问提供的 Astra 版本将拒绝一些高级网络安全工作,包括漏洞利用发现。
OpenAI 通过 Daybreak 向经过验证的防御者初始群体提供限制较少的访问,并表示将在未来几周内通过 Daybreak Blue 扩展 Astra 访问权限。Daybreak Blue 是一项用于授权防御工作的访问计划,不是单独的 Astra 模型或推理模式。
对于使用 API 的开发者,网络安全安全检查将直接停止任务,而不是暂停并等待批准。
OpenAI 的 Mia Glaese 还警告说,不在其可信访问计划中的用户在进行网络安全工作时可能会遇到减速、暂停或阻止——有时在进行无关工作时也会如此。当然,这在最近的许多模型发布中都出现过,但对于用户来说仍然令人沮丧。
"在发布时,这是人们应该预期的,"她说。