GPT-6 Astra 在数学、编程、网络安全基准测试中登顶,测试期间独立发现两个零日漏洞,被 OpenAI 定为首批「关键」级别模型。
OpenAI 正在推出 GPT-6 Astra,这是其迄今为止能力最强的模型。付费 ChatGPT 用户和云平台将在未来几天内获得访问权限。
在基准测试中,Astra 在逻辑、数学和软件工程等关键领域的表现显著优于其前身 GPT-5.6 Sol 以及 Anthropic 的 Fable 5 系列模型。
Token 价格是后者的 2.5 倍,与 Anthropic 的 Fable 5.1 持平,但 OpenAI 认为,以每个任务的完成成本计算,实际上反而更低。
添加了 Codex 和 GPT-6 Pro 的详细信息以及发布视频
OpenAI 已经发布了 GPT-6 Astra,这是其迄今为止能力最强的模型。总裁 Greg Brockman 表示,它可能已经达到"AGI"标准,或者至少已经触手可及——按 OpenAI 自身的定义,即 AI 系统在大多数具有经济价值的工作上超越人类。
GPT-6 Astra 首先通过 OpenAI 的 Daybreak 计划向特定组织推出,预计在未来几天内将面向更广泛的 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放。也将通过 API 以及 AWS Bedrock 和 Microsoft Azure 等云平台访问。Pro、Business 和 Enterprise 订阅用户可以使用 GPT-6 Astra Pro,这是更高性能的版本,不过企业工作区管理员需要手动激活该模型。
Astra 在德克萨斯州的 Stargate 设施中使用了超过 100,000 块 GPU 进行预训练。OpenAI 研究员 Aidan Clark 称这是公司有史以来最大规模的训练run。从 Sol 到 Astra 的跨越代表了比从更早模型到 Sol 更大的能力提升,Clark 表示,部分原因是之前的 AI 模型在监控训练过程中发挥了作用。
在 OpenAI 发布的基准测试中,Astra 的得分远高于其前身 GPT-5.6 Sol 和 Anthropic 的 Fable 系列模型。Astra 在多个领域达到了顶级成绩:逻辑推理(ARC-AGI-3 上 99.9%,不过是在其自设的测试条件下)、数学(FrontierMath Tier 4 v2 上 97.6%)、软件工程(DeepSWE v1.1 上 74.1%)、专业知识(GPQA Diamond 上 96%)、工程学(BenchCAD 上 95.9%)、网络安全(ExploitBench 上 100%)。
BenchCAD 成本:比 Sol 低约 43%,比 Fable 5.1 低约 86%。
Terminal-Bench 4.0 成本:比 Sol 低约 9%,比 Fable 5.1 低约 63%。
更低成本设置:Terminal-Bench Science 61.1%(成本降低约 27%);GPQA Diamond 94.9%(成本降低约 37%)。素数间隙改进从 240 降至 186,80 多年来首次改善了大间隙边界项。
Fable 5 和 5.1 未被纳入 LifeSciBench、GeneBench Pro 和 MedChemBench,因为它们会拒绝大多数问题。
四次尝试内的 SRE-Bench:99.2% 对比 Sol 的 68.7%。Astra 在评估过程中发现了两个此前未知的零日漏洞。
对齐(越低越好,Impossible ExploitGym 除外)
不可能任务范围测试:Sol 有 48% 的时间超出其授权目标,Astra 为 0%。Astra 误报自身能力的可能性低 3 倍。
在科学工作中,该模型据报道改进了素数间隙的数学结果,并在生物学、化学、医学和物理学评估中创造了新纪录。OpenAI 还将 Astra 定位为能够像人类一样可靠地操作计算机的模型,在衡量这一能力的 OSWorld 2.0 上,Astra 以每个任务约 40 分钟的速度获得了 72.6% 的分数,而 Sol 以约 75 分钟的速度获得 65.7%。"凡是你能在电脑上做的事,Astra 都能为你做。而且更快,"该公司宣称。
除了 Astra,OpenAI 还在更新其 Codex 编程环境。一项新的实验性功能允许模型在长会话中跨多个上下文窗口做笔记,而不是每次都将所有内容压缩成单一摘要。早期的上下文窗口仍然可搜索,因此即使某些内容没有被捕捉到笔记中,Astra 也能查找之前消息中的需求或测试结果。OpenAI 计划在未来几周内将其设为默认行为。
比 Sol 更贵,但 OpenAI 称每个任务成本更低
GPT-6 Astra 在标准模式下通过 API 收费为每百万输入 token 10 美元、每百万输出 token 50 美元。Fast 模式承诺 2.5 倍速度,价格翻倍,使 Astra 比 GPT-5.6 Sol 贵 2.5 倍,与 Anthropic 的 Fable 5.1 处于同一价格区间。
Brockman 认为,token 价格已经成为一种糟糕的模型比较方式,因为 OpenAI 的 token 与竞争对手的不同,甚至在其自身不同模型系列之间也不具可比性。他说,真正重要的是每个完成任务的成本,而 OpenAI 已经在尝试这种定价模式。在 DeepSWE v1.1 上,Astra 的最高配置与 Sol 相比,每个任务的估算 API 成本降低了约 57%,据该公司称。
在新闻发布会上,Brockman 承认没有明确定义的 AGI 时刻,他说团队最初认为当 OpenAI 成立时会有一个显而易见的阈值,每个人都能认识到。这一刻并没有那样出现,过渡比预期更为渐进,这是 OpenAI 去年春天就阐明的立场。Brockman 在发布会结束时说:"欢迎来到 AGI 时代。"OpenAI CEO Sam Altman 此前曾表示,他预计到今年年底会有一个他会称之为 AGI 的模型。
首个达到 OpenAI 关键网络安全阈值的模型
Astra 是 OpenAI 在其 Preparedness Framework 中第一个被归类为"critical"的模型。这意味着该模型可以在获得正确工具和访问权限的情况下,自主发现以前未知的漏洞并在整个防御完善的系统中构建利用链,全程无需人类一步步引导。OpenAI 还承认,Astra 的书面推理比 GPT-5.6 Sol 更难监控。
在 ExploitBench 上——衡量模型发现和利用真实软件漏洞能力的基准——Astra 获得了完美的 100 分。OpenAI 表示,该模型在评估过程中发现了两个此前未知的漏洞,随后公司向受影响的供应商报告了这些漏洞。人类专家确认,Astra 可以在多种软件类别中识别出新颖的零日漏洞,包括浏览器和操作系统。
最先进的网络安全能力目前仅限于 Daybreak Blue 计划中的可信防御者。OpenAI 此前曾推迟 Astra 的发布以进行更多安全测试。这些双用途能力是双刃剑:一个能够自主发现漏洞的 Agent,帮助防御者打补丁和帮助攻击者利用漏洞同样容易。
AI News Without the Hype – Curated by Humans
订阅 THE DECODER,享受无广告阅读、每周 AI 时事通讯、每年六期的独家"AI Radar"前沿报告、完整档案访问权限,以及评论区访问权限。