GPT-6 Astra 在 ARC-AGI-3 达 99.9%,token效率提升70%,但输入输出价格均为 GPT-5.6 Sol 的2.5倍,性价比存在争议。
OpenAI 于 2026 年 9 月 3 日发布了 GPT-6 Astra——这是自 GPT-5 以来的首个完整版本号更新。它在 ARC-AGI-3 上借助 Provider Adapter 测试框架达到 99.9%,相比 GPT-5.6 Sol 令牌效率提升 70%,价格为每百万令牌 10 美元/50 美元。但故事远比一个榜单分数要复杂得多。
本文涵盖基准测试、定价变化、架构线索、社区质疑,以及 Astra 相对于 Fable 5.1 和 GPT-5.6 Sol 的实际定位。
定价变化是你首先需要知道的事情,因为它改变了价值计算的逻辑。
Astra 在所有档位的价格都是 GPT-5.6 Sol 的 2.5 倍。对于一个并非在所有维度都明显领先的模型来说,这是一个陡峭的涨幅。同样的缓存折扣结构依然适用——如果你的工作负载缓存密集,有效价格差距会缩小,但原始的每令牌成本仍然显著更高。
来源:Artificial Analysis 基准测试文章,经 HN 讨论(1340 分)确认。
ARC Prize 博客发布的结果显示,GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上使用 Provider Adapter 测试框架得分为 99.9%(花费 19K 美元),使用 Standard 测试框架得分为 62.7%(花费 26K 美元)。
测试框架的差异很重要:
Provider Adapter 测试框架通过在调用之间保留推理上下文给 Astra 带来了巨大优势。没有它,分数会降至 62.7%——仍然令人印象深刻,但不再是标题中的 99.9%。
Astra 还在动作效率上超越了人类基准——它用比中位人类参与者更少的动作完成了任务。这是一个真正的里程碑,无论选择哪种测试框架。
来源:ARC Prize 博客——Greg Kamradt,2026 年 9 月 3 日。
HN 评论者指出分数卡可能有误导性:图表中显示的 GPT-5.6 Sol 的 7.8% 在使用相同 Provider Adapter 测试框架后会跃升至约 30%,这使得对比不那么戏剧性。来源:HN 关于分数卡对比的评论。
GPT-6 Astra 在编程 Agent 指数中得分为 67——与 Claude Code 中的 Claude Opus 5 和 Fable 5 大致持平。Fable 5.1 以 70 领先。在令牌效率方面,Astra 在 Codex 测试框架中使用的令牌是 GPT-5.6 Sol(max)的三分之一,是 Claude Opus 5(xhigh)的五分之一。
这是 Astra 对开发者最有说服力的卖点:在更低的令牌消耗下达到与前代相当的编程 Agent 能力,即使它没有领先排行榜。
来源:Artificial Analysis 编程 Agent 指数基准测试。
OpenAI 在 SRE-Bench 上测试了 Astra,该基准衡量模型能否在没有源代码访问权限的情况下逆向工程软件二进制文件。结果:
Astra 几乎将 Sol 的单次尝试成功率翻倍。这与安全分析、遗留系统迁移以及任何源代码不可用的场景都相关。
来源:HN 评论引用 OpenAI 的系统卡,参考 SRE-Bench 论文。
Artificial Analysis 在他们的两个旗舰指数上发现了截然不同的故事:
来源:Artificial Analysis 文章。
OpenAI 没有发布详细的架构规格,但系统卡可在 deploymentsafety.openai.com/gpt-6-astra 查看。社区分析的关键信号:
循环/循环 transformer 架构——多位 HN 评论者注意到这与潜在推理方法的结构相似性。"循环/循环 transformer 本身并不是一个新概念,但看到这种方法最终出现在前沿生产模型中还是很有意思的。"来源:HN 评论。
始终开启的推理——从 2.5 倍定价和模型在调用之间携带推理上下文的能力推断出来(这是 ARC-AGI-3 性能的必要条件)。
不强制使用工具——与 Fable 5.1 相同的模式,强制工具调用(tool_choice: {"type": "any"})可能会返回错误,因为它们会跳过推理并降低输出质量。
HN 帖子(撰写时 1340 分,1070 条评论)涵盖了三个主要关切领域:
1. 这是 AGI 还是又一次版本发布? 多位评论者引用了 Francois Chollet 2019 年的论文"On the Measure of Intelligence",认为前沿模型的进展看起来仍然是"技能获取优化"——在现有基准分布内更广泛的覆盖和更高的分数,而非真正新颖的泛化能力。来源:HN 评论。
2. 定价-竞争力差距。 Astra 价格是 Sol 的 2.5 倍,但在大多数基准测试(除 ARC-AGI 和 SRE-Bench 外)上仅带来 modest 的提升。在编程 Agent 指数上,它与价格更低的模型持平。一位评论者的观点:"其他每个基准测试似乎都是相对 modest 的改进,与 AI 实验室的任何'点'更新相当。"来源:HN 评论。
3. 改进的提示和协作。 一些用户报告 Astra 更好地处理模糊提示——它会提出澄清问题而不是一次性做出假设。"如果我给出一个约束不足/模糊的提示,我不想让模型一次性做出大量假设。"来源:HN 评论。
对于 ARC-AGI-3 风格的推理任务和 SRE-Bench 二进制分析: Astra 是明确的领导者。SRE-Bench 上 4 次尝试内 99.2% 的成绩确实难以反驳。
对于编程 Agent 工作负载: 用你当前使用的模型做基准测试对比。它在编程 Agent 指数上与 Fable 5 和 Opus 5 持平,但成本更高。令牌效率更好,但在 2.5 倍定价下,每任务成本可能更高或相当,取决于你的上下文长度。
对于高吞吐、成本敏感的任务: 继续使用 GPT-5.6 Sol 或 Fable 5.1。2.5 倍的溢价买不到通用工作负载上成比例的收益。
对于"这是 AGI 吗"这个问题: 数据不支持不连续性声明。在 ARC-AGI 上更好的分数、更好的二进制逆向工程、更好的令牌效率——这些是持续轨迹上的真实改进,不是 regime change。ARC-AGI-3 基准测试 specifically 衡量的是对新奇任务的泛化能力,Astra 在那里的表现(尤其是使用保留推理上下文的测试框架)确实令人印象深刻。但基准测试套件的其余部分显示的改进与之前的点版本一致。
用你自己的数据跑你自己的评估。 标题分数是方向性的,不是决定性的,定价变化意味着每个工作负载的成本计算都不同。
来源:Artificial Analysis——GPT-6 Astra 基准测试,ARC Prize 博客——GPT-6 Astra on ARC-AGI-3,HN 讨论(1340 分),OpenAI 系统卡,SRE-Bench 论文(arXiv)。ARC-AGI-3 分数来自 ARC Prize Standard 和 Provider Adapter 测试框架。定价来自 Artificial Analysis。社区引述来自 HN 评论,内联提供参考。