与 Fable 5/5.1 同价,ARC-AGI-3 99.9%(但使用自定义 Provider Adapter),ExploitBench 100%,发现两个零日漏洞。有技术深度的独立评测。
3rd September 2026 - Link Blog
GPT‑6 Astra(来源)GPT-6 Astra "今日起面向有限数量的组织推出,并在未来几天内向所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,同时通过 OpenAI API 和 AWS 提供"——我自己还没体验过,所以暂时没有太多可说的。
它的 API 定价与 Claude Fable 5 和 5.1 持平:$10/百万输入 tokens,$50/百万输出 tokens。这显然是 OpenAI 用来对标 Fable 的产品,而且在 OpenAI 自报的大部分基准测试中得分都高于 Fable。
最令人印象深刻的是,Astra 在今年 3 月发布的 ARC-AGI 3 基准测试中取得了 99.9% 的成绩——不过值得注意的是,Fable 5 目前尚未公布相关成绩,而且 ARC-AGI 博客指出,99.9% 的成绩是在使用 OpenAI 自研的 "Provider Adapter harness"、花费 $19K 的条件下取得的;而使用默认 ARC-AGI harness 的成绩为 62.7%,花费 $26K。
Provider Adapter harness 能够在请求之间保留不透明的推理状态,并使用压缩技术处理更长对话,让模型能够复用之前的工作。
不难想象,鉴于近期 Hugging Face 事件,Astra 在安全任务上表现极为强劲。它在 ExploitBench 上取得了 100%(GPT-5.6 Sol 为 78.5%),在 ExploitGym 上为 42.4%(Sol 为 30.3%),在 SRE-Bench 二进制逆向工程任务中,四次尝试内达到 99.2%,而 Sol 仅为 68.7%。
它的长上下文能力也更胜一筹:在 OpenAI 的八针基准测试中,256K–512K tokens 区间达到 100%,512K–1M tokens 区间达到 96.3%。OpenAI 或许已经攻克了长上下文处理这一长期存在的难题。
但它并非在所有方面都领先。Artificial Analysis 指出,在他们的 Intelligence Index 上,Astra 仍然不敌 Fable:
与 GPT-5.6 Sol 并列 Intelligence:GPT-6 Astra 在该指数中与 GPT-5.6 Sol 得分相同,为 61 分。这比 Claude Fable 5.1(带 fallback 的最高分)低 5 分。该模型也落后于 Meta 新发布的 Muse Spark 1.3(最高分)。
在他们发布的 Coding Agent Index 上表现更好:
领先 Coding Agent Index 成本效率前沿:在最大投入下,GPT-6 Astra 的成本与 GPT-5.6 Sol(最高分)大致持平,但指数得分高出 2 分。按任务计算,该模型达到相同分数时,成本不到 Claude Fable 5 的一半。
等拿到使用权限后我会详细写更多关于 Astra 的内容。届时 API 模型标签将是 gpt-6-astra。
Claude 的新 system prompt 真的非常不想复现歌词——2026 年 9 月 2 日
Claude Fable 5.1 给我做了一只超棒的动画鹈鹕——2026 年 9 月 1 日
理解 ChatGPT Work——2026 年 8 月 30 日
这是 Simon Willison 的链接帖,发布于 2026 年 9 月 3 日。
Sponsor me for $10/month and get a curated email digest of the month's most important LLM developments.
Pay me to send you less!