GPT-6 Astra在计算机操控任务领先,Gemini 4 Argon主导法律金融场景,GPT-6.1 Sol以性价比适合编程Agent,Claude Fable 5.1能力均衡;各模型在不同任务维度各有优势。
2026年9月的前沿模型发布季,堪称 AI 领域近年来最密集的一次军备竞赛。Anthropic、OpenAI 和 Google DeepMind 在不到 30 天内相继推出了 4 款旗舰级模型:Claude Fable 5.1 于9月1日发布,GPT-6 Astra 于9月3日跟进,GPT-6.1 Sol 和 Gemini 4 Argon 则在9月底压轴登场。
我们对每款模型的发布都做了单独报道。本文把它们放在一起横向比较。 benchmark 分数的重叠度比各家发布博客呈现的更高,但价格、访问规则和单任务成本就不一样了。
有一个变化需要先交代:OpenAI 在9月28日取消了下个月发布的 GPT-6.1 Sol,原因是他未能通过内部 scope 和授权测试。因此 GPT-6 Astra 仍是 OpenAI 目前的顶级模型。
Astra 和 Fable 5.1 标价相同:输入 $10/百万 token,输出 $50/百万 token。Sol 和 Argon 标价是前者的五分之一。Argon 的价格是过渡性的,后续会翻倍。
| Feature | GPT-6 Astra | GPT-6.1 Sol | Gemini 4 Argon | Claude Fable 5.1 |
|---|---|---|---|---|
| Developer | OpenAI | OpenAI | Google DeepMind | Anthropic |
| Released | Sep 3, 2026 | Sep 29, 2026 | Announced Sep 30, 2026 | Sep 1, 2026 |
| Access | OpenAI API, ChatGPT, Codex | OpenAI API, ChatGPT Work, Codex | Fairwind Program only | Claude API, Bedrock, Google Cloud, Microsoft Foundry |
| Input / output (per 1M) | $10 / $50 | $2 / $10 | $2 / $10 intro, then $4 / $20 | $10 / $50 |
| Cached input (per 1M) | $1.00 | $0.10 | $0.10 intro | $0.25 |
| Long-prompt pricing | Above 272K: $20 / $75 | Above 272K: 2x input, 1.5x output | Not disclosed | Flat to 1M |
| Context window | 1.05M | 1.05M | Not disclosed | 1M |
| Max output per response | 128K | 128K | 1M | 128K |
| Reasoning control | 5 effort levels, low to max | 5 effort levels, low to max | Not disclosed | Effort levels incl. low, medium, high |
| Open weights | No | No | No | No |
Sources: OpenAI GPT-6.1 Sol coverage, Gemini 4 Argon coverage, GPT-6 Astra long-context pricing, Claude Fable 5.1 specs. Standard first-party list prices, short-context tier.
cached-input 这行对 Agent 场景最关键。Agent 在每一步都会重新发送 system prompt、tool schemas 和历史记录。Astra 的 cache 读取价格为 $1.00,是 Fable 5.1 的 4 倍、Sol 的 10 倍。
Argon 的 1M 输出上限是唯一结构性异常值。其他三款的单次响应上限都停在 128K token。
没有哪款模型能做到全面碾压。Argon 在知识工作和长周期编码任务上领先。Astra 在前沿软件工程和 computer use 上领先。注意:Terminal-Bench 4.0 的领先者是 Opus 5.5,不在本次横评阵容中。
| Benchmark | What it tests | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|---|---|
| DeepSWE v1.1 | Long-horizon software engineering | 77.9% | 74.1% | 67.4% |
| Vals Index | Finance, coding, legal and tax work | 68.9% | 63.1% | 65.8% |
| FrontierSWE v2 | Frontier software engineering | 55.0% | 65.5% | 56.3% |
| Terminal-Bench 4.0 | Agentic work in a terminal | 57.4% | 58.2% | 57.9% |
| CWE-bench v1 | Vulnerability remediation | 68% (tie) | 68% (tie) | 58% |
| OSWorld-2.0 | Computer use | 69.2% | 72.6% | Not in Google's table |
Source: Google DeepMind's published comparison, as reported in our Gemini 4 Argon coverage. Vendor-reported.
GPT-6.1 Sol 没有出现在 Google 的对比表中。根据 OpenAI 自家数据,Sol 与 Astra 非常接近:
不过在原始智能层面,独立信号指向了相反方向。在 Artificial Analysis Intelligence Index 上,Astra 得 61 分,Fable 5.1 高出 5 分。在 coding-agent 指数上,Fable 5.1 在 Claude Code 中得分 70,而 Astra 为 67。Artificial Analysis 还报告 Argon 在 Intelligence Index 上与 Astra 持平。
在 ARC-AGI-2 上,Astra 得 95%,Fable 5.1 得 90%。
Artificial Analysis 测算 Fable 5.1 单任务成本为 $9.18,而 GPT-6 Astra 为 $4.72,差距约 1.9 倍——但两者的标价完全一样。
差距来自 token 消耗量,而非单价。单任务成本 = 单价 × 消耗 token 数。在单价相同的前提下,Fable 5.1 消耗了更多 token。Anthropic 还指出,其新一代 tokenizer 在相同文本下产生的 token 数量多出约 30%。
两款更便宜的模型进一步改变了局面:
缓存复用可以让排名反转。以上单任务成本数据没有模拟大量缓存复用的场景。对于一个长时间运行的 Agent,每一步都会重新读取相同的上下文。以下是 200K token 缓存上下文、尚未计算输出 token 时的费用演算:
| Model | Cached rate (per 1M) | Per step | Per 100 steps |
|---|---|---|---|
| GPT-6 Astra | $1.00 | $0.20 | $20.00 |
| Claude Fable 5.1 | $0.25 | $0.05 | $5.00 |
| GPT-6.1 Sol | $0.10 | $0.02 | $2.00 |
| Gemini 4 Argon (intro) | $0.10 | $0.02 | $2.00 |
Illustrative math from list cache rates. Astra's 200K context stays under its 272K long-prompt threshold.
在缓存密集型循环中,Fable 5.1 的上下文读取成本是 Astra 的四分之一。在看到单任务成本的新闻标题后,先用自己的 trace 数据对两者做实测。
根据工作负载选模型,而非排行榜排名。GPT-6.1 Sol 是大多数团队的首选。另外三款在更狭窄的场景下才值得付出溢价。
| Job | Pick | Why | Runner-up |
|---|---|---|---|
| High-volume coding agents, CI bots, PR review | GPT-6.1 Sol | DeepSWE v1.1 与 Astra 持平,价格仅 $2 / $10,cache $0.10 | Gemini 4 Argon,公开后 |
| Hardest open-ended engineering | GPT-6 Astra | FrontierSWE v2 领先(65.5%) | Claude Fable 5.1 |
| Computer use and browser agents | GPT-6 Astra | OSWorld-2.0 领先(72.6%) | GPT-6.1 Sol,差距 2.1 分 |
| Long coding sessions inside a harness | Claude Fable 5.1 | Claude Code 中 Artificial Analysis coding-agent 得分最高(70);cache 读取 $0.25 | GPT-6 Astra(67) |
| Hard science and research | GPT-6 Astra | Terminal-Bench Science 领先(68.1%) | GPT-6.1 Sol,单任务成本 $5.47 |
| Legal, finance and business automation | Gemini 4 Argon | Vals Index(68.9%)、AutomationBench(51.3%)和 Harvey Legal(19.6%)均领先 | GPT-6.1 Sol;Claude Fable 5.1 |
| Very long single outputs: big refactors, full reports | Gemini 4 Argon | 唯一支持单次 1M token 输出的模型 | 其他三款,按轮次拆分 |
| Vulnerability finding and patching | Gemini 4 Argon or GPT-6 Astra | CWE-bench v1 并列第一(68%) | Claude Fable 5.1(58%) |
| Tightest budget at frontier quality | GPT-6.1 Sol | 公开价格最低;Argon 仅在 Fairwind 内才匹配该定价 | Gemini 4 Argon |
其中两行的选择取决于访问权限。Argon 目前仅通过面向网络防御者的 Fairwind Program 提供。Astra 的完整攻击性安全能力位于 OpenAI Daybreak program 之后;公开版本拒绝高级攻击性网络任务。Anthropic 将其不受限制的孪生模型 Claude Mythos 5.1 放在了 trusted access programs 之后。
本文大多数数据来自各厂商官方报告,各家在边缘指标上存在分歧。OpenAI 报告 Astra 在 Terminal-Bench 4.0 上为 57.9%,而 Google 的对比表中列的是 58.2%。
安全护栏会影响 Fable 5.1 的分数:Anthropic 在开启生产安全护栏的条件下运行 benchmark。被标记的网络和生物任务会路由到其他 Claude 模型,这可能压低了 OSWorld 和 AutomationBench 的结果。
Argon 的定价是临时的:$2 / $10 是过渡价,后续会升至 $4 / $20,具体时间未定。
Argon 的 context window 未公开:Google 公布了 1M 输出上限,但未披露输入限制。
单任务成本是一个快照:$9.18 和 $4.72 来自 Artificial Analysis 9月初的 Astra 跑分。effort 设置会大幅改变这些数字。
Anthropic 有一个更便宜的选项:我们的 Argon 报道引用了多份报告,指出 Claude Opus 5.5 在关键 agentic benchmark 上击败了 Fable 5.1,而 API 价格更低。它还在 Terminal-Bench 4.0 上以 66.4% 领先。
Asif Razzaq 是 Marktechpost AI Media Inc. 的 CEO。作为一位有远见的企业家兼工程师,Asif 致力于将人工智能的潜力用于社会公益。他最近的举措是推出了一个人工智能媒体平台 Marktechpost,该平台专注于深度报道机器学习和深度学习新闻,既具技术深度又易于广泛读者理解。该平台月浏览量超过 200 万,在受众中颇受欢迎。