前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9375
  • Harness决定AI Agent能力:同模型不同表现
  • Claude Code权限绕过:Read拒绝后Bash仍可读取
  • 生产级Agent系统实战:LLM路由、Prompt合约与PR安全审查
  • LCLM:16倍压缩的潜在上下文语言模型
  • Claude Code mods解析:何时需要构建插件
  • Linus确认Linux内核进入「AI新常态」
  • 如何验证Agent实际完成了它声称的任务
  • Claude Code /compact 后哪些内容真正存活
  • 开源安全模型 apex-flash-1:60 个遗留 Bug 任务解出 40 个
  • yOGI Neural Grid:强制验证模型引用来源的工程实现
  • 美团开源LongCat-Video:13.6B参数统一视频生成模型
  • Agent技能需要包管理器而非仅靠Prompt
  • n8n AI Agent 生产环境失败根因与修复方案
  • 565 行 Python 从零实现编程智能体
  • 四大前沿模型横向评测:Astra擅计算机使用、Argon强法律金融、Sol价格最优
  • 本地RAG开发113个评估问题后的实战总结
  • AI重写让我重新审视运行时成本:Node.js转Go/Rust的算账
  • MCP工具超90个时的平台化架构设计
  • Homa:专为AI集群设计的TCP替代网络协议栈
  • 我为编码Agent的测试篡改问题做了个AdversaryGate
  • SaaS支持文档检索应选语义嵌入而非关键词
  • AI 审核员知道太多会变差:验证者应不知情
  • 长文档JSON提取超时?先做好输入分片而非调大timeout
  • PostgreSQL pgvector混合搜索实战:向量相似度+全文关键词融合
  • 新版Claude不再需要"Think Step by Step":Osmani提示指南解读
  • CodeSmith三区架构:解决prefix drift导致Token重计费问题
  • 像读流水线一样读Transformer Block
  • Cloudflare OS:面向 AI 原生的企业工作台开源
  • AI 编程工具正在泄露凭据:Cursor、Claude Code、Copilot 和 MCP 均有风险
  • prompt-shelf:在 Claude Code 里暂存草稿、临时想法和常用 prompt
  • Agenshive:AI agent 专属 Q&A 平台,用执行验证替代投票
  • 评审容量已成交付新瓶颈:打字快不等于交付快
  • AI Agent 让 CI 成为瓶颈,加速流水线是错误解法
  • Claude Code Mods 沙箱机制深度解析
  • MCP 协议安全:Agent 工具调用的运行时攻击面
  • Node.js多LLM提供商集成实战:统一输出契约与回退策略
  • Google RRSI 方法:防止自改进 AI Agent 记忆测试任务
  • DeepSeek Harness v0.2支持Claude Code Mods兼容层
  • MCP协议深度解析:AI工具集成标准现状与局限
  • 生产级LLM Gateway四个关键设计决策
  • MCP JSON 配置优化:同步一次节省 98% Discovery Token
  • Agent 静默失败代价 2500-8000 美元:用权威系统交叉验证代替执行日志
  • Agent 静默失败导致数千美元损失:如何用外部核查机制堵漏
  • Grok Build 真实用户体验:宣传与实际的落差
  • 两个面向AI Agent的x402 API:页面质量检测与成本计算
  • 已加载 45 / 9375
8.0
热点
AI SCORE
编程提效2026-10-05 04:59

四大前沿模型横向评测:Astra擅计算机使用、Argon强法律金融、Sol价格最优

MarkTechPost#模型评测#AI编程#Claude
Editor brief · 编辑速览

GPT-6 Astra在计算机操控任务领先,Gemini 4 Argon主导法律金融场景,GPT-6.1 Sol以性价比适合编程Agent,Claude Fable 5.1能力均衡;各模型在不同任务维度各有优势。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

2026年9月的前沿模型发布季,堪称 AI 领域近年来最密集的一次军备竞赛。Anthropic、OpenAI 和 Google DeepMind 在不到 30 天内相继推出了 4 款旗舰级模型:Claude Fable 5.1 于9月1日发布,GPT-6 Astra 于9月3日跟进,GPT-6.1 Sol 和 Gemini 4 Argon 则在9月底压轴登场。

我们对每款模型的发布都做了单独报道。本文把它们放在一起横向比较。 benchmark 分数的重叠度比各家发布博客呈现的更高,但价格、访问规则和单任务成本就不一样了。

有一个变化需要先交代:OpenAI 在9月28日取消了下个月发布的 GPT-6.1 Sol,原因是他未能通过内部 scope 和授权测试。因此 GPT-6 Astra 仍是 OpenAI 目前的顶级模型。

规格、定价与访问方式

Astra 和 Fable 5.1 标价相同:输入 $10/百万 token,输出 $50/百万 token。Sol 和 Argon 标价是前者的五分之一。Argon 的价格是过渡性的,后续会翻倍。

Feature GPT-6 Astra GPT-6.1 Sol Gemini 4 Argon Claude Fable 5.1
Developer OpenAI OpenAI Google DeepMind Anthropic
Released Sep 3, 2026 Sep 29, 2026 Announced Sep 30, 2026 Sep 1, 2026
Access OpenAI API, ChatGPT, Codex OpenAI API, ChatGPT Work, Codex Fairwind Program only Claude API, Bedrock, Google Cloud, Microsoft Foundry
Input / output (per 1M) $10 / $50 $2 / $10 $2 / $10 intro, then $4 / $20 $10 / $50
Cached input (per 1M) $1.00 $0.10 $0.10 intro $0.25
Long-prompt pricing Above 272K: $20 / $75 Above 272K: 2x input, 1.5x output Not disclosed Flat to 1M
Context window 1.05M 1.05M Not disclosed 1M
Max output per response 128K 128K 1M 128K
Reasoning control 5 effort levels, low to max 5 effort levels, low to max Not disclosed Effort levels incl. low, medium, high
Open weights No No No No

Sources: OpenAI GPT-6.1 Sol coverage, Gemini 4 Argon coverage, GPT-6 Astra long-context pricing, Claude Fable 5.1 specs. Standard first-party list prices, short-context tier.

cached-input 这行对 Agent 场景最关键。Agent 在每一步都会重新发送 system prompt、tool schemas 和历史记录。Astra 的 cache 读取价格为 $1.00,是 Fable 5.1 的 4 倍、Sol 的 10 倍。

Argon 的 1M 输出上限是唯一结构性异常值。其他三款的单次响应上限都停在 128K token。

Benchmark:各模型在何处领先

没有哪款模型能做到全面碾压。Argon 在知识工作和长周期编码任务上领先。Astra 在前沿软件工程和 computer use 上领先。注意:Terminal-Bench 4.0 的领先者是 Opus 5.5,不在本次横评阵容中。

Benchmark What it tests Gemini 4 Argon GPT-6 Astra Claude Fable 5.1
DeepSWE v1.1 Long-horizon software engineering 77.9% 74.1% 67.4%
Vals Index Finance, coding, legal and tax work 68.9% 63.1% 65.8%
FrontierSWE v2 Frontier software engineering 55.0% 65.5% 56.3%
Terminal-Bench 4.0 Agentic work in a terminal 57.4% 58.2% 57.9%
CWE-bench v1 Vulnerability remediation 68% (tie) 68% (tie) 58%
OSWorld-2.0 Computer use 69.2% 72.6% Not in Google's table

Source: Google DeepMind's published comparison, as reported in our Gemini 4 Argon coverage. Vendor-reported.

GPT-6.1 Sol 没有出现在 Google 的对比表中。根据 OpenAI 自家数据,Sol 与 Astra 非常接近:

  • DeepSWE v1.1:Sol 以约五分之一的价格与 Astra 基本持平
  • OSWorld 2.0 offline set:Sol 以约七分之一的单任务成本,落在了 Astra 2.1 分以内
  • AutomationBench 1.0.6:Sol 在 medium effort 下比 Claude Opus 5.5 高 2.2 分
  • Terminal-Bench Science 0.1:Astra 仍以 68.1% 领先。OpenAI 推荐 Astra 用于最困难的研究任务

不过在原始智能层面,独立信号指向了相反方向。在 Artificial Analysis Intelligence Index 上,Astra 得 61 分,Fable 5.1 高出 5 分。在 coding-agent 指数上,Fable 5.1 在 Claude Code 中得分 70,而 Astra 为 67。Artificial Analysis 还报告 Argon 在 Intelligence Index 上与 Astra 持平。

在 ARC-AGI-2 上,Astra 得 95%,Fable 5.1 得 90%。

单任务成本:标价相同,账单不同

Artificial Analysis 测算 Fable 5.1 单任务成本为 $9.18,而 GPT-6 Astra 为 $4.72,差距约 1.9 倍——但两者的标价完全一样。

差距来自 token 消耗量,而非单价。单任务成本 = 单价 × 消耗 token 数。在单价相同的前提下,Fable 5.1 消耗了更多 token。Anthropic 还指出,其新一代 tokenizer 在相同文本下产生的 token 数量多出约 30%。

两款更便宜的模型进一步改变了局面:

  • Gemini 4 Argon:Artificial Analysis 报告,在使用过渡价格的前提下,Argon 的 Intelligence Index 与 Astra 持平,而单任务成本是 Astra 的 60%
  • GPT-6.1 Sol:在 Terminal-Bench Science 上,OpenAI 报告 Sol 的单任务成本为 $5.47,而 Astra 为 $23.80

缓存复用可以让排名反转。以上单任务成本数据没有模拟大量缓存复用的场景。对于一个长时间运行的 Agent,每一步都会重新读取相同的上下文。以下是 200K token 缓存上下文、尚未计算输出 token 时的费用演算:

Model Cached rate (per 1M) Per step Per 100 steps
GPT-6 Astra $1.00 $0.20 $20.00
Claude Fable 5.1 $0.25 $0.05 $5.00
GPT-6.1 Sol $0.10 $0.02 $2.00
Gemini 4 Argon (intro) $0.10 $0.02 $2.00

Illustrative math from list cache rates. Astra's 200K context stays under its 272K long-prompt threshold.

在缓存密集型循环中,Fable 5.1 的上下文读取成本是 Astra 的四分之一。在看到单任务成本的新闻标题后,先用自己的 trace 数据对两者做实测。

哪款模型适合哪类工作

根据工作负载选模型,而非排行榜排名。GPT-6.1 Sol 是大多数团队的首选。另外三款在更狭窄的场景下才值得付出溢价。

Job Pick Why Runner-up
High-volume coding agents, CI bots, PR review GPT-6.1 Sol DeepSWE v1.1 与 Astra 持平,价格仅 $2 / $10,cache $0.10 Gemini 4 Argon,公开后
Hardest open-ended engineering GPT-6 Astra FrontierSWE v2 领先(65.5%) Claude Fable 5.1
Computer use and browser agents GPT-6 Astra OSWorld-2.0 领先(72.6%) GPT-6.1 Sol,差距 2.1 分
Long coding sessions inside a harness Claude Fable 5.1 Claude Code 中 Artificial Analysis coding-agent 得分最高(70);cache 读取 $0.25 GPT-6 Astra(67)
Hard science and research GPT-6 Astra Terminal-Bench Science 领先(68.1%) GPT-6.1 Sol,单任务成本 $5.47
Legal, finance and business automation Gemini 4 Argon Vals Index(68.9%)、AutomationBench(51.3%)和 Harvey Legal(19.6%)均领先 GPT-6.1 Sol;Claude Fable 5.1
Very long single outputs: big refactors, full reports Gemini 4 Argon 唯一支持单次 1M token 输出的模型 其他三款,按轮次拆分
Vulnerability finding and patching Gemini 4 Argon or GPT-6 Astra CWE-bench v1 并列第一(68%) Claude Fable 5.1(58%)
Tightest budget at frontier quality GPT-6.1 Sol 公开价格最低;Argon 仅在 Fairwind 内才匹配该定价 Gemini 4 Argon

其中两行的选择取决于访问权限。Argon 目前仅通过面向网络防御者的 Fairwind Program 提供。Astra 的完整攻击性安全能力位于 OpenAI Daybreak program 之后;公开版本拒绝高级攻击性网络任务。Anthropic 将其不受限制的孪生模型 Claude Mythos 5.1 放在了 trusted access programs 之后。

切换之前要核实的事项

本文大多数数据来自各厂商官方报告,各家在边缘指标上存在分歧。OpenAI 报告 Astra 在 Terminal-Bench 4.0 上为 57.9%,而 Google 的对比表中列的是 58.2%。

安全护栏会影响 Fable 5.1 的分数:Anthropic 在开启生产安全护栏的条件下运行 benchmark。被标记的网络和生物任务会路由到其他 Claude 模型,这可能压低了 OSWorld 和 AutomationBench 的结果。

Argon 的定价是临时的:$2 / $10 是过渡价,后续会升至 $4 / $20,具体时间未定。

Argon 的 context window 未公开:Google 公布了 1M 输出上限,但未披露输入限制。

单任务成本是一个快照:$9.18 和 $4.72 来自 Artificial Analysis 9月初的 Astra 跑分。effort 设置会大幅改变这些数字。

Anthropic 有一个更便宜的选项:我们的 Argon 报道引用了多份报告,指出 Claude Opus 5.5 在关键 agentic benchmark 上击败了 Fable 5.1,而 API 价格更低。它还在 Terminal-Bench 4.0 上以 66.4% 领先。

核心结论

  • GPT-6.1 Sol 在 DeepSWE v1.1 上与 Astra 持平,价格仅为后者的五分之一
  • GPT-6 Astra 在 FrontierSWE v2(65.5%)和 OSWorld-2.0(72.6%)上领先
  • Gemini 4 Argon 在 DeepSWE、Vals Index 和 AutomationBench 上领先,但仅在 Fairwind 内可用
  • Fable 5.1 单任务成本 $9.18 vs Astra 的 $4.72,标价完全相同
  • 对缓存密集型 Agent,Fable 5.1 的 $0.25 cache 读取成本是 Astra $1.00 的四分之一
  • 哪款最便宜?GPT-6.1 Sol,输入 $2,输出 $10,cache $0.10/百万 token。Argon 仅在 Fairwind 内以过渡价格才能与之持平
  • 哪款最适合编程?大批量用 Sol,最难任务用 Astra。Fable 5.1 在 Claude Code 中 Artificial Analysis coding-agent 指数排名第一
  • 我现在能用 Gemini 4 Argon 吗?仅限通过 Google Fairwind Program 的网络防御者

Asif Razzaq 是 Marktechpost AI Media Inc. 的 CEO。作为一位有远见的企业家兼工程师,Asif 致力于将人工智能的潜力用于社会公益。他最近的举措是推出了一个人工智能媒体平台 Marktechpost,该平台专注于深度报道机器学习和深度学习新闻,既具技术深度又易于广泛读者理解。该平台月浏览量超过 200 万,在受众中颇受欢迎。

Original source

本文由 AI 翻译整理自 MarkTechPost,原文版权归原作者所有。

阅读英文原文
上一篇
565 行 Python 从零实现编程智能体
下一篇
本地RAG开发113个评估问题后的实战总结