两家同天发布新模型,Claude Opus 5.5 输入降价 20%、缓存读降 60%;GPT-6 Sol 主打低价位,Agent 编程成本将进一步压缩。
2026 年 9 月 22 日,发生了一件不寻常的事:Anthropic 和 OpenAI 在大约一小时内先后发布了新的 AI 模型。Anthropic 发布了 Claude Opus 5.5,这是其全新 Claude 5.5 系列的首款模型。OpenAI 则反击推出了 GPT-6 Sol 和 GPT-6 Luna,两款定位低于旗舰产品 GPT-6 Astra 的更廉价模型。两家厂商做了同一件事——性能更强,价格更低。本周 Grok 4.7 和小米 MiMo-V2.6 也相继发布,但真正改变开发者 AI 成本的是 Anthropic 与 OpenAI 的这场对决。
以下是新模型的实际表现、基准测试数据,以及这对以写代码为生的开发者意味着什么。
Claude Opus 5.5 是 Anthropic 的新旗舰,取代了发布仅两个月之久的 Opus 5。最大的亮点不是原始智能——而是效率:
价格:每百万输入 tokens 4 美元,每百万输出 tokens 20 美元——比 Opus 5 低 20%。Anthropic 表示,缓存读取占大多数 Agent 编程成本,其费用下调 60%,降至每百万 0.20 美元。
性能:Anthropic 声称 Opus 5.5 在大多数工作中与 Claude Fable 5.1(其顶级模型)持平,同时运行成本比 Opus 5 典型工作负载低 40%——体现在输出速度提升 30% 以上且每任务 tokens 消耗更少。
快速模式:Claude Code 中提供 research-preview 选项,每百万 tokens 8/40 美元,输出速度提升高达 2.5 倍。
可用性:API、Amazon Web Services、Google Cloud、Microsoft Azure,以及 Claude Pro/Max/Team 计划,其中五小时用量限制正在上调。
在安全方面,Opus 5.5 在发布前由外部评估机构 METR 和 Frontier Design 进行了测试。Anthropic 表示,与 Opus 5 相比,它绕过边界的行为减少了约 85%。一个值得注意的变化是:"思考"模式已无法关闭,且该模型搭载了符合欧盟 AI 法案的水印措施。
Anthropic 发布了一组厂商自测分数。这些数据来自公司自身和二次报道,而非独立第三方测试——应将其视为方向性参考,尤其是 Anthropic 自身也警告过:"在这个能力级别上,基准测试的分数差距已不再是现实世界差异的可靠指南":
对开发者而言,"每任务成本"这个视角更有意思:Anthropic 声称 Opus 5.5 以约三分之一的每任务成本,在 GPT-5.6 Sol 的最高 CursorBench 分数上领先 11 分;在 Terminal-Bench 4.0 上与 GPT-6 Astra 持平,成本约为 Astra 的 40%;在 FrontierCode 最高分上击败 Astra,而每任务成本仅为其五分之一。
最具体的一项claim是一对内部工程测试:将 HAProxy 负载均衡器从 C 语言翻译为 Rust,Opus 5.5 耗时 9.5 小时,Fable 5.1 耗时 12 小时,成本降低 51%,两份重写均通过了几乎所有回归测试。在一份报告撰写测试中(任何虚构数据或引用都会导致质量评分不达标),18 份 Opus 5.5 报告中有 16 份通过——而 Fable 5.1 和 Opus 5 的通过次数为零。GitHub 和 Deloitte 的早期测试者报告,每任务 tokens 消耗更少,代码审查中的 bug 捕获率更高。
OpenAI 的两款 9 月 22 日发布产品瞄准价值区间,每个都比上一代 GPT-5.6 便宜约一半:
GPT-6 Sol(每百万 2/10 美元)——专为编程和多步推理构建,OpenAI 声称事实性错误显著减少。
GPT-6 Luna(每百万 0.10/0.50 美元)——专为高容量日常任务构建,单次调用成本比深度更重要。
两款都位于旗舰 GPT-6 Astra 之下。如果你还记得 GPT-5.6 Sol,我曾分析过为什么那款模型是快速编程答案的理想选择——以下是笔者免费使用它的方法——而 GPT-6 Sol 就是其直接继承者,价格仅为其一半。
Opus 5.5 看起来是 Agent 编程工作、大型迁移和深度调试的首选——这些正是 Anthropic 效率提升发挥复利效应的任务。订阅用量限制的上调对重度 Claude Pro/Max 用户也颇具吸引力。
GPT-6 Sol 更适合日常编程辅助:快速解答、bug 修复、多步推理,成本只是旗舰的一小部分。GPT-6 Luna 则用于后台自动化和高容量分类/摘要场景——你需要最便宜的可用调用。
值得了解的诚实局限性:
所有基准测试数字均来自厂商报告。Anthropic 自身的警示同样适用于 OpenAI 的数字——在做出决定前,运行你自己的任务集。
Opus 5.5 仅输出文本,知识截止日期为 2026 年 6 月。
定价变化很快。本文引用的价格数据截至 2026 年 9 月 25 日;预算前请查看厂商定价页面。
"与前沿保持同步"的背景:这是 Anthropic 自其 CEO 主张 AI 进步应与安全实践保持同步以来的首次发布——5.5 系列明确是效率优化版本,而非能力飞跃。Claude Sonnet 5.5 和 Haiku 5.5 预计将在未来几周内发布。
两个月前,前沿编程辅助需要旗舰级的花费。现在 Opus 5.5 以低 40% 的运行成本匹敌顶级水准,GPT-6 Sol 以 2/10 美元的价位完成严肃推理,Luna 以微不足道的成本处理批量工作。对开发者的实际建议:把廉价模型放在日常任务上(审查、摘要、样板代码),把昂贵的调用留给难题——正是这种分层配置,如今的成本只是八月份的一小部分。
想要亲自对比当前一代模型的实际表现吗?Toolxz AI Chat 提供免费、无需注册的访问,涵盖前沿模型包括 Claude Fable 5.1 和 GPT-5.6 系列——这些新发布所对标性能级别的模型——因此你可以在新模型全面铺开的同时,自行对上一代进行基准测试。
我什么时候可以用 Claude Opus 5.5? 现在已在 Claude 平台、API、AWS、Google Cloud 和 Azure 上线,模型名称为 claude-opus-5-5。
GPT-6 Sol 和 GPT-5.6 Sol 一样吗? 不一样。GPT-6 Sol 是 2026 年 9 月的新发布,价格约为 GPT-5.6 系列的一半,聚焦编程和多步推理。GPT-5.6 Sol 是其前代。
开发者应该信任哪个基准测试? 没有哪个能单独信赖。SWE-bench Pro 在编程上区分度较高(Opus 5.5 以 89.9% 领先,见 9 月 24 日 leaderboard),但 OpenAI 自身也指出了该基准 public split 存在的问题。用 leaderboard 做初筛,然后在你的代码仓库上测试。
价格会继续下跌吗? 趋势指向是——两家厂商本轮降价 20–60%。但请把今天的价格当作今天的事实,搭建时再核实。
这些数字的来源是什么? Anthropic 的发布公告和 system card(通过 Unite.AI 和 Reuters)、AI Stock Wire 的价格战分析、ETV Bharat 的发布报道,以及 BenchLM.ai 的 SWE-bench Pro leaderboard。
Toolxz(toolxz.com)创始人——45+ 款免费浏览器工具。我写关于实用 AI 工具和开发者工作流的内容。