Anthropic 和 OpenAI 同日发布新模型,GPT-6 Luna 输入 token 成本仅 $0.10/M,较前代腰斩;Claude Opus 5.5 定价 $4/M 输出 $20/M,新一轮价格战开启。
昨天是 Grok 4.7(鹈鹕)和 MiMo v2.6 Flash/Pro(更多鹈鹕)。今天 Anthropic 发布了 Claude Opus 5.5,大约一小时后 OpenAI 发布了 GPT-6 Sol 和 GPT-6 Luna。要全面了解这些新模型还需要一些时间,但以下是到目前为止我的初步印象。
GPT-5.6 Luna 一直是我构建应用最喜欢的模型,因为它在性能出色的同时价格非常实惠。GPT-6 Luna 的价格居然再次降了一半——GPT-6 Sol 相比 GPT-5.6 Sol 也有类似的降幅。
以下是当前的价格格局:
Note that GPT-5.6 has a scheduled 25% price increase for November, so GPT-6 is half the price of the promotional pricing for those models.
(GPT-5.6 Terra 的定价与 GPT-6 Sol 相同,这意味着继续使用 Terra 的理由已经彻底消失。)
这种定价的竞争力怎么强调都不为过。Grok 4.7 定价 $2/$6,不足 GPT-5.6 Sol 的一半,但现在在输入价格上与 GPT-6 Sol 持平,输出价格也更加接近。
GPT-6 Luna 定价 $0.10/$0.50,是 OpenAI 发布过最便宜的模型之一,只有更弱一代的 GPT-4.1 Nano($0.10/$0.40,2025 年 4 月)和 GPT-5 Nano($0.05/$0.40,2025 年 8 月)比它更便宜。
我为 GPT-6 Luna 和 GPT-6 Sol 生成了鹈鹕图,然后将它们与 GPT-5.6 鹈鹕一起合并到这个对比网格中。我很喜欢这样可以一目了然地看到 5.6 系列选择了更大胆、更明亮的颜色,而 6 系列则内敛得多。我仍然认为 GPT-6 Astra 在最大思考努力级别下生成了最好的鹈鹕。

Opus 5.5 看起来解决了人们对 Opus 在沟通风格方面的最大抱怨。Thariq Shihipar:
Opus 5.5 是根据你们的反馈打造的。
它沟通清晰,智能水平与 Fable 5.1 相当,但每 token 成本比 Opus 5.0 更低,非常 token 高效,并且在每个思考努力级别下都能良好运行。
它还应该在 Blender 方面表现得更好。我很期待在那里测试它。
Opus 4.5、4.6、4.7、4.8 和 5 的价格都是一样的:输入 $5/百万 token,输出 $25/百万 token。5.5 降价 20%——变成了 $4/百万和 $20/百万。
缓存读取价格下降了 60%。这对于更长的 agent 对话非常重要,因为 90%+ 的输入 token 都是以缓存 token 价格处理的。
Opus 5.5 的新价格与 GPT-5.6 Sol 的价格相同,但那是在 OpenAI 将 Sol 价格减半之前的定价。
GPT-6 Astra 和 Claude Fable 5.1 的定价都是 $10/百万输入和 $50/百万输出。当前的价格战影响的是其下下一层级的模型。
Anthropic 表示 Sonnet 5.5 和 Haiku 5.5 即将推出。考虑到目前 Haiku 4.5 是 $1/$5,而最新的 GPT-6 Luna 价格是其十分之一的 $0.10/$0.50,看看 Haiku 是否能在低端重新获得价格竞争力将会非常有趣。
在我"生成一只骑自行车的鹈鹕的 SVG"测试史上第一次,Claude Opus 5.5 在"最大"思考级别下没能返回响应!
它首先称这是一个"经典测试请求",然后真的、真的、非常认真地思考它在做什么:
这是一个经典测试请求,所以我想要规划一只构图良好的鹈鹕,有着它独特的喙和喉囊,骑在一辆有适当车轮、车架和踏板的自行车上,背景是简单的天空和地面。[...]
验证小腿长度约为 95.2,几乎一致。现在我在计算从臀部到膝盖到脚踝的近侧腿路径,然后勾勒踩在踏板上的脚形——用路径描述脚跟、脚尖和脚底轮廓,线条和曲线使它自然地放在踏板表面约 y=478-494 处。[...]
我喜欢鱼突出地挂在篮子里、鹈鹕盯着它看这个有趣的细节。我还在确认眼睛位置靠近喙根部是否符合典型鹈鹕解剖学,并考虑给它一个更快乐的表情。[...]
远侧腿正确地读取为从车架后面穿过,所以我继续检查链轮齿并确认图层顺序——远侧曲柄臂应该大部分被座管和链轮遮挡。我正在确定最终 SVG 的宽度和高度属性以及 viewBox 以确保正确的缩放,注意没有文本所以不需要 font-family。[...]
我很兴奋地期待看到这只鹈鹕……但然后它停了。Opus 5.5 的最大输出 token 限制是 128,000(其他 Claude 模型也是如此),它在还在为 SVG 做推理时就触及了这个上限!
我试了第二次,得到了相同的结果。这让我怀疑"最大"级别基本上是无效的——如果它在一个愚蠢的 SVG 提示词上过度思考到崩溃,我不敢相信它在更有趣的工作上不会这样做。
(这两次失败各花了我 $2.56,几乎用了 20 分钟。)
Fable 5.1 在"最大"级别下没有过度思考,而且确实给了我见过的最好的鹈鹕。
这是 Opus 5.5 的鹈鹕,不包括 5.5 max。
我还制作了这个对比网格,将它们与 Opus 5、Fable 5.1 和 Sonnet 5 的鹈鹕进行比较:

通过它们画鹈鹕骑自行车的能力来比较不同模型供应商可能现在没有太大意义(如果它曾经有意义的话),但我仍然在使用同一模型家族在不同推理级别的对比中发现价值。
我现在将 GPT-6 Sol 和 Claude Opus 5.5 作为我在 Codex 和 Claude Code 中的默认模型。我已经将 agent.datasette.io 上的 Datasette Agent 演示升级为使用 GPT-6 Luna,它在 SQL 查询和为 Datasette Apps 构建 HTML 和 JavaScript 方面似乎既快速又胜任。
Jev 推出了一种新形态的 LLM——System One,也称为 Decision Models——2026 年 9 月 21 日
用 GPT-6 Astra 和 ChatGPT Work 生成跑步路线——2026 年 9 月 12 日
本文是 Simon Willison 的《Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna, and a new price war》,发布于 2026 年 9 月 22 日。
上一篇:Jev 推出了一种新形态的 LLM - System One,也称为 Decision Models
赞助我 $10/月,获取当月最重要 LLM 发展的精选邮件摘要。
付费让我少给你发邮件!