同一天 OpenAI 和 Anthropic 双双推出低价前沿模型:GPT-6 Sol 输入 $2/输出 $10,Claude Opus 5.5 比 Opus 5 便宜 40%,推理成本竞争加剧。
Photo by Taylor Vick on Unsplash

本周二,OpenAI 和 Anthropic 在数小时内先后推出了更便宜的前沿级模型。OpenAI 在旗舰款 Astra 之下新增了 GPT-6 Sol 和 GPT-6 Luna,Anthropic 则发布了 Claude Opus 5.5。同一周,阿里巴巴的芯片部门也展示了一款新的训练和推理加速器。综合来看,这些事件指向同一个方向:"足够智能"的模型调用成本正在快速下降,而真正有意思的工程问题正在转向别处。
以下是我的解读:实际发生了什么,以及开发者应该怎么做。
OpenAI 表示,将 Sol 和 Luna 的 API 价格相比 GPT-5.6 促销价下调 50%。按每百万 token 计费,Sol 从 $4 输入 / $20 输出降至 $2 / $10,Luna 从 $0.20 / $1.20 降至 $0.10 / $0.50。公司将原因归功于"缓存和推理层面的改进",并表示将把节省的成本让渡给用户。
Anthropic 对 Opus 5.5 的定位是:在大多数工作中"达到 Claude Fable 5.1 的水平",且在典型工作负载下运行成本比 Opus 5 低约 40%。列表价格为每百万 token $4 输入 / $20 输出,比 Opus 5 低 20%。更值得关注的是缓存定价:缓存读取为每百万 token $0.20,比 Opus 5 低 60%,Anthropic 指出"缓存读取占 Agent 任务和编码工作成本的大部分"。
CNBC 将两家公司的发布定性为应对来自阿里巴巴、Moonshot AI 和 DeepSeek 等公司更便宜的开源权重模型的压力。这个判断我认同。前沿实验室降价并非出于自愿,而是因为"最佳模型"和"足够好的开源模型"之间的差距,在很多日常工作中正在不断收窄。
如果你在跑 Agent,大部分 token 并不是新的。同样的系统提示词、工具定义、仓库上下文和对话历史,在每一步都会被重新发送。这就是为什么 Anthropic 突出缓存读取比标题输入价格更有意义。一个 Agent 循环如果重新读取大上下文 30 次,它主要支付的是缓存费率,而非列表费率。
OpenAI 从另一个角度做了同样的布局:它表示自己的降价部分来自基础设施层面更好的缓存。
实践要点:如果你的应用没有将提示词结构化——让稳定部分排在前面、且每次调用时字节完全一致——那你就是在把大部分节省拱手让出。把系统提示词、工具 schema 和长期上下文放在顶部,把变化的部分(最新的用户消息、最新的工具结果)放在末尾。这是老生常谈的建议,但在本周它变得值钱多了。
两家公司的发布公告都附有大篇幅基准测试表格,且都拿对方实验室的模型做对比。OpenAI 表示 GPT-6 Sol 在最高 effort 级别下,以"仅 Opus 5 单任务成本 9%"的表现超越了 AutomationBench 上的 Claude Opus 5。Anthropic 自己的表格则显示 Opus 5.5 在 Terminal-Bench 4.0 等 Agent 编码基准测试中领先。
这些数字是自报数据,在各厂商自选的设置下运行,而且往往拿自己的最新款对比对方的上一代。值得肯定的是,Anthropic 说得坦白:"在这种能力水平上,我们发现基准测试的差距对现实世界差异的指引已经不那么可靠了。"
我认为这是两份公告中最有用的一句话。当两个模型如此接近时,唯一重要的基准是你的任务集。如果你没有从产品中提取的真实提示词小评估集,没有可以自动校验的预期输出,这是一个好时机去建一套。价格下调到这个程度正是切换模型的收益开始显现的时候,而没有评估你就无法安全切换。
两份发布都做对了一件事:谈论按任务计费,而不仅仅是按 Token 计费。一个更便宜的模型如果需要三次重试,或者思考时间翻倍,最终可能更贵。OpenAI 报告 Luna 在 AutomationBench 上以"比上一代低 58% 的单任务成本"提升了 5.4 个百分点。Anthropic 表示 Opus 5.5 根据 effort 级别使用更少 token。
对开发者而言,这意味着定价页上的 Token 单价只是图的一半。记录每个完成任务的 Token 消耗、重试次数、以及人工介入的频率。这才是决定一个模型对你来说是否真的更便宜的数字。
在供给侧,阿里巴巴芯片子公司 T-Head 在杭州云栖大会上发布了 Zhenwu V900。据 TechNode 报道,公司声称性能是前代的三倍,216GB 内存,1,200GB/s 的芯片间带宽,原生支持 FP8 和 FP4。声称 1,000 颗以上芯片可协同作为单一系统,集群规模可达 50 万个加速器。量产预计在 2027 年第一季度。这些都是厂商自述,目前尚无独立基准验证。
让我印象深刻的是重点所在——不是原始 FLOPS,而是内存、互联和低精度格式,这些才是向大量 Agent 提供大模型服务时降低成本的关键。这与 API 价格中呈现的压力一脉相承:推理成本已成为主战场。
在新档位上重新跑你的评估。一款价格现在只要一半的中档模型,可能已经能覆盖你目前发给顶配模型的很多任务。
为缓存重组提示词结构。稳定内容在前,变化内容在后。
按任务追踪成本。Token 数、重试次数、人工介入次数。
不要锁定。在价格变动如此剧烈的时期,一层能让您切换供应商的薄抽象,其价值已经超过了搭建它所需的几个小时。
更便宜的模型不会让精心工程变得不再重要。它们只是把成本决策的战场——评估、缓存和路由——推到了模型调用之外那些地方。
你在自己的使用中看到了什么?缓存真的占据了你账单的最大头吗?
本文由 AI 辅助撰写,发布前经过事实核查(来源和链接已验证)。