GPT-5.6 Luna降价80%无官方公告,价格追踪站23天未察觉,暴露了监测系统的漏洞和传统爬虫对API定价的失效。
7 月 9 日之后的某个时间,OpenAI 将 GPT-5.6 Luna 每百万 tokens 的价格从 $1.00/$6.00 下调到了 $0.20/$1.20。
这意味着,一款当前处于 frontier 级别的模型,价格直接降低了 80%。没有公告,没有 changelog 记录,也没有邮件通知。只是在某一天,定价页面悄悄换成了另一组数字。
我运营着一个追踪各大提供商 LLM API 定价的网站,但整整 23 天都没有发现这次变化。在此期间,我自己的追踪器一直发布着原来那组更高的价格。
我想聊聊这是为什么,因为背后的原因比这个错误本身更值得关注。
同一家族中的两款模型,在同一次扫描中被发现:
混合价格按输入与输出 3:1 的比例计算,这大致符合真实聊天或 RAG 工作负载的情况。直接对输入、输出价格取平均值,会让输入价格便宜的模型显得比实际更贵。
有三点让我确信,这是提供商真实调整了价格,而不是我误读了页面:
Batch 和 Flex 两个 tier 完全同步变动——两者的新价格都恰好是标准价格的一半,与此前的比例关系完全一致。抓取错误不会如此准确地保留内部比例。
Sol 的价格完全没有变化。如果是解析失败,同一家族的三行数据都会被破坏,而不会只影响其中两行。
旧价格本身已于 7 月 9 日通过两个来源交叉验证。调整前的数据并不是猜测。
所以,结论很明确:这是一次真实的降价,只是悄无声息地上线了。
如果你正在构建任何依赖第三方定价的系统,这部分值得认真关注。
API 定价没有 changelog。OpenAI 没有,Anthropic 没有,Google 也没有。你能看到的只有一个定价页面:页面渲染出一个数字,而这个数字只代表今天的价格。没有版本历史,没有 RSS feed,没有 webhook,也没有弃用通知。如果你想知道价格发生了什么变化,就必须事先记录它原来是多少。
在我的案例中,三道彼此独立的安全网同时失效,而且它们失效的方式很有启发性:
社区数据集里没有相关信息。大量工具在定价方面暗中依赖 LiteLLM,但 LiteLLM 从未收录过任何 gpt-5.6-* 条目。如果你的成本估算来自社区价格表,就必须明白:数据缺失看起来与“什么都没变”完全一样。
我的每周验证扫描从未选中过它。这个扫描机制会从模型池中轮换选取一批模型,与提供商的官方定价页面重新核对。Luna 不在选中的模型里。扫描机制本身没有出错,只是它根本没检查那里。
唯一知道问题的系统,却用一种毫无用处的方式告诉了我。我设置了一个覆盖率 tripwire,它准确地针对这款模型发出了警告:“这里的价格即使错误,也不会被发现。”但这条消息被打印在了长达 375 行的警告信息墙中,随后系统还建议我通过 LiteLLM ID 文件映射这个模型来修复——然而 LiteLLM 根本没有收录该模型。如果一条警告给出的解决方案根本无法执行,那它就不能算警告,只是带着愧疚感的噪声。
我真正从中得到的教训是:一个已经存在、却一直被忽略的信号,暴露的是执行约束问题,而不是检测问题。我不需要更好的检测器。我需要让现有检测器大声失败,而不是礼貌地写下一条没人会读的日志。最终随价格修正一起上线的,就是这个改动:让 tripwire 直接打断构建,而不是继续往无人查看的日志里加一行文字。
由于我每天都会记录所有提供商的每项价格,因此我可以观察到一些无法从任何单一定价页面看出来的市场现象。
当前,frontier intelligence 每百万 tokens 的成本为 $4.66。
这是一个覆盖九家不同实验室、九款 frontier 模型的等权重链式指数。这九家实验室分别是 OpenAI、Anthropic、Google、xAI、DeepSeek、Alibaba、Mistral、Z.AI 和 Moonshot。自 2 月下旬以来,该指数下降了 3.7%,最近 7 天则完全没有变化。
这个模型篮子里有三个发现令我感到意外:
低价区间便宜得离谱,而且模型并不差。DeepSeek V4 Pro 的混合价格为 $0.544,大约只有 GPT-5.6 Sol 的二十分之一,后者的混合价格为 $11.25;但在 Vellum 排行榜上,DeepSeek 得分为 71.5,Sol 则为 83.8。将其标准化为每个 benchmark 分数点的成本后,DeepSeek 每分只需 $0.0076,而该指数的平均值为 $0.0637。换句话说,它的成本效率大约是 frontier 模型平均水平的八倍。最后那 12 个 benchmark 分数点是否值得支付 20 倍的价格溢价,这是一个真实的工程决策,但大多数团队从未明确做出过这个决定。
Open weights 确实更便宜,但差距并不大。模型篮子中的 open-weight 模型,平均混合价格为 $4.08;closed 模型则为 $4.83。每百万 tokens 只差 75 美分——远小于“开源基本免费”这种直觉所暗示的差距。如果你选择 open weights,应该是为了可移植性和 fine-tuning,而不是 token 价格。
frontier 模型的更替速度快得惊人。短短两周内,这个模型篮子发生了五次模型交接:GPT-5.5 → GPT-5.6 Sol、Grok 4 → Grok 4.5、Claude Opus 4.8 → Opus 5、Qwen3-Max → Qwen3.7-Max,此外 Kimi K3 还作为新的成分模型加入。十四天内,九个席位中有五个发生了变化。一个月前构建的任何成本模型,描述的很可能都已不再是当前模型。
而且,价格并不只会下降,这一点经常被人忽略。在同一时间窗口内,Mistral 将 Mixtral 8x7B Instruct 的价格上调了 29.6%($0.54 → $0.70),并将 Mistral Small 3.2 24B 的价格上调了 36.4%($0.08/$0.20 → $0.10/$0.30)。这些调整同样没有任何公告。
下面是一些具体建议,大致按实施成本从低到高排列:
在成本模型中固定价格,并记录日期。不要只写“GPT-5.6 Luna 的价格是 $1”,而要写成“截至 2026-07-09,GPT-5.6 Luna 的价格为 $1.00/$6.00”。没有生效日期的成本估算,只是一个假装成事实的数字。这是所有建议中价值最高的一条,而且不需要付出任何成本。
在执行任何依赖该数字的操作前,重新验证价格。比如预算审批、模型选择决策以及面向客户的定价。花五分钟查看提供商自己的定价页面,远胜于依赖三周前缓存的数字——而我已经用惨痛经历证明了这一点。
不要把社区价格表当作唯一事实来源。它们确实很有用,维护者也都很认真,但覆盖缺口不会发出任何声音。某个模型没有被列出时,看起来并不像存在数据缺口,而更像是没有任何变化值得报告。
按照你的真实输入输出比例计算混合成本。一个读取 50k tokens、只写出 500 tokens 的摘要器,与一个不断生成内容的 Agent 循环,在成本结构上完全不同。哪款模型更“便宜”,会随着你属于哪一种工作负载而发生反转。
检查 prompt caching 是否会改变结论。对于任何需要重复读取相同上下文的场景——Agent、RAG、长对话——缓存输入价格对排名的影响,可能比页面上的主打价格更大。在这类比较中,它也是最常被忽略的变量。
我专门构建了一个工具,用来发现这一类问题,但对于行业中最大提供商旗下的一款当前模型所发生的 80% 降价,我仍然花了 23 天才注意到。
这并不是一个关于我的工具有多差的故事。它真正说明的是:这个生态系统在多大程度上依赖着一堆根本无人持续关注的数字。如果一个拥有每日快照和验证扫描机制的专用追踪器,都能带着错误价格运行三个星期,那么你在 6 月份用来计算单位经济模型的那张 spreadsheet,情况不会更好。
把日期写在价格旁边。这就是整件事最重要的结论。
以上指数数据会实时更新在 modelpricewatch.com/price-index,其中包含完整的方法论,以及每月发布的 State of LLM Pricing 报告。每项价格都会注明其对应的提供商页面和抓取时间戳。
披露:我是 ModelPriceWatch 的维护者。
你的成本模型里还留着多久以前的价格?现在就去检查一下——我真的很想知道,你们当中有多少人会找到已经过期的数据。
如果需要采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。