用经济学解释为什么 OpenAI 降价 80% 后 AI 总成本仍上升:廉价催生新需求,Agent 工作负载增加 10-50 倍 token 消耗。
本周 AI 价格战又有了新动向:OpenAI 将 GPT-5.6 Luna 的价格下调了 80%,GPT-5.6 Terra 则降价 20%。Claude Opus 5 登陆 Amazon Bedrock,定价维持在每百万 token 输入 5 美元、输出 25 美元,并提供 100 万 token 的上下文窗口。每条新闻标题表达的都是同一个意思:智能正在迅速变得更便宜。
可为什么我接触的每一个工程团队都在反映同一件事——这个季度,云账单里的 AI 支出又增加了?
因为整个技术栈中,只有 token 在变便宜,而 token 在账单中的占比却越来越小。我们来算算这笔账。
1865 年,经济学家 William Jevons 发现,效率更高的蒸汽机并没有减少煤炭消耗,反而增加了消耗量。因为效率提升后,蒸汽动力可以用于那些过去因成本过高而无法采用它的场景。
把煤炭换成 token,道理也是一样。当 Luna 降价 80% 后,团队不会把节省下来的钱揣进口袋,而是会启动那些按原价计算时处于成本临界点的工作负载:
那个“在每个 PR 上运行都太贵”的代码审查 bot,现在会在每个 PR 上运行。
原本每天执行一次的日志摘要任务,现在改为每小时执行一次。
原本只负责回答问题的 Agent,现在开始直接采取行动——而一个执行任务的 Agent 所消耗的 token,是问答型 Agent 的 10~50 倍,因为规划、执行、验证循环就是一座 token 熔炉。
价格降低 80%,随后用量增长 10 倍,最终账单反而会翻一倍。这并不是团队缺乏成本纪律,而是降价在完全按照预期发挥作用——当然,是按照厂商的预期。
更重要的变化是:token 支出正在成为 AI 基础设施成本中的少数部分。以下是今年围绕模型陆续上线的技术栈:
Agent 运行时。 AWS Bedrock AgentCore、Azure Foundry Agent Service、Vertex AI 的 Agent 技术栈——今年,每一家主要云厂商都推出了托管式 Agent 基础设施。运行时、网关、身份管理、托管内存:每一项都是 2024 年账单上还不存在的全新计量收费项目。你付费购买的并不是智能本身,而是支撑智能运行的脚手架;而脚手架不会在某个星期二突然降价 80%。
Agent 的记忆与状态。 长期记忆存储、向量数据库、会话持久化。记忆的成本由存储和检索计算组成,其定价遵循传统云服务的成本曲线,也就是缓慢下降,而不是模型成本那种断崖式下跌。
可观测性。 追踪 Agent 做过什么、评估输出结果,以及为审计保存完整的对话链路。团队经常会发现,自己的 LLM 可观测性支出已经可以与 token 支出相提并论——相当于每个 token 都要存储并查询两遍。
GPU 成本底线。 如果你自行运行过任何推理服务,就会知道一个难以启齿的秘密:自托管模型的经济性主要由利用率决定,而具有突发性的 Agent 工作负载恰恰是利用率的毒药。为了应对 Agent 活动峰值而配置的 GPU 节点池,大部分时间都处于闲置状态,却始终按全价计费。
从我在真实账户中观察到的大致结构来看:2024 年约为 80% token、20% 其他成本,如今正在转向约 30% token、70% 运行时、记忆、可观测性与 GPU 成本——与此同时,AI 总支出仍在逐季度增长。
过去两年,AI 成本一直有一套令人安心的叙事:“再等六个月,价格就会下降。”对 token 来说,这确实如此。但对技术栈中的其余部分来说,这一点毫无意义——其余部分都是普通的云基础设施,影响它们的是常规的 FinOps 手段,而不是模型厂商之间的价格战:
闲置的 Agent 运行时和 GPU 资源池,与闲置的 EC2 遵循相同的规律——为它们设置调度计划。评估环境中的 GPU 节点组没有任何理由在凌晨 3 点继续运行(我们会像安排 staging 环境一样,定时让它进入休眠;使用的也是同一套工具,ZopNight 会把 GPU 节点组视为任何其他可调度资源来处理)。
可观测性数据的保留时长是一个可以调节的选项。为聊天机器人保留 90 天的完整链路是一种选择,而这通常恰好又是默认设置,并且这个默认设置代价高昂。
“更便宜的模型”是一项规格优化决策。Luna 降价 80% 后,模型选择已经成为与实例选择同等重要的成本杠杆。把较简单的 70% 请求路由到低价层级,就相当于今年版本的“把开发环境迁移到 spot 实例”。
异常检测需要覆盖 AI 资源。陷入重试循环的 Agent,就是新时代的“忘记关闭 p4d 实例”——按天汇总的账单粒度完全发现不了它,直到它变成一个非常显眼的数字。
价格战的新闻标题都是真的,而且还会不断出现——Luna 不会是最后一个降价 80% 的模型。但在今年的某个时间点,“token 变便宜了”和“运行 AI 变便宜了”已经不再是同一回事。账单的重心已经转移到模型周围的基础设施上,而这一部分不会随着价格战出现断崖式降价。它只会像云账单一直以来那样:悄无声息地增长,直到终于有人认真查看。
模型降价之后,真的有人看到自己的 AI 总支出下降了吗?我一直在问,却还没有找到这样的例子——如果你是个例外,我确实很想知道,你采用了哪些不同的做法。
如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。