单个 README 修正消耗 21000 输入 token,Agentic 工作负载比标准 Chatbot 多耗 5-30 倍 token,RAG 管道和常驻监控 Agent 使成本进一步膨胀。
一次请求从来不只是一次调用
Gartner 2026 年 3 月的分析显示,agentic 工作负载每个任务的 token 消耗是标准聊天机器人的 5 到 30 倍,而在典型的生产环境中,一个用户请求通常会落地为 10 到 20 次模型调用。
随着系统的野心增大,数字会变得更难看。RAG 流水线每次查询都会携带巨大的上下文窗口。常驻监控 agents 全天候扫描日志、收件箱和市场数据,无论有没有人在看都在消耗算力。这些后台工作负载两年前在企业预算中几乎不存在,如今却占据了推理支出中越来越大的份额,因为没有人把它逐项列出来。
在 1 万用户规模下,单个 agentic 功能每月可能消耗 15 万到 75 万美元。五十用户时看起来可行的 pilot,测量的是另一个系统。代码没变,模型也没变,是规模变了——而规模才是决定一切的那个变量。
甚至有一种粗略的方式来衡量这个打击有多疼。对失败 agent 部署的分析显示,成本悬崖在 500 到 5000 用户之间,在这个范围内云 API 定价开始变得不合算,团队面临被迫迁移到他们从未规划过的自托管 GPU。一家有据可查的创业公司在 700 到 1000 并发用户之间眼睁睁看着单位经济指标反转,然后关停了产品。
系统在技术上是可行的。它在商业上失败了,而失败在白板阶段就已经被写入了。
Token 价格在持续下降,这使得消费模式看起来非理性——直到你把它拆解开来。根据最新分析,GPT-3.5 级别模型的推理成本从 2022 年的每百万 token 20 美元降到了 2024 年 10 月的大约 0.07 美元,跌幅达 280 倍。然而企业 AI 预算的平均水平从 2024 年的每年约 120 万美元增长到了 2026 年的 700 万美元。
折扣已经落地之后,账单却仍在攀升,这说明驱动力从来就不是价格。消费正在以更大的幅度超越它。
最大的驱动力隐藏在 agent 循环内部。每一步推理都会重新发送系统提示词、工具定义、指令以及累积的对话状态。
公司们在一次次地为模型重新读取它已经处理过的材料买单。加上输出定价——在大多数提供商那里输出定价比输入定价高出数倍——任何在每一步都生成冗长响应的 workflow 都会让问题进一步恶化。
供应商定价在走云的老路
账单目前看起来还能承受,还有第二个原因。当前的模型定价是有补贴的。推理提供商正在以低于成本的价格抢占工作负载,这个策略与十年前云提供商的做法如出一辙。打折的算力锁定客户进入某种架构,而一旦架构变得不可动摇,费率就 normalization 了。2017 和 2018 年被云成本增长杀了个措手不及的财务团队,记得那场对话是怎么结束的。
早期的信号已经清晰可见。一家行业分析跟踪到某些工作负载在十二个月内 OpenAI 定价上涨了 4 倍。这个数字是否在各个提供商那里都成立并不重要,重要的是方向。在今天有补贴的费率上构建 agentic 系统的公司,是在用别人的风险投资为他们的单位经济担保,而那个补贴带着一个没有人会提前宣布的过期日。
这套玩法第一次就奏效了。没有理由期待它会被改写。
把成本模型做进架构里
研究表明,小语言模型可以用比前沿模型低 10 到 30 倍的推理成本处理 60% 到 80% 的企业 agent 子任务。分类、格式化和检索很少需要前沿模型,而一个路由机制把昂贵的推理保留给那些真正需要的步骤,这件事对成本曲线的影响比任何价格谈判都大。
下一个杠杆是激进地裁剪和缓存:每一步只传递它需要的上下文,而不是整个历史;缓存工具结果和语义相似的响应,这样系统就不会为生成两次相同的答案而付费。由于重新发送的上下文占据了 agent 支出的主体,这里通常是最大节省空间所在。
给循环设置上限同样重要。错误分类让 agent 知道哪些失败值得重试,哪些应该升级给人。没有上限的重试策略就是没有上限的预算。
所有这些在没有早期治理的情况下都不成立。AI FinOps 这门新兴学科的存在正是为了解决这个问题:按任务、按步骤、按工具调用来追踪支出,这很重要,因为汇总的月度数字会掩盖那个独自消耗了 40% 预算的工作流。现在就指定一个负责人并设置阈值——趁数字还小到可以冷静讨论的时候——意味着当 CFO 最终问到一个 agent 要花多少钱时,有人能给出比发票总额更具体的答案。
循环在哪里挣回它的价值
这一切都不是在反对 agents。当一个循环取代了数小时的熟练工作,无论 token 价格如何,20 次模型调用都是划算的。关键在于知道哪些 workflow 配得上它们的循环,哪些只是在烧算力来移动一个逗号。
架构决策和预算决策是同一个决策。分开做只是延后了那场它们终究要合并的会议,而在那场会议上,发票决定了真正的结局。
Nick Talwar 是一位 CTO,曾任职微软,是一位身在一线支持高管们应对 AI 采用的 AI 工程师。他分享关于 AI 优先策略如何驱动底线的洞见。
→ 在 LinkedIn 上关注他,获取他的最新思考。
→ 订阅他的免费 Substack,获取直接送达收件箱的深度文章。
→ 观看直播专场,了解受监管行业的领导者如何利用 AI 减少手动工作并驱动 ROI。