单步 Chat 只需 800 tokens,但多步自主 Agent 工作流因系统提示词、工具 Schema、自我修正循环等叠加,单任务可达数万 tokens,成本骤增。
周末,我在跑一个自主 Agent 评估流水线时,收到了 Anthropic 的账单提醒:不到 3 小时就烧掉了 85 美元。
我的第一反应是陷入了无限循环。但检查日志后,发现每一个工具调用都成功执行了,Agent 也正常终止了。
那钱花到哪儿去了?
2026 年,基础前沿模型(GPT-4o、Claude 3.5 Sonnet、Gemini 1.5 Pro)的每 token 价格相比往年已经下降了将近 70%。
然而企业和独立开发者的 AI 账单却上涨了 300% 到 500%。
这就是所谓的推理悖论:
随着基础 token 价格暴跌,从"单轮对话"到"多步自主 Agent"的架构转变,使得每个任务的 token 消耗量级增长了数倍。
单轮对话:
[用户提示词:300 tokens] ➔ [LLM 回复:500 tokens] = 800 tokens 总计 ($0.003)
多步 Agent 工作流:
[系统提示词 + 15 个工具模式定义:3,500 tokens]
➔ 步骤 1 工具调用 + 结果(+1,200 tokens)
➔ 步骤 2 检查 + 代码分析(+4,500 tokens)
➔ 步骤 3 自我修正循环(+6,000 tokens)
➔ 步骤 4 最终执行(+2,000 tokens)
= 每个任务约 45,000 个累积上下文 tokens($0.15 - $0.35)
如果用 Agent 批量测试 200 个任务,你突然发现一个原本只需要 $2.00 的任务现在要花 $70.00。
每一个工具定义(参数、属性、描述)都会被预置到每一次推理请求中。如果你的 Agent 配备了 20 个 MCP(Model Context Protocol)工具,那么在用户还没输入一个字之前,你每次轮询就要支付 3,000 tokens 的税。
自我修正机制("检查你的输出并修复错误")会强制模型重新读取整个执行历史。如果一个 Agent 循环 5 次来修复一个 lint 错误,它就要单独读取这份臃肿的对话记录 5 次。
不同的模型家族对文本的 tokenize 方式不同:
一个包含缩进和 JSON 括号的代码块,在 Claude 中的 token 密度可能比 Gemini 高出 30%,这会让你的预算计算完全失准。
为了避免意外,我在 OmniTool Hub 中直接内置了一个交互式 AI Token 计数器和多模型成本计算器。
利用提示词缓存:确保你的系统提示词和静态工具模式位于上下文窗口的起始位置,以利用 90% 折扣的缓存命中。
将低复杂度的步骤路由到小型模型(SLM):不要用前沿模型来做 JSON 格式化或字符串清理。将它们路由到 Qwen 2.5 7B 或 GPT-4o-mini。
循环前先计算:在启动无人值守的批量任务之前,先测量基线的 token 占用量。
你可以在 OmniTool Hub(ai-token-counter)免费试用这个 token 计算器——完全开放、客户端执行、无需登录。
你有过使用 Agent 时突然收到高额 token 账单的经历吗?你使用什么缓存或路由策略?欢迎在评论区讨论!