单次编程代理任务消耗100万至350万Token(76%为读取),主流模型缓存读取折扣最高达56倍;优化Prompt结构将稳定上下文前置可大幅降低成本。
如果用聊天机器人的方式给 coding agent 定价,你每次看账单都会看走眼。
普通代码对话是一个 prompt 对应一个 completion。而 coding agent 运行的是一个循环:读取文件、调用工具、读取输出、编辑、重新运行测试、自我修正——往往要十几轮。2026 年的研究(斯坦福、MIT 等)显示,单个 agentic-coding 任务大约消耗 100–350 万 token,其中约 76% 是读取。一项研究发现,agentic coding 消耗的 token 量可达普通代码对话的 1000 倍。
关键结论不是"agents 很贵",而是"计量单位错了"。你不是按每百万 token 付费的,你是按任务付费的——而有两个杠杆对那个数字的影响,比模型名称大 5–10 倍。
coding agent 几乎在每一轮都会重新发送相同的上下文——system prompt、项目文件、工具定义。缓存读取的费用是基础输入费用的一小部分。在一个有透明缓存定价的网关上,差距非常明显:
将 prompts 结构化,让稳定上下文可缓存,新内容追加在末尾,这样折扣会在一个长会话中不断叠加。一个改动,影响比大多数模型切换都大。
同样的研究显示,同一任务在不同模型之间的单任务成本差异约为 40 倍。成立的模式是:默认跑能通过你评估的最便宜的模型,只对困难任务升级。一个统一的网关,覆盖 25+ 模型和 8 家提供商,使这变成一行代码切换而不是重构:
REQUEST -> AUTH -> ROUTE(model:"auto") -> RESPONSE -> METER
^ 按成本 / 质量 / 速度选择
大多数团队忽略的一个陷阱:如果你看不到成本,就无法按难度路由。这就是为什么按请求溯源很重要——每一行调用都应该显示模型选择、延迟、token 数量和成本,而不是埋在 dashboard 里。
别按 $/M 来基准测试模型了。按 $/task 来基准测试,用你自己仓库里 15–30 个真实任务来测。缓存稳定上下文。把例行工作路由到更便宜的模型上。并且让计量表可见,因为一个隐藏自己成本的 agent,才是你运行过的最贵的 agent。
构建 agentic 系统,使用统一、OpenAI 兼容的网关(SG 托管、PDPA 合规、中国模型最多便宜 90%+):tokenlat.com