九种不换模型不重构系统的 Token 节省方案,涵盖用量可视化、分级路由、缓存、提示词压缩等实操技巧,均为真实生产环境验证。
有一个场景出现在《点球成金》里:布拉德·皮特坐在一群球探对面,这些球探想在知名球员身上砸大钱。他告诉他们,他们问错了问题。重点从来不是买最好的球员,而是买胜利,而胜利就藏在没人注意到的地方。
"这就是 LLM 成本优化要求你具备的心态。"
最强大的模型很少是每个任务的答案,而你账单上最大的一行数字也往往不是你猜的那个。
问题是,大多数团队看不到他们的钱到底花在了哪里。数字每个月都在涨,而原因藏在某个没人去查的地方。
这篇文章给你九种方法把这个数字降下来,在生产环境中减少 token 使用量。每一个都曾在真实系统中测试过,没有任何一个要求你更换模型或重建任何东西。
模型几乎从来不是真正的问题。团队真正缺乏的是对系统各部分运行成本的清晰认识,而这种认识正是 LLM 成本优化的起点。

你的账单归根结底就是两个数字:
有多少 token 流经你的系统
你选择的模型每个 token 要花多少钱
本指南中的每一步都是针对这两个数字做文章。
假设你运行一个支持摘要器,把长的工单对话转换成简短的摘要供你的客服代理使用。每天处理 10 万次请求,每次收入一千个 token,输出五百个。
显然,几个月来没人注意到它的成本,因为这个数字只出现在账单的一行普通文字里。这就是 LLM 推理成本隐藏的方式。
到 2025 年中期,企业 LLM API 支出达到 84 亿美元,比 2024 年底的 35 亿美元翻了一倍多。
正如 OpenAI CEO Sam Altman 所说:"计算成本限制一切。"
以下是九种 LLM 成本优化技术,从投入最少、回报最多的开始。
你最好的模型对于大多数发送给它的任务来说都是杀鸡用牛刀。模型路由意味着将每个请求匹配到仍能出色完成工作的最便宜的模型。

分类工单、提取字段、清理格式。这些都不需要前沿模型,更小的模型只需一小部分价格就能处理。
再看那个摘要器。压缩工单对话不是深度推理。把它降到一个可靠的中端模型,这个工作流的成本可以下降一半,而摘要读起来是一样的。
系统提示词变长的方式和杂物抽屉变满的方式一样。你不断添加一个当时看起来必要的东西,却从来没有人回头清理掉它。
你在每次请求时都要为所有这些付费,不管模型是否需要。在这方面进行提示词优化是大多数团队触手可及的最快的结构性节省。
令人惊讶的是,删除多少你会放弃的质量。当你把提示词精简到真正影响输出的指令时,结果通常看起来一样,而背后的账单却明显变小了。
存在两种缓存,它们解决不同的问题。

提示词缓存降低了重新处理稳定部分(比如你的系统提示词)的成本。模型不再在每次调用时重新读取它,所以你只需为重复部分支付一小部分费用。
响应缓存完全跳过模型。当一个问题已经有存储的答案时,你直接把它返回,分文不花。
几乎没有人开启其中任何一个,这对于像摘要器这样的工作流来说是一件憾事。顶部的指令块从不改变,所以缓存它意味着你停止在每次运行时都为教模型同样的事情而付费。
在每个主要提供商那里,输出 token 的价格是输入 token 的四到五倍。这一事实应该影响你写的每一个提示词。
当你的代码只读取一个字段时,要求围绕它给出完整解释就是在为没人用的文字花钱。告诉模型只返回摘要,不要其他东西。
这是最简单的修复之一,也是最容易被跳过的,因为冗长的答案在乘开来之前从来不会让人觉得贵。输出长度是人们最容易错过的最简单的 LLM 成本优化收益。
在 RAG 设置中,提示词通常没问题。浪费来自你打包到上下文中的所有东西。

当模型只需要两段时,把整个文档丢进上下文是往排水沟里倒 token 最简单的方式之一。两项修复可以处理大部分问题:
更精准的分块,这样你传递更小、更相关的片段
更好的检索,这样只有重要的上下文才会进入提示词
它们一起减少的 token 使用量比你做任何措辞改变都多。所以从那里开始。在检索管道中,这几乎总是最能推动变化的改变。
大量工作不需要你一问就有答案。批量 API 处理这些请求会有延迟,并为你的耐心收取大约一半的标准费率。
任何按计划执行的事情都符合条件。比如那个摘要器还要生成一份昨天工单的早间摘要。这份摘要没有理由按实时价格运行,所以批量处理可以将成本减半,什么都不损失。
实时聊天和任何有人在等待的东西保持标准调用。剩下的值得再看一下。
这是你能设置的最简单直接的保障,也是团队最常跳过的。
每一步的上限可以在它到达你的账单之前阻止失控。它捕获两种悄悄积累 token 的失败:

一个不断自我循环并持续生成的模型
一个偏离轨道并一步一步调用的代理
当其中任何一个达到限制时,它就会停止,而不是让你为一堆没人想要的 token 付费。
它不会降低你日常的开支。它的作用是让你免于糟糕的一天,而在规模上这非常有价值。
你工作流中的一些步骤根本不需要模型。比如路由请求、读取单个字段、或检查一个值格式是否正确。几行普通代码可以完成这些工作,而且代码运行不花你一分钱。
问题在于使用模型太容易了,所以团队即使在任务很简单的时候也会用它。比如从一句话中提取日期。这不是需要思考的任务。代码每次都能找到日期而且做对。
把这个工作交给模型,两件事会发生。你为它支付 token,而且时不时它会以你没要求的格式把日期返回来。更多的成本,更少的确确定性,对于代码已经做得很好的工作来说。
月度总数告诉你花了多少。它说不出钱花在了哪里或为什么。

在工作流级别追踪把这个数字变成你可以采取行动的东西。真正的 AI 成本管理从这里开始,在这里你终于看到:
哪个工作流在驱动账单
哪个工作流物有所值
哪个工作流只是噪音
这是使列表上每个 token 优化工作都可衡量的基础工作。你无法优化你看不到的东西。
每项 LLM 成本优化工作都需要一个起点。以下是九个技术在投入、节省和各自发挥作用的地方如何排序。
从顶部投入少收益多的开始。精简你的提示词、收紧你的输出、开启缓存。
一旦这些完成了,再转向像路由和用代码替换步骤这样的重活。它们需要更多工作,但它们会在很久之后继续回报你。
LLM 成本优化中的常见错误是切得太深。团队尝到节省的甜头后,加大力度,而质量开始在某个他们不会立即联想到这次改变的地方下滑。
三个陷阱捕获了大多数团队:
切过了质量的临界点。当你的 token 数量下降,但错误率上升时,清理成本可能超过你节省的所有东西。目标是找到质量崩溃前的最低 token 数量,而不是你能达到的最低数字。
优化了错误的东西。没有工作流级别的追踪,团队倾向于优化感觉昂贵的东西,而这往往不是真正在消耗账户的东西。
把这当作一个你能完成的工作。提示词会重新变满,新功能上线,使用情况在你脚下变化。LLM 成本削减最好作为一种习惯,而不是一个你关闭并遗忘的任务。
奇怪的是,价格实际上在下降。Epoch AI 发现达到 GPT-4 水平性能的成本每年下降约 40 倍,但账单仍在增长,因为使用的增长超过了价格的下降。
大多数成本工具在你的发票已经落地后才报告你花了什么。Unmeshed 走了一条不同的 LLM 成本优化道路,让你在钱离开之前就能划定界限。

每步 token 限制。每个 AI 步骤都有一个预算。当它达到上限时,它就停止,这样就没有单个任务悄悄积累账单。
代理工具许可列表。代理只能接触你批准的工具。没有什么能偏离你设定的边界。
在不需要 AI 的地方用确定性步骤。对于路由、解析或验证,你可以把模型调用换成普通代码:没有提示词,没有 token,没有成本。
目标不是让你的系统缺乏 token。好的 LLM 成本优化只在模型值得其投入的地方花费 token,让代码免费覆盖其余部分。
LLM 成本优化不是对 AI 小气。任何人都可以通过做得更少来缩小账单。真正的工作是把钱花在值得花的地方,砍掉一切不值得的。
布拉德·皮特从来没有靠买最贵的阵容赢过。他赢是通过知道每一块钱实际上在做什么。
用你的 token 做到这一点。先拿下容易的成果,观察真正移动你账单的东西,并养成在数字偏离之前检查的习惯。如果你想在,工作流级别为你强制执行这些限制,那就是 Unmeshed 的用途。