作者通过语义缓存、模型切换、批量处理和 Prompt 优化四招,将客户月度 AI API 费用从 95,000 卢比降至 10,000 卢比,其中缓存单独贡献超过一半降幅,68% 调用为近重复查询。
几个月前,一位中型电商客户找到我,他的问题让我瞠目结舌。他们每月在 OpenAI API 调用上的支出高达 ₹95,000——而且还在不断攀升。他们的商品描述生成器、客服聊天机器人以及评论摘要工具,全部都在做原始 API 调用,零优化。每一次用户交互都是一次全新的、昂贵的 GPT-4 请求。
等我完成对他们 AI 管道的重构后,账单降到了每月 ₹10,000。降幅 97.5%。质量没有损失,用户体验没有降级。
以下是我具体是怎么做到的——以及如何将同样的策略应用到你自己的 AI 应用中。
在动任何代码之前,我花了整整两天做一件大多数开发者都会跳过的事——真正搞清楚 API 被用在哪里了。我在他们的代码库中加入了日志记录,捕获每一次调用:prompt、模型、token 数量以及响应时间。
我发现的结果令人震惊:
68% 的调用是近似重复的。同一个商品描述 prompt 的轻微变体每天被发送数百次。
22% 的调用使用了 GPT-4,但同样的任务 GPT-3.5-turbo 完全可以胜任。比如格式化文本、提取关键词、生成元标签这些事。
剩下的 10% 才是真正需要强大模型的复杂任务。
这个分析给了我一张清晰的路线图。如果你的 LLM API 每月支出超过 ₹20,000,却还没做过这种审计,那你几乎肯定在多付钱。
我写了一个轻量级的包装器来捕获调用元数据——prompt 的哈希值、使用的模型、输入/输出 token 数、预估成本以及调用的端点。运行一周后,我完整地看清了钱花在哪里了,哪些调用是冗余的。
关键洞察:大多数团队根本不知道他们的 AI 实际上在做什么。他们建好了、发布了,然后就再也不看了,直到财务团队来抱怨。
这一个改动就把成本砍掉了一半多。原理很简单:如果有人问了一个和你已经回答过的问题语义上相似的问题,就直接返回缓存的响应,而不是发起新的 API 调用。
我用 Redis 搭配向量嵌入来实现相似度匹配。阈值至关重要——0.95 的相似度。太低就会返回无关的缓存答案;太高缓存就永远命中不了。我用 500 对真实的 prompt 对进行测试后确定了 0.95 这个值。
各场景缓存命中率
运行一个月后的生产数据:
商品描述和评论摘要的缓存表现极为出色,因为输入是结构化的且重复性高。聊天机器人的命中率较低,因为对话本质上更多变,但 45% 仍然很可观。
不是每个任务都需要 GPT-4。这听起来像废话,但我看到团队默认用最贵的模型处理一切,因为"这样能用"。这就像为了去超市买菜而叫直升机。
我写了一个简单的路由器,对传入请求进行分类,并分配给能处理该任务的最便宜的模型:
诀窍是验证更便宜的模型实际上能产生可接受的输出。我做了两周的 A/B 测试,比较每种任务类型的输出。关键词提取和格式化任务,两个模型的输出几乎无法区分。商品描述方面,GPT-4o-mini 达到了 95% 的效果,成本却只有十分之一。
仅这个模型路由每月就额外节省了 ₹22,000。
评论摘要工具原本是实时运行的——每收到一条新评论,就触发一次 API 调用。但没有人需要即时摘要。那些摘要展示在商品页面上,而商品页面每天才更新一次。
我把评论摘要改为夜间批处理任务,一次性处理所有新评论,按商品分组。这样一来,每天 200+ 次单独调用变成了每晚 20-30 次批量调用。
批处理还带来了更好的 prompt 工程效果——在单个 prompt 中发送多条评论,比逐条处理能产生更好的摘要,因为模型可以识别共同主题和矛盾点。
最后一个优化手段不起眼但有效——重写 prompt,用更少的 token 产生相同的输出。
他们原有的商品描述 prompt 有 380 个 token,全是冗长的指令。我重写成了 95 个 token,结构更清晰、要求更明确。响应质量实际上更好了,因为模型要处理的歧义更少。
75% 的 prompt token 削减,在每天数千次调用的叠加效应下,摊到每月能节省 ₹1,500。
新的月账单:大约 ₹10,000。客户喜出望外,而且系统实际上表现更好了——因为我们通过缓存减少了延迟,并为每个任务配备了合适规模的模型。
如果你在评估自动化工具,可以看看我的 n8n vs Zapier 对比。对于 AI Agent 基础设施,可以读一下 MCP Protocol——AI 的 USB 接口。如果你想看我每天用来构建这些优化的工具,这里有我真实的 Claude Code 评测。
经验总结
先审计。你无法优化你没有测量过的东西。在做改动之前,花时间理解你的使用模式。
积极缓存。语义缓存对大多数应用来说是单次影响最高的优化手段。
让模型匹配任务。用能产生可接受输出的最便宜的模型。要严格测试。
在不需要实时的时候批处理。不是每个 AI 功能都需要亚秒级响应。
优化 prompt。更短、更清晰的 prompt 节省 token,而且往往效果更好。
如果你在生产环境中运行 AI 功能,而每月的 API 账单让你心里不安,从第一步开始。光是审计就会揭示你之前不知道的机会。
我每周都在帮助企业优化他们的 AI 基础设施。如果你想要一份针对你 AI API 成本的个性化审计,请联系我。
我在 architmittal.com 写关于自动化和我实际运行的系统的文章。最初发表于该站。