每次对话都重传完整历史导致 token 高速增长,六项架构决策可削减 75-90% 成本并显著降低延迟。
你有没有想过,ChatGPT 或 Claude 是如何"记住"你的对话的?
剧情反转:AI 模型并不会。
大语言模型是完全无状态的。每次你提问时,聊天应用都会将你完整的对话历史打包——系统指令、工具定义、所有历史消息以及工具结果——然后重新发送所有内容给模型。
模型处理这些内容,再次从头开始。每次都是如此。
💸 成本暴涨 — Token 数量随每次对话轮次指数增长
🧠 上下文崩塌 — 你比想象中更快触及 Token 上限
🐌 响应延迟 — 更大的历史记录意味着更慢的性能
如果你在使用 LLM 构建应用,这些问题会快速叠加。但好消息是:六个架构决策可以将成本降低 75-90%,并显著提升速度。
在深入讨论解决方案之前,让我们先明确构建块:
Token
文本处理的基本单元。模型将文本分解为子词片段(例如 "understanding" → ["understand", "ing"]),然后将它们转换为数值向量。
经验法则:1 token ≈ 0.75 个单词,因此 1000 tokens ≈ 750 个单词
参数(Parameters)
神经网络中定义模型能力的学习权重。参数越多(70B vs 7B),推理能力越强,但计算成本也越高。
层(Layers)
模型架构的垂直深度。每个 token 都要通过数十个顺序层(32、60、80+),每一层都会逐步深化理解——从早期层的基本语法到深层中的复杂推理。
上下文窗口(Context Window)
模型在单次请求中能处理的最大 Token 容量(例如 Claude 3.5 Sonnet 支持 200k tokens)。超过这个限制 = 截断或报错。
收益:缓存 Token 享受 75-90% 折扣 + 极速响应
提示词缓存(KV Cache)会存储静态内容的计算结果。但这里有个陷阱:前缀中只要有一个字符变化,整个缓存就会失效。
方案:按从最静态到最动态的顺序排列你的负载:
1. System Instructions (static)
2. Tool Definitions (static)
3. Context Documents (static)
4. Messages Array (dynamic)
这种结构让你的静态内容在请求之间可缓存,只有对话历史在变化。
每一句闲聊废话都要花钱。
原文:"Sure! I'd be happy to help you with that. Let me take a look at your question and provide you with a comprehensive answer..."
优化后:"The function returns null when the user ID is invalid."
方案:在系统指令中添加:
For this entire session, provide direct answers without
preambles, summaries, or conversational filler.
Focus purely on data density.
模糊的问题需要包含更广泛的文档,并产生更长的回复——双向叠加了输入和输出 Token 成本。
原文:"What does this codebase do?"
锚点查询:"In the auth/middleware.py file, explain the token validation logic in the verify_jwt() function."
收益:最小的上下文大小 + 简洁、精准的回复 = 更低的成本
当模型只需要一页内容时,不要把整个图书馆喂给它。
UI 方案:只上传特定的相关文档片段
API 方案:使用语义分块(embeddings + 向量搜索)只输入最相关的 3-4 个文本块
效果:大幅减少输入 Token 数量
使用滑动窗口压缩来缩减对话历史。许多聊天界面支持 /compact 或 /summarize 这样的命令。
⚠️ 关键警告:永远不要压缩上传的主要文档。
为什么?文档修改会破坏缓存连续性,迫使下次请求时重新摄入完整上下文。这会让你 75-90% 的成本节省化为乌有,并将延迟重置为基准水平。
对于独立任务,不要在一条巨大的对话线程上继续构建。
用以下内容开启新的聊天:
收益:
LLM 成本不一定会失控。通过理解无状态模型如何处理上下文,并应用这六个架构模式,你可以:
这些优化只是开始。在使用 LLM 构建时:
你控制 LLM 成本的常用策略是什么?在评论区分享你的技巧——我很想学习你的经验!
构建 LLM 应用?关注我,获取更多关于 AI 架构、成本优化和实用实现策略的深度解析。
👋 我是 Nitesh Kumar——我写关于 AI 工程、成本优化和构建生产级 LLM 应用的内容。
觉得有用?点个 ❤️ 并关注我,获取更多技术深度解析。我分享的是在生产环境中真正有效的实用策略。
联系方式:LinkedIn