大多数团队聚焦模型压缩和提示词优化,但忽视了 token 计费的结构性问题——生产环境中 prompt token 往往占大头。真正有效的策略是将 token 计数器从关键路径中移除,而非单纯减少发送量。
理解 Token 经济模型
基于 Token 的计费将成本拆分为两个维度:Prompt Token 和 Completion Token。在生产环境中,Prompt Token 通常占主导地位。一次 RAG 请求若包含 8000 Token 的上下文加上一个 200 Token 的问题,会产生一个不对称的成本结构——输入是预期输出的四十倍。Agentic 模式进一步放大了这个问题。每次工具调用和观察循环都会向对话历史追加更多上下文,导致后续每个步骤的 Prompt 体积不断膨胀。
传统优化手段的目标是尽可能压缩这个载荷。开发者实现滑动窗口记忆、语义压缩和层级摘要等策略。这些方法增加了工程复杂度,而且在丢弃关键上下文的情况下可能降低任务准确率。根本约束依然存在:每个 Token 都有边际成本。
架构优化
在更换供应商之前,先审视你的 workload 架构。以下几种模式可以在不牺牲输出质量的前提下降低 Token 总量。
上下文检索:将知识库 Embedding 后进行搜索,然后只注入排名最靠前的 k 个相关片段。调整 chunk 大小和重叠量,在粒度和 Token 数量之间取得平衡。
Prompt 模板化:移除冗余空格、系统 Prompt 重复,以及可以用微调或缓存指令替代的静态 Few-shot 示例。
模型路由:将简单查询路由到更小的模型。只在真正需要深度计算的任务上使用大型推理模型。
以下是一个轻量级的 Python 路由实现,根据意图分类将请求分发到不同的模型层级:
import openai
import os
client = openai.OpenAI(
base_url="https://api.oxlo.ai/v1",
api_key=os.environ["OXLO_API_KEY"]
)
def classify_complexity(user_prompt: str) -> str:
# Lightweight classifier uses a small model to route requests
response = client.chat.completions.create(
model="qwen3-32b",
messages=[{"role": "user", "content": f"Classify as simple or complex: {user_prompt}"}],
max_tokens=10
)
label = response.choices[0].message.content.strip().lower()
return "complex" if "complex" in label else "simple"
def generate(user_prompt: str) -> str:
tier = classify_complexity(user_prompt)
model = "deepseek-r1-671b" if tier == "complex" else "llama-3.3-70b"
# Cost is predictable per request on Oxlo.ai, regardless of prompt length
response = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": user_prompt}],
stream=False
)
return response.choices[0].message.content
这一模式将昂贵的推理计算限制在真正需要的任务上。在 Oxlo.ai 这样基于请求计费的平台上,路由决策本身只产生一个固定成本,因此你可以负担得起运行轻量级分类步骤,而无需盯着 Token 计数器。
重新思考计费模型
当计费模型对上下文长度施加惩罚时,架构层面的微调效果有限。如果你的应用需要长篇文档分析、扩展工具使用或持续的多轮会话,基于 Token 的定价模式会对这些使 LLM 真正发挥价值的模式征收硬税。
Oxlo.ai 采用基于请求的定价:无论 Prompt 长度如何,每次 API 调用的费用固定。对于输入 Token 超过输出的 Workload,这颠覆了传统的优化逻辑。基于请求的定价在长上下文 Workload 上可能比基于 Token 的定价便宜 10-100 倍。你不再需要为了控制开销而截断转录文本、剥离系统 Prompt,或实施激进的摘要层。相反,你可以专注于优化准确率。