DeepSeek V4的缓存命中与未命中费用相差31倍,Agent循环和定时任务中重复prompt前缀可大量复用缓存,输出token始终最贵且高峰期翻倍。
DeepSeek V4 定价:你的成本工具没有告诉你的 30 倍缓存杠杆
当 DeepSeek 公布 V4 定价时,有一个数字几乎无人关注。命中文本缓存的输入 tokens 每百万成本 0.007 美元。未命中缓存时,同样的输入成本为每百万 0.22 美元——相同 tokens 上的差距高达 31 倍。
如果你用 DeepSeek 运行 Agent 循环、定时任务或任何有重复 prompt 的场景,这个机制直接决定你月底账单是一笔零头还是意外惊吓。
数据来源为官方定价页(2026 年 8 月核实):
所有价格在高峰时段翻倍。输出 tokens 是每一行中最贵的项目。
缓存在实际应用中意味着什么
每次 API 调用都有一个前缀。只要前缀相同、顺序相同,供应商就可以从缓存中提供服务。真实账单中主要有三种模式:
Agent 循环。每一步都会重新发送整个对话。一个 20 步的会话,如果历史记录是 10K tokens,每次都要为这 10K 前缀付费。命中文本缓存后,每次重发只需 0.007 美元/百万,而非 0.22 美元。没有缓存的情况下,同样的会话输入部分成本要高出 31 倍。
定时任务和批处理。确定性 prompt 配合稳定 system prompt,是最容易获得缓存收益的场景。
带固定 system prompt 的 RAG。检索到的 chunk 会变化,但指令不会变。稳定的指令前缀让缓存持续生效。
关键问题:前缀的任何变化都会让整个请求的缓存失效。注入 system prompt 的时间戳、重新排序的上下文块、甚至末尾换行符位置不对——缓存设计上是脆弱的,除非你主动测量,否则完全看不见。
为什么通用成本工具会算错 DeepSeek 的账
两个结构性问题,都可以量化。
定价表靠社区 PR 更新。LiteLLM 及类似工具从社区提交中追踪价格。当 DeepSeek 变更定价时,从变更到 PR 合入之间存在一个窗口期,这期间所有估算都是错的。V4 的缓存命中 tier 正是那种会打破旧估算的变动,而且恰恰是最关键的那个 tier。
分词器不匹配。大多数工具用 OpenAI 的 tiktoken 来估算 tokens。DeepSeek 自带了分词器。我用两者对同一段中文文本做了测量:cl100k_base 计数 2,496 个 tokens,o200k_base 计数 1,949 个。同样字符串上相差 20%。用错误的分词器估算账单,数字就是虚构的。
真正能降低 DeepSeek 账单的方法
保持前缀稳定。同样的 system prompt,同样的排序,不加时间戳。缓存命中率是账单上最大的单一杠杆。
在非高峰时段运行批处理任务。高峰时段价格翻倍。凌晨 3 点做夜间处理,同样工作只要半价。
限制重试次数。重试风暴会让账单翻 3 倍,却什么都产不出来。
关注输出。输出 tokens 是表格中单价最高的行。长文本生成才是真正的开销。
我自己使用的真实数据
一个简单问答(2K 输入 + 1K 输出)成本 0.0011 美元。100K token 上下文调用成本 0.0253 美元;如果前缀命中缓存则只需 0.0040 美元(节省 84%)。单个请求很便宜。账单爆炸来自重复:Agent 循环、定时任务、重试、你反复发送的上下文。这些在按请求视图中都不会显示。
主流可观测性工具显示总支出。几乎没有哪个把缓存命中率作为一级指标来展示,而恰恰是这个数字真正决定了 DeepSeek 的成本。我正在做 SpendGuard 来解决这个问题:直接对照官方页面而非社区 PR 核对定价、可见化缓存命中率、高峰时段调度建议,以及不需要电子表格的成本报告。预登记即将开放,关注仓库获取通知。
数据已对照 api-docs.deepseek.com 定价页核实,2026-08-18。价格会变动,做决策前请查阅官方页面。