文章围绕 DeepSeek V4 Flash 的缓存命中、第三方托管价格、量化版本、模型标识和思考模式分析成本差异。其核心判断是先优化调用与缓存策略,再决定是否因涨价迁移。
DeepSeek 于 2026 年 8 月 6 日在其定价页面发布了一则通知:“我们计划在不久的将来提高 DeepSeek API 服务的整体价格,预计涨幅较大。请据此规划你的使用量。”没有公布具体涨幅,也没有公布日期。r/DeepSeek 上关于此事的帖子一天内就有了 115 条评论,最高赞的回应只有两个词。
更有价值的应对方式并不是恐慌性迁移。大多数正在运行 V4 Flash 的用户本来就多付了数倍费用,而原因与价目表毫无关系。其中有六个问题现在就能解决,赶在新价格落地之前。
首先是缓存行为,其次是托管服务商的选择。价目表反而最不重要。根据下文的价格数据,以下排名按照每一项能够影响的费用幅度排列。
前两项相互影响,因此“谁最便宜”并没有固定答案。请按顺序逐项检查。
如果你每月在 V4 Flash 上的支出超过约 50 美元,值得。低于这个数,只做第 3 项和第 5 项,然后就可以停了。并非每种工作负载都值得进行全面审计。
以下情况值得把整个列表做完:
你在运行 AI 智能体,也就是具有较长多轮会话、相同上下文会被重复发送几十次的场景。50 倍的缓存价差正是在这里累积成真正可观的费用。
你的月度支出已经大到,一旦价格上涨 2 到 4 倍,就不得不找人讨论预算问题。
你正在使用第三方托管服务商,并且从未检查过它的缓存读取费率、量化方式或上下文限制。
你只会偶尔发送没有共享前缀的单次请求。这种情况下没有缓存可命中,因此本文大部分内容都不适用。选择输入价格最低的服务商,然后继续做其他事情即可。
你仍处于原型开发阶段。在账单变得重要之前,模型选择就会发生变化。
你的流量已经直接走 DeepSeek,使用稳定的前缀,并且针对不同任务调整了思考模式。你已经完成了该做的工作。
停止规则:如果你修正了 slug(第 3 节),又检查了托管服务商的缓存读取价格栏(第 2 节),但没有发现任何异常,那么剩余项目只能带来个位数百分比的收益。回去继续交付产品吧。
因为 DeepSeek 对缓存输入的定价是每百万 token 0.0028 美元,而未命中缓存时是每百万 token 0.14 美元。这是整个页面上差距最大的数字,其影响远超其他所有可调参数。
缓存默认开启,不需要修改代码,但它的匹配规则比你可能从其他供应商那里了解到的前缀缓存更加严格,因此值得把它正确配置好。
DeepSeek 会存储缓存前缀单元,只有请求与其中某个单元完全匹配时才会命中。系统会在请求边界持久化这些单元,包括输入末尾和模型输出末尾;也会在长输入内部以固定 token 间隔持久化;此外,当系统发现多个请求具有共同前缀时,也会将其持久化。
这会产生一个很容易让人踩坑的实际结果。追加内容可以命中:先发送 A + B,再发送 A + B + C,第二个请求会命中第一个请求生成的单元。分支则不会命中,至少不会立即命中。先发送 A + B,再发送 A + C,第二个请求仍然会完全未命中,尽管两者都共享 A。系统实际上会注意到共享的 A,并将它单独持久化为一个单元,因此第三次发送 A + D 时才终于能够命中。
这意味着扇出模式——针对同一份长文档提出许多不同问题——前两次调用都要支付全价,从第三次调用开始才会节省费用。如果你只用两个请求测试缓存,然后得出缓存不起作用的结论,原因就在这里。
顺序依然很重要,因为一个从不重复的单元永远不会得到复用。
以下是最常破坏前缀的四类内容,大致按出现频率排序:
系统提示词中的时间戳或日期。"Today is 2026-08-06T14:22:11Z" 会导致每次调用的缓存都失效。如果模型需要知道日期,请把它放在最后一条用户消息里。
由字典或集合生成的工具列表。每次运行时迭代顺序都会改变,输出的 JSON 顺序也会被打乱,于是前缀永远无法匹配。请对列表排序。
放在指令之前的检索内容块。按照设计,RAG 输出每次都不同。它应该放在稳定的系统提示词之后,而不是放在前面。
为追踪而注入的会话 ID 或请求 ID。它们很有用,也完全可以免费移到末尾。
所有这些情况的修复方法都一样:稳定内容放在前面,易变内容放在最后。请读取 usage 对象来验证修复是否生效,不要仅凭内容布局判断。DeepSeek 会返回 prompt_cache_hit_tokens 和 prompt_cache_miss_tokens;两者的比例是本文所有决策所依赖的数字,而且只需一个请求即可测出。
一位 r/DeepSeek 用户发布了七天的费用明细:大约 2400 万输入 token 和 600 万输出 token,总费用为 1.87 美元,并表示上下文缓存将账单降低了约 70%。在把它用作基准之前,值得先核对一下计算结果:按照官方费率,2400 万输入 token、600 万输出 token、70% 缓存命中率的费用约为 2.74 美元;要把费用降至 1.87 美元,命中率需要接近 96%。要么实际缓存效果比报告的更好,要么部分流量运行在其他地方。该帖子的最高赞回复同样值得一读:回复者每天消耗 2 亿输入 token,并称 2400 万“离重度工作还差得远”。这两个数字都是真实的,只是描述了不同的工作负载。
取决于哪一家最符合你的缓存命中率,而答案会在约 77% 的位置发生反转。OpenRouter 为 0731 版本列出了 22 家托管服务商。输入和输出价格的差距大致集中在 2 倍以内,缓存读取价格则并非如此。
再看一遍 Parasail 那一行。它的输入价格与直接使用 DeepSeek 相同,输出价格也相同,但缓存读取价格却高出 25 倍。不存在任何适合选择它的工作负载。Phala、Io Net 和 Morph 也是如此。Reddit 上有一个帖子指出了 OpenRouter 的这种模式,并将其归咎于零数据保留路由;一条回复给出了更完整的解释:这些只是其他托管模型权重的公司,既没有 DeepSeek 的缓存基础设施,也没有 DeepSeek 的利润空间。
真正能在输入价格上更便宜的托管服务商是 DeepInfra、GMICloud 和 BaseTen。它们能否帮你省钱取决于你的流量形态:
低于盈亏平衡点时,选择更便宜的托管服务商。高于该点时,直接使用 DeepSeek。以 Reddit 帖子中的 2400 万输入 token、600 万输出 token,以及 70% 缓存命中率为例:DeepInfra 为 2.03 美元,直接使用 DeepSeek 为 2.74 美元,Parasail 为 3.86 美元。缓存命中率为 0% 时:DeepInfra 为 3.24 美元,直接使用 DeepSeek 为 5.04 美元。
如果你使用的是最直观的 slug,很可能不是。在 OpenRouter 上,deepseek/deepseek-v4-flash 实际解析为 DeepSeek V4 Flash 0423。当前版本则单独列在 deepseek/deepseek-v4-flash-0731 下。
deepseek/deepseek-v4-flash -> V4 Flash 0423 (older)
deepseek/deepseek-v4-flash-0731 -> V4 Flash 0731 (current)
~deepseek/deepseek-v4-flash-latest -> tracks current
0731 正是 r/LocalLLaMA 和 r/DeepSeek 帖子一直称赞的版本,因为它修复了长时间 AI 智能体会话中的上下文退化问题。仅仅因为 slug 的默认行为,就用相近的价格购买 4 月份的版本,是这份列表中修复成本最低的错误。
你会付出账单上看不见的质量代价,以及在会话进行到一半时才发现的截断问题。低输入价格的托管服务商出售的并不是完全相同的东西。
DeepInfra 的输入价格为 0.09 美元,是列表中最低的,但它运行的是 fp4 量化。Sail Research、Ambient 和 Ionstream 也是如此。其他大多数服务商运行 fp8,还有几家标记为“unknown”。DeepSeek 自有端点报告使用 fp8。没有任何服务商公布该模型在 fp4 与 fp8 推理服务之间的基准差异,因此应当把 fp4 端点上 36% 的输入折扣视为一笔存在未测量负面影响的权衡,而不是毫无代价的收益。
上下文窗口的差异比价格差异还要大:
CoreWeave、AtlasCloud、Io Net:262K
DeepSeek 直连及其他大多数服务商:1M
如果你根据输入价格选择了托管服务商,随后 AI 智能体却悄悄地从 131K 开始截断,原因就在这里。模型本身支持 1M,限制你的是托管服务商。
有时应该,而且它默认会以高强度开启,这一点大多数人并不知道。DeepSeek 的文档写得很明确:思考模式默认启用,默认强度为 high。这些推理 token 会按照输出费率计费。
# OpenAI format: disable thinking
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[...],
extra_body={"thinking": {"type": "disabled"}},
)
在 Anthropic 格式中,对应配置为 {"reasoning": {"effort": "none"}}。不同模型的强度级别映射方式不同:在 V4 Flash 上,low 映射为 low,而 xhigh 会向下映射为 high;在 V4 Pro 上,low 则会向上映射为 high。
在全局关闭之前,有两件事值得了解。思考模式会忽略 temperature、top_p、presence_penalty 和 frequency_penalty,而且设置这些参数不会产生错误,因此一份看起来已经调优的配置实际上可能毫无作用。此外,禁用思考模式会降低多步骤任务的准确率,而这恰恰是人们使用 V4 Flash 的主要场景。可以在抽取、分类和格式化任务中关闭它;进行重构和调试时则应保持开启。
我们是通过网关而不是直接调用 DeepSeek 的端点进行测量的,而且数据受到了网关侧参数处理方式的干扰,因此这里不公布具体倍数。请基于你自己的提示词,对比调整前后的用量对象,读取 completion_tokens_details.reasoning_tokens,在自己的实际流量上完成测量。
在收集这些数据期间,可以采用一个实用的经验法则:如果人工审核者无需检查推理过程就会接受答案,那么思考过程可能并不值得这笔成本。从发票中提取字段、给支持工单打标签、重新格式化 JSON,以及撰写提交信息,都属于这一类。凡是错误答案代价高昂且不容易被察觉的任务——包括大多数重构以及几乎所有调试任务——推理 token 往往都物有所值。应根据任务类型进行路由,而不是切换一个全局开关;新价格落地后还要重新评估,因为这些 token 是按输出费率计费的。
它的影响比价目表更大,因为它决定了每项任务会消耗多少 token。r/DeepSeek 上没人能就具体应该选哪个达成一致,但所有人都认同它确实很重要。
反复被提到的名字有 OpenCode、Reasonix、Pi 和 Codex。一位用户报告称,Reasonix 通过提高缓存命中率,将一项长任务“从 20 分钟缩短到了 5 分钟”;另一位用户则表示,与 Pi 或 OpenCode 相比,它“仍然有点多 bug,而且难以扩展”。第三位用户指出,DeepSeek 对 Codex 的原生支持彻底消除了使用代理的必要。大家没有公认的首选,而客观的结论是:执行框架的开销真实存在、数额很大,并且高度取决于你的工作负载。
真正值得理解的是其背后的机制:AI 智能体的每一轮交互都会重放整个对话。能够保持稳定前缀的执行框架可以命中缓存,对重放的 token 只需支付 $0.0028/M。每轮都重新构建上下文的执行框架,则会为相同的 token 支付 $0.14/M。这就是第 1 节提到的 50 倍差距,而且会在一次会话中重复出现数十次。
几乎在所有场景下,直接调用都将失去优势,因为第三方托管商没有理由同步涨价。OpenRouter 上的托管商是在自己的硬件上运行开放权重。DeepSeek 调整费率只会影响 DeepSeek 自己的端点,而不会影响这些托管商,这会同时改变本文所有盈亏平衡点。
目前没人知道具体涨价倍数,因此下面仍以缓存命中率为 70%、输入 24M token、输出 6M token 的工作负载为例,给出三种场景,并假设作为第三方参照的 DeepInfra 价格保持不变:
即使在今天,这种工作负载也已经更适合第三方托管商,因为相对于 24M 输入,6M 输出已经足够偏重输出,较低的输出费率会占据主导。只有在输出仅占输入很小一部分时,缓存优势才能让直接调用重新胜出。即便如此,盈亏平衡点也在移动:对于纯输入流量,目前与 DeepInfra 相比的缓存命中率盈亏平衡点约为 77%;如果直接调用价格翻倍,它将上升到大约 94%。高于这条线,你仍然应该选择官方端点,因为其缓存读取价格仅为 $0.0028。低于这条线,你就是在补贴一个自己根本没有命中的缓存。
实际结论是:如果你的缓存命中率确实高于 90%,而且输出量很小,涨价虽然会带来影响,但直接调用仍有可能胜出。其他所有人都应该在新价格公布前准备好一条经过测试的备用路径。
等新价格落地,并且计算结果表明它不再划算时,而不是现在。讨论串中有很多人已经提前决定改用 GPT-5.6 Luna;它是被提及最多的替代方案,并且确实支持视觉能力。把它列入候选名单很合理,但现在就做决定并不明智,因为 DeepSeek 尚未公布任何具体数字。
为了帮助判断变化幅度:一位评论者回忆称,DeepSeek 曾在四五月份将价格下调约 75%,随后又把降价变成了永久政策,因此他推断所谓“显著”涨价可能意味着价格大致恢复到原来的水平,即上涨 4 倍。这只是某个人根据公开历史做出的推断,不是泄露消息。应针对一个价格区间制订计划,而不是押注某个具体数字。
检测你的实际缓存命中率。上面的每个决策都依赖这项指标,但几乎没人真正测量它。
通过功能开关接通并验证第二家提供商,让切换提供商只需修改配置,而不是启动一个新项目。
新费率公布后,重新计算盈亏平衡表。77% 这个数字只适用于当前价格。
集中决定托管商和思考策略,然后不要再让个人自行选择。在团队中,失败模式不是做出一次错误选择,而是六个人分别做出六种不同选择,而且没人看得见全貌。
有三件事值得统一约定:
把模型字符串固定在共享配置中,而不是分别写入各个服务。四个服务各自硬编码模型标识时,0423 与 0731 的问题会被成倍放大。一个常量、一个位置,版本升级就只需要一次代码审查。
按工作负载类别而不是按开发者设置思考策略。提取和分类服务禁用思考;AI 智能体和重构服务保留思考。把规则明确写下来,因为默认设置是开启,而通常没人会注意到默认值。
按服务而不是按组织测量缓存命中率。汇总数字会掩盖某个在系统提示词中包含时间戳、因而每次调用都多付 50 倍成本的服务。在现有请求指标旁记录 prompt_cache_hit_tokens 和 prompt_cache_miss_tokens,异常服务就会立刻暴露出来。
配置错误造成的计费后果并不是均匀分布的。一个配置错误的高流量服务,其成本可能高于团队其他所有服务之和,而从外部看,它与配置正确的服务完全一样。
通过同时支持两种协议的方案进行路由,这样切换备用方案就只需更改模型字符串。DeepSeek 同时提供 OpenAI 格式端点和 Anthropic 格式端点,后者位于 https://api.deepseek.com/anthropic;这正是 V4 Flash 无需适配层就能接入 Claude 形态工具的原因。
如果你不想在当前局势尚未明朗时为每家供应商分别维护账户,ofox 提供的 V4 Flash 价格与直接调用相同,分别为 $0.14 / $0.28 / $0.0028;一个密钥即可使用两种协议,并且注册不需要中国手机号码。它并不比直接调用 DeepSeek 便宜;任何声称网关上的原厂模型价格还能低于原厂的人,都是在向你推销东西。它真正提供的是一个统一集成入口,让你可以在新价格公布后从背后切换模型。
DeepSeek 直连。与缓存读取价格第二低的托管商相比便宜 6.4 倍,使用 fp8,支持完整的 1M 上下文。最适合高度依赖缓存的 AI 智能体工作负载。
DeepInfra、GMICloud、BaseTen。输入价格确实更低。最适合一次性、低缓存命中率的流量。请先检查量化方式。
ofox。费率与直接调用相同,一个密钥支持两种协议,适合需要可切换路径的场景。它不是折扣渠道。
GPT-5.6 Luna。r/DeepSeek 最常提及的替代方案,支持视觉能力。等 DeepSeek 公布具体数字后再进行比较。
自行托管。权重是开放的。r/LocalLLaMA 上有人使用 2 张 RTX 3090 加一台二手服务器运行 0731 版本。只有在你已经拥有这些硬件时才合理。
对于完全零成本的使用路径,我们已在《DeepSeek V4 Flash 免费使用:4 条零成本路径》中单独介绍。包括 V4 Pro 在内的完整费率细目,请参阅《DeepSeek V4 API 定价指南》;要了解 Pro 的费用究竟花在哪里,请参阅《缓存未命中与思考成本》。如果涨价后 Flash 不再是高性价比之选,我们的《Flash 与 Gemini 3.6 Flash 对比》介绍了最接近的低成本竞品,而《如何降低 AI API 成本》则进一步推广了上文的缓存优化方法。
DeepSeek 模型与定价
DeepSeek 思考模式
OpenRouter 上的 DeepSeek V4 Flash 0731 提供商
r/DeepSeek:DeepSeek 表示 API 定价将“显著”上涨(2026-08-06,115 条评论)
ofox DeepSeek V4 Flash 模型页面
是的。截至 2026 年 8 月 6 日,官方定价页面显示了以下通知:“我们计划在不久的将来提高 DeepSeek API 服务的整体定价,预计涨幅将较为显著。”目前尚未公布涨价幅度和生效日期。当前费率仍然有效:V4 Flash 缓存未命中的输入价格为 $0.14/M,缓存命中的输入价格为 $0.0028/M,输出价格为 $0.28/M。
截至 2026-08-06,官方定价页面上并没有这项政策。一条获得大量赞同的 Reddit 评论引用了一项高峰/非高峰政策,声称北京时间 9:00–12:00 和 14:00–18:00 期间按 2 倍费率收费,但这段文字并未出现在当前页面上;实时页面只有一则笼统的涨价通知。在 DeepSeek 正式发布前,应将高峰时段方案视为未经证实的消息。
这完全取决于你的缓存命中率。DeepInfra 的输入标价为 $0.09/M,而 DeepSeek 自身为 $0.14/M;但 DeepInfra 的缓存读取价格为 $0.018/M,而 DeepSeek 仅为 $0.0028/M。缓存命中率低于约 77% 时,第三方托管商胜出;高于这一比例时,直接调用胜出。如果输出量超过输入量的约 20%,无论缓存命中率如何,价格较低的托管商都会胜出。
第三方托管商在自己的基础设施上运行开放权重,并不具备 DeepSeek 的缓存技术栈,也没有其价格补贴。在 OpenRouter 为 0731 版本列出的 22 家托管商中,每 100 万 token 的缓存读取价格从 0.0028 美元到 0.078 美元不等,相差 28 倍;而输入和输出价格之间的差距则大约在 2 倍以内。
Deepseek/deepseek-v4-flash 能让我使用最新模型吗?
不能。在 OpenRouter 上,这个 slug 指向的是 DeepSeek V4 Flash 0423。当前版本是单独列出的 deepseek/deepseek-v4-flash-0731。选择这个看起来最直观的 slug,会让你在价格相近的情况下悄然买到一个较旧的模型。
关闭思考模式能省钱吗?
它可以减少按输出费率计费的推理 token。根据 DeepSeek 的文档,思考模式默认开启,推理强度设置为高。在 OpenAI 格式中将 thinking type 设置为 disabled,或在 Anthropic 格式中将 reasoning effort 设置为 none,即可将其关闭。处理多步骤任务时,预计输出质量会有所下降;是否关闭应针对具体任务决定,而不应作为全局开关。
涨价后,GPT-5.6 Luna 会比 DeepSeek 更便宜吗?
在 DeepSeek 公布价格之前无法得知。在讨论涨价的帖子中,Luna 是 r/DeepSeek 用户提到最多的替代方案,部分原因是它支持视觉功能。在 DeepSeek 新费率正式公布前,任何价格比较都只是猜测。
如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。