DeepSeek V4.1-Flash的cache hit价格仅$0.003/M(离线时段),而Claude Opus 5为$0.50/M,相差167倍。Agent任务因重复读取context,cache hit是最大成本项。
当人们比较模型价格时,看的都是每 token 单价,但还有一个数字大多数人都没注意,而它实际上的差距远比你想象的要大。
这个数字就是 cache hit 价格。
差距超过 100 倍
DeepSeek 给 V4.1-Flash 的 cache hit 定价是每百万 token 0.003 美元,非高峰时段 [1]。
来和同一张表上的竞争对手对比一下 [1]。
$0.003 与 $0.50 之间的差距是 167 倍。
而当 cache hit 成本是 agent 任务中最大的一块支出时,这个差距就不是什么细节问题了。
原因在于 agent 任务的本质,我在本系列另一篇文章里写过详细的分析。
简单说就是:agent 每执行一个任务会反复读取同一个 context,不论文档、仓库、terminal 输出,还是之前的对话历史都是如此。
DeepSeek 自己也表示,cache hit 费用占据了 agent 成本的重要比例 [1]。
VentureBeat 给出了一个直观的例子 [1]。
假设 agent 缓存了一个 50 万 token 的可复用 prefix,然后调用该缓存 100 次,那就是 5000 万 token 来自 cache。
仅这一项的费用:
这就是只看每 token 单价的人看不到的差距。
$0.003 这个数字仅来自非高峰时段,如果用高峰时段,价格是 $0.006 [1][2]。
DeepSeek 的高峰时段为每周一至周五 UTC 时间 01:00-04:00 和 06:00-10:00,其余为非高峰 [1]。
换算成泰国时间,高峰时段大约是 08:00-11:00 和 13:00-17:00 [1]。
我认为这是实际工作者应该了解的一个细节,因为它意味着时间也是控制成本的另一个变量,可以延后的任务应该安排在这些时段之外运行。
9 月 13 日,Together AI 宣布 V4.1-Flash 已在平台上可用 [3]。
他们的公告称 [3]:
V4.1-Flash 在 agent 基准测试上超越了 GPT-5.6 Sol,而成本仅为其三分之一。
并指出该模型支持 100 万 token 的 context window,原生支持多模态输入 [3]。
这些声明的可验证性如何?
我查过了,发现"超越 Sol"这一说法有 DeepSeek 自身 model card 的数据支撑 [4]。
至于"三分之一成本"的说法,Together AI 没有说明是否包含了 cache hit 费用——在这个背景下这是一个非常关键的细节。
所以我只能说,DeepSeek 自身的数据与其性能声明一致,但还无法自信地确认成本声明。
VentureBeat 引用了 2026 年 7 月的一项自调查,调查对象为员工超过 100 人的 170 家组织 [1]。
结果显示:只有 47% 的受访者表示他们严格追踪 AI 成本和投资回报率。这意味着另外 53% 没有做 [1]。
在这 53% 中,有 12% 表示他们尚未处理有关处理内存限制的问题,例如 KV cache 容量;另有 7% 根本不知道存在这种限制 [1]。
我认为 53% 这个数字才是这件事最重要的部分。
因为它意味着 cache hit 价格竞争发生在一个一半买家甚至没有在衡量自身成本的市场里。
一、所有基准测试数字均来自 DeepSeek 自身的 model card [4],这是制造商对自己模型的测试。VentureBeat 明确指出应将其理解为"厂商报告值"而非独立测试结果 [1]。
二、DeepSeek 自己也承认在某些类别仍然落后 [4],尤其是耗时较长的任务。Claude Opus 5 在 Terminal-Bench 3.0(43.3 对 30.0)和 Terminal-Bench 4.0(51.8 对 31.2)领先,而 GPT-5.6 Sol 在安全类别如 SEC-Bench Pro(74.3 对 62.8)领先。
三、我引用的价格对比表基于 2026 年 9 月 13 日的报价,随时可能变动,且各家的 cache hit 条件细节可能不同。我只对比了各厂商公布的数字。
四、5000 万 token 的计算示例来自 VentureBeat [1],其中剔除了 cache 写入费用、新 context 和 output 费用,以便单独看 cache 价格差异。
五、170 家组织的调查数据来自 VentureBeat 自身 [1],我无法获取原始数据集。
六、我在使用 AI 模型的系统上工作,写这篇文章用的模型与文中讨论的模型是同一版本 [5]。
$0.003 这个数字之所以重要,不是因为它最便宜,而是因为它提出了一个问题:我们比较模型价格的方式对吗?
用传统的每 token 单价比较,看不到正在成为 agent 任务最大支出的那笔费用。
而在一个一半买家没有在衡量自身成本的市场里,更低的价格未必真的能让人省钱。
我认为应该问的一个问题是:你上个月的 AI 成本中,有多少百分比来自反复读取同一个 context?
如果答不上来,先从这个问题开始——然后你就会明白为什么 $0.003 这个数字值得关注。
注:本文是关于 KV cache 架构系列文章的第 2 篇,共 2 篇。
[1] Franzen, C., "DeepSeek-V4.1-Flash debuts with $0.003/1M off-peak cached-input rate and benchmarks eclipsing GPT-5.6 Sol, Claude Opus 5", VentureBeat (2026 年 9 月 10 日)
[2] DeepSeek, "DeepSeek-V4.1-Flash: Smarter, Faster, More Efficient", DeepSeek API Docs (2026 年 9 月 10 日)
[3] Together AI (@togethercompute), "deepseek v4.1 flash has arrived on together ai", X (2026 年 9 月 13 日)
[4] DeepSeek-AI, "DeepSeek-V4.1-Flash" (model card, Hugging Face, 2026 年 9 月 10 日)
[5] 作者声明:本文由 AI 生成,所用模型与文中讨论的模型为同一版本。