DeepSeek 7 月 31 日发布 V4-Flash 开源版,Artificial Analysis 评分 50,价格 $0.14/$0.28 per M tokens,性能超过 V4-Pro,引发 token 成本竞争。
DeepSeek 在 7 月 31 日发布了官方 V4-Flash ——开源权重、MIT 许可证和技术报告,全部在第一天公布。
令人瞩目的不是分数有多高。而是分数和价格一起出现:在 Artificial Analysis Intelligence Index 上得 50 分,每百万个令牌的价格仅为 $0.14/$0.28。
前一天,OpenAI 将 GPT-5.6 Luna 降价 80%。就这样,令牌价格战在一天内打响。
根据 DeepSeek 的发布和技术报告,关键事实如下:
DeepSeek-V4-Flash-0731 是官方版本,取代了预览版,具有大幅增强的 agent 能力。
架构没有变化:相同的高效 MoE 核心(~284B 参数,~13B 活跃),附加了投机性解码模块,1M 上下文。
价格也没有变化——与预览版相同。
这意味着它的增强不是通过扩大规模,而是通过后训练实现的。
结果是:较小的 Flash 在 Terminal-Bench 2.1(82.7)、DeepSWE(54.4)、Toolathlon(70.3)和 Cybergym(76.7)上超过了 DeepSeek 自己更大的 V4-Pro 预览版。
Artificial Analysis 在 Intelligence Index 上将其评为 50 分——比 4 月的 V4 Flash 提高了 10 分,比 V4 Pro 领先 6 分,在开源权重模型中位居前 3。
每百万个令牌的成本(输入/输出):
| 模型 | 输入价格 | 输出价格 |
|---|---|---|
| DeepSeek V4-Flash | $0.14 | $0.28 |
Artificial Analysis 报告称 DeepSeek 完成相当的基准任务的成本大约比 Fable 低 105 倍(一些独立运行显示范围为 105-137 倍)。
有一个流传开来的比较:Opus 5 在早 7 天发布。在一个任务上,Opus 5 一次就成功了,而 DeepSeek 需要三次——但 DeepSeek 用 ~900 行完成,而 Opus 5 用 ~3000 行,且 DeepSeek 的运行成本只有一分钱。
这是反面论点,这很重要。
一位开发者在两个真实代码库中隐藏了 105 个错误。V4-Flash 修复了 8 个——最后一名。但这次运行花费 $0.61,而 Fable 5 花费 $68.08。注意单位:每个任务的成本,而不是每百万个令牌。
这指向了一个真正的测量转变:
**每个令牌更便宜可能具有误导性。**如果模型需要更多轮次,每个任务的总成本可能最终会更高。
所以正确的问题不是"哪个模型每个令牌更便宜"。而是"实际完成这项工作花了多少成本,需要多少轮次?"关注可验证的结果,而不是代理指标。
最具战略意义的部分不是性能或价格——而是它如何发布的:权重在第一天开放,包含 MIT 许可证和技术报告。
这个时机没有逃过观察家的眼睛:在华盛顿提出 AI 控制和国会引入断电法案的同一周,一个前沿级模型被发布为自由软件。
加上 OpenAI 前一天的 80% 降价——"80% 的降价不是折扣,是武器"——战斗的形势就很清楚了:前沿智能正在被推向零,开源权重加上接近零的价格正在重新划分谁控制分发。
**获得改进不再需要扩大规模。**相同的结构,相同的价格,后训练将 Flash 推过了自己的 Pro。
**按任务成本衡量,而不是每个令牌的价格。**便宜的令牌不能保证便宜的结果。
**开源权重加上接近零的价格是对分发的宣战。**谁能给"接触前沿"定价不再由少数实验室决定。
首先,当最好的模型每周都在变化,价格可能在一夜之间下降 80% 时,你不应该手工选择模型——你需要一个为你权衡成本和能力的路由层。随着价格战的升级,这个层变得越来越有价值。
其次,当智能趋向自由时,稀缺的东西不再是智能。而是判断力,以及将其指向重要地方的品味。
基于 DeepSeek 的官方发布(DeepSeek-V4-Flash-0731 权重、MIT 许可证、技术报告)、Artificial Analysis 基准和成本比较,以及公开讨论的独立开发者测试。数据和规格来自官方和第三方来源。