DeepSeek V4-Flash达到最强模型性能但成本显著更低,对编程和内容agents的支持成熟;可能改变程序员模型选择策略。
最初发布于 Cosmic 博客。
DeepSeek 于 2026 年 7 月 31 日发布了 V4-Flash,并以模型名 deepseek-v4-flash 在 API 上开启公开测试。发布后短短几小时内,它两次登上 Hacker News 首页。
一句话就能概括它的亮点:智能水平接近排行榜顶端,价格却位于排行榜底部。但具体细节比这句宣传语更有意思,其中有一项甚至会改变成本的计算方式,而这并不会直接体现在每 token 价格中。
下面来看看这次究竟发布了什么、数据说明了什么,以及这类模型适合用在内容流水线的哪些环节。
根据 DeepSeek 官方更新日志,V4-Flash 采用了与此前 V4-Flash-Preview 相同的架构和参数规模。唯一的变化发生在 post-training 阶段。DeepSeek 对模型重新进行了 post-training,并公布了新的评测成绩,相比 V4-Pro-Preview 有了显著提升。
这次发布还有几个值得注意的实用信息:
该模型已通过 API 开启公开测试。
原生支持 Responses API 格式,并针对 Codex 做了适配。
V4-Pro 的 API、App 和 Web 体验均未发生变化。正式版 V4-Pro 仍有待发布。
独立测量显示其参数规模为 284B,但模型权重尚未公开。
它只支持文本输入和文本输出,不支持图像、音频或视频输入。
如果你原本希望将它直接接入处理截图或 PDF 的工作流,那么最后一点尤其重要。至少目前还不能直接这么做。
DeepSeek 公布了以下成绩。评测使用自家的 DeepSeek Harness,在 minimal mode、max effort、top_p 为 0.95、temperature 为 1.0 的配置下完成:
与其盯着表格中的某一行,不如观察整体趋势。最强的结果集中在终端操作、tool calling 和多步骤工程任务上:Terminal Bench 得分 82.7,Toolathlon 得分 70.3。这些都是 Agent 能力评测,而不是考查知识记忆的问答测试。这是一款针对软件操作能力进行调优的模型。
最后两行成绩需要坦诚地加上一点说明。Agent Last Exam 和 Automation Bench 都是刻意设计得极其困难的长周期评测。在当前的前沿模型中,二十多分属于正常水平。25.2 分并不意味着失败,而是在提醒我们:对于需要持续数小时、完全自主完成的任务,目前所有模型都尚未解决这一问题。
还有一点也值得明确说明:这些数据由厂商发布,使用厂商自己的评测工具,并在 max effort 配置下得出。你可以把它们视为一个强烈的积极信号,但在迁移任何重要业务之前,仍应使用自己的 eval 进行验证。
Artificial Analysis 的独立测量结果显示,V4-Flash 的 Intelligence Index 为 50,在同类 162 个模型中排名第 2,而该类别的中位数仅为 17。
按 API 原始价格计算,V4-Flash 在同类 162 个模型中排名第 1:
每 100 万个输入 token 为 0.14 美元
每 100 万个输出 token 为 0.28 美元
每 100 万个缓存输入 token 为 0.003 美元,cache hit 时可享受 98% 的折扣
每 100 万个 token 的综合价格为 0.06 美元
1M token context window
真正值得关注的是 cache hit 的价格,但这个数字往往最容易被人一眼略过。对于任何会重复运行,并始终使用相同 system prompt、相同 schema 定义和相同 style guide 的 Agent,每次请求的固定前缀都是完全一致的。通过缓存,这部分前缀的成本会从一项反复产生的开销,变成几乎可以忽略不计的零头。
Artificial Analysis 还测量了模型的冗长度。V4-Flash 为完成 Intelligence Index 评测消耗了 210M 个输出 token,而中位数为 62M。它的输出效率在 162 个模型中排名第 58。换句话说,为了达到这一分数,它生成的 token 数量大约是中位数的三倍半。
token 便宜和任务便宜是两个不同的衡量指标。如果一个模型的每 token 价格只有三分之一,但输出了三倍的 token,那么它已经把省下来的钱花回去了。V4-Flash 完成 Intelligence Index 评测的总成本为 72.02 美元,这个数字确实很低,因此它的经济性依然相当不错。这里真正的经验是:你应该根据自己的工作负载,衡量每个已完成任务的成本,而不是看到“每百万 token 价格”这一列就停止分析。
如果你的工作负载对延迟敏感,那么冗长度数据同样也是一个吞吐量警告。token 越多,生成最后一个 token 所需的时间就越长。
强大的 tool calling 得分、1M token context window,以及 98% 的缓存折扣,共同描述了一种非常具体的实用场景:运行时间较长、负责读写结构化内容的 Agent。
这是真实存在的工作负载。例如,将整个内容库翻译成六种语言;审查每一篇文章是否包含已经废弃的产品声明;为上千个对象重新生成 meta description;确保 changelog 与 release notes 保持同步。这些任务重复性高、受 schema 约束,并且使用前沿模型时成本昂贵——恰好符合便宜、适合缓存且具备工具使用能力的模型能够发挥价值的场景。
1M context window 在这里之所以重要,有一个具体原因。内容运营通常需要广而浅的上下文:记录数量很多,但每条记录都比较小。你可以在一次请求中放入完整的内容模型和数百个对象,让模型跨越所有数据进行推理,而不必为了绕过较小的 context window 专门构建 retrieval 层。
使用 Cosmic 时,这个循环中的读取部分只需要几行代码。拉取所需的对象和字段:
import { createBucketClient } from '@cosmicjs/sdk';
const cosmic = createBucketClient({
bucketSlug: process.env.COSMIC_BUCKET_SLUG!,
readKey: process.env.COSMIC_READ_KEY!,
});
const { objects: posts } = await cosmic.objects
.find({ type: 'blog-posts' })
.props('id,slug,title,metadata.seo_description')
.limit(200);
由于 .props() 会把 payload 限制在你实际请求的字段中,因此你可以从源头控制 token 账单。发送 200 个 slug 和 meta description,成本远低于发送 200 篇完整的文章正文。
然后将这一批数据交给模型。该 API 与 OpenAI 兼容,因此你已经在使用的 client 可以直接工作:
const response = await fetch('https://api.deepseek.com/chat/completions', {
method: 'POST',
headers: {
'Content-Type': 'application/json',
Authorization: `Bearer ${process.env.DEEPSEEK_API_KEY}`,
},
body: JSON.stringify({
model: 'deepseek-v4-flash',
messages: [
{ role: 'system', content: STYLE_GUIDE },
{ role: 'user', content: JSON.stringify(posts) },
],
}),
});
在每次运行中,都要确保 STYLE_GUIDE 在字节层面完全一致,这样它才能持续命中缓存。将可变内容放在 user message 中。只需遵守这一条规则,98% 的缓存折扣才会真正体现在你的账单上。
通过 SDK 将结果写回去,就能闭合整个循环。由于每次更改都会以带版本记录的对象形式保存,而不是直接写入数据库,因此你可以保留 Agent 所有修改的审计记录。
以目前的情况来看,可以作出以下合理判断:
大批量、重复性的内容运营任务,且单任务成本是主要考量因素
面向 Agent 和终端的工作,因为这是它在 Benchmark 中表现最强的领域
拥有大段稳定 prompt 前缀、能够命中缓存的工作负载
需要跨大量记录获取广泛上下文的任务
任何需要图像、音频或视频输入的任务,因为该模型仅支持文本
对延迟要求极高、直接面向用户的交互,因为其输出较为冗长
无法接受公开测试版 API 的生产系统
需要开放权重的部署场景,因为该模型目前并未提供权重
坦率地总结:这是一款强大、便宜、具备工具使用能力的文本模型,非常适合后台内容处理,但目前还不适合多模态或延迟敏感的链路。在正式采用之前,请先用你自己的 eval 对它进行测试。
模型排行榜还会持续变化。决定你能否利用 V4-Flash 这类新模型的关键,在于你的内容层是否采用 API-first 架构。这样,更换背后的模型只需要修改配置,而不必进行一次完整迁移。
这正是 Cosmic 的用途。你的内容存放在一个提供 REST API 和 TypeScript SDK 的 headless CMS 中,因此任何模型、Agent 或框架都可以读写这些内容。下个月有更便宜或更聪明的模型发布时,只需将配置指向它,然后继续工作即可。
免费开始构建,只需几分钟即可连接一个 bucket
阅读 AI 功能概览,了解内置了哪些能力
还在比较 coding Agent?查看我们对 Claude Code、GitHub Copilot 和 Cursor 的详细对比
需要在团队规模下运行?预约与我们 CEO 进行 15 分钟交流
本文中的 Benchmark 成绩来自 DeepSeek 于 2026 年 7 月 31 日发布的官方更新日志。价格、Intelligence Index、参数量和冗长度数据来自 Artificial Analysis。厂商公布的 Benchmark 使用 DeepSeek 自己的评测工具,并在 max effort 配置下完成,因此请务必结合自己的工作负载进行验证。
如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。