DeepSeek-V4-Flash Agent 性能显著升级,小模型更快更经济。扩大 AI 开发的成本效益边界。
很高兴你来到这里。每周一至周五,你都会收到 TNS 的精选内容,及时掌握新闻动态,让自己始终保持最佳状态。
请查收确认邮件,你可以在邮件中调整偏好设置,还可以加入其他群组。
在你喜欢的社交媒体平台上关注 TNS。
在 LinkedIn 上关注 TNS。
在等待第一期 TNS newsletter 期间,不妨浏览最新的精选文章和热门内容。
DeepSeek 推出了 DeepSeek-V4-Flash-0731,在不改变模型核心架构的情况下,显著提升了 Agent 性能。
继上周发布公告后,该公司已通过 DeepSeek API 以公开测试版形式提供此次更新;同日晚些时候,模型的开放权重也以 MIT 许可证发布到了 Hugging Face。
虽然模型本身没有改变,但 DeepSeek 表示,性能提升来自额外的 post-training。这表明,要取得显著改进,并不总是需要更大的模型。
🚀 DeepSeek-V4-Flash 官方 API 现已上线公开测试版!🔷 我们大幅升级了它的 Agent 能力——benchmark 分数现在已经远超 V4-Pro-Preview。来看看下面这次巨大的性能飞跃!👇🔷 正式版 V4-Flash 现在原生支持…… pic.twitter.com/NUzOyxza2f— DeepSeek (@deepseek_ai) 2026 年 7 月 31 日
🚀 DeepSeek-V4-Flash 官方 API 现已上线公开测试版!🔷 我们大幅升级了它的 Agent 能力——benchmark 分数现在已经远超 V4-Pro-Preview。来看看下面这次巨大的性能飞跃!👇🔷 正式版 V4-Flash 现在原生支持…… pic.twitter.com/NUzOyxza2f
DeepSeek 决定以宽松许可证发布可直接用于生产环境的模型权重,这让组织在模型的部署和定制方式上拥有了更多控制权。
虽然模型本身没有改变,但 DeepSeek 表示,性能提升来自额外的 post-training。这表明,要取得显著改进,并不总是需要更大的模型。
DeepSeek 表示,V4-Flash-0731 采用了与预览版相同的架构,总参数量为 2840 亿,每个 token 激活 130 亿参数。
它远小于 V4-Pro,后者拥有 1.6 万亿总参数,每个 token 激活 490 亿参数。对于大规模运行 Agent 的公司来说,激活参数量的差距会直接转化为 inference 成本差异——不过,仅看模型价格并不能反映全部情况。
尽管它仍然是规模更小的模型,但 DeepSeek 表示,更新后的 Flash 版本如今已经在多项面向 Agent 的 benchmark 上超过了早期的 V4-Pro 预览版。
尽管它仍然是规模更小的模型,但 DeepSeek 表示,更新后的 Flash 版本如今已经在多项面向 Agent 的 benchmark 上超过了早期的 V4-Pro 预览版。
该公司公布的成绩分别为:Terminal-Bench 2.1 得分 82.7、DeepSWE 得分 54.4、Toolathlon-Verified 得分 70.3。
Artificial Analysis 的早期独立测试显示,V4-Flash-0731 在 Terminal-Bench 2.1 上的得分较低,为 79%。这意味着 DeepSeek 公布的数据可能并不总是与独立测试结果一致。
DeepSeek 还公布了多项内部测试结果,但这些结果尚未得到独立验证。如果这些成绩经得起检验,就会进一步证明:企业可以通过 post-training,从现有模型中挖掘出更多性能,而不必一味扩大模型规模。
MIT 许可证意味着,组织不必局限于通过 DeepSeek 托管的 API 使用该模型。这次发布也延续了一个趋势:开放权重模型正在缩小与闭源专有模型之间的差距。与此同时,它还支持许多开发者已经在使用的工具。V4-Flash 现在支持 Responses API,可用于构建 AI Agent 和多步骤工作流;DeepSeek 也发布了将该模型集成到基于 Codex 的开发工作流中的操作说明。
对于已经在使用 OpenAI 风格 API 的团队来说,这降低了尝试另一款模型的门槛,因为他们无须大幅改动现有配置,就能对模型进行评估。
V4 技术报告还介绍了多项 inference 改进,例如通过 DeepSeek 的 DSpark 框架实现 speculative decoding,旨在提高模型服务效率。结合 self-hosted 部署后,这些能力可以让基础设施团队通过更多方式,针对自身的生产需求调整性能。
此次发布表明,企业正在寻找新的方法,在不扩大模型规模的情况下提升模型效果,并开始围绕模型的交付方式展开竞争。许多 AI 厂商专注于托管 API,而 DeepSeek 则继续发布可下载的权重,让组织能够在自己的基础设施上运行模型。对熟悉 API 格式的支持,也让团队可以在不彻底改造现有工作流的情况下,更轻松地测试开放权重模型。
企业正在寻找新的方法,在不扩大模型规模的情况下提升模型效果,并且越来越多地围绕模型的交付方式展开竞争。