DeepSeek V4-Flash编程和Agent能力重大突破
DeepSeek通过重新训练显著提升编码和agent性能,保持低成本;直接影响程序员AI编程工具选择。
DeepSeek通过重新训练显著提升编码和agent性能,保持低成本;直接影响程序员AI编程工具选择。
人工智能
DeepSeek 于 2026 年 7 月 31 日在 Hugging Face 发布了 DeepSeek-V4-Flash-0731,并将官方 V4-Flash API 推向公开测试阶段。模型卡明确说明,这是取代预览版的正式版本,架构和规模均未发生变化。性能提升来自重新进行 post-training,而非采用了新的设计。
该 checkpoint 随附 DSpark speculative decoding 模块,其结构与 DeepSeek-V4-Flash-DSpark 一致。Hugging Face 显示该仓库包含 304B 参数,其中包括基于 284B 基础模型附加的 draft 模块。
在 API 方面,deepseek-v4-flash 现在原生支持 Responses API 格式,并已针对 Codex 进行适配。V4-Pro API、App 端模型和 Web 端模型均未更新。
是的,但要从两种截然不同的使用方式来看。
通过 API,几乎任何人都可以部署:DeepSeek 的定价页面显示,deepseek-v4-flash 每 100 万输入 token 的缓存未命中价格为 0.14 美元,缓存命中价格为 0.0028 美元,每 100 万输出 token 的价格为 0.28 美元,并发上限为 2,500。这大约是 deepseek-v4-pro 输出价格(0.87 美元)的三分之一。以此价格,种子轮创业公司、独立开发者和企业内部平台团队无需准备 GPU 预算,也能运行 Agent 循环。
通过 self-hosting 部署,门槛则要高得多:模型权重采用 MIT 许可证且无需申请访问权限,但即使每个 token 仅激活 13B 参数,所有 expert 仍需常驻内存。DeepSeek 的 vLLM 示例使用单个 4×GB300 节点提供服务。Unsloth 的动态 GGUF 中,无损 8-bit 版本大小为 162 GB,3-bit 版本为 103 GB,后者大约需要 110 GB 的 RAM 与 VRAM 总容量。Self-hosting 更适合拥有推理集群的中大型企业,或者拥有一台高配置工作站并愿意采用激进量化方案的用户。
根据 DeepSeek-V4 技术报告,V4-Flash 是一个拥有 284B 参数的 MoE 模型,每个 token 激活 13B 参数,context window 为 1M token。每个 MoE 层包含 1 个 shared expert 和 256 个 routed expert,中间维度为 2048,每个 token 会激活 6 个 routed expert。前三个 MoE 层使用 hash routing。Multi-token prediction 深度为 1。
Attention 采用混合架构,结合了 Compressed Sparse Attention(CSA)和 Heavily Compressed Attention(HCA)。Manifold-Constrained Hyper-Connections(mHC)取代了传统 residual connection,其 expansion factor 为 4,并执行 20 次 Sinkhorn-Knopp 迭代。Pre-training 使用了超过 32T token,并采用 Muon optimizer。论文中最受关注的效率数据——在 1M context 下,单 token 推理 FLOPs 仅为 DeepSeek-V3.2 的 27%,KV cache 仅为其 10%——描述的是 V4-Pro,而非 Flash。
<!– 在此嵌入:将 wordpress-embed.html 粘贴到 Custom HTML 区块中 –>
以下所有数据均由 DeepSeek 提供,来自 0731 模型卡。
| Benchmark | V4-Flash-0731 | V4-Flash(Preview) | V4-Pro(Preview) | GLM-5.2 | Opus-4.8 |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 | 81.0 | 85.0 |
| NL2Repo | 54.2 | 39.4 | 38.5 | 48.9 | 69.7 |
| Cybergym | 76.7 | 38.7 | 52.7 | — | 83.1 |
| DeepSWE | 54.4 | 7.3 | 12.8 | 46.2 | 58.0 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 | 59.9 | 76.2 |
| Agents’ Last Exam | 25.2 | 15.8 | 16.5 | 23.8 | 25.7 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 | 12.9 | 27.2 |
有两点需要特别注意:
Code Agent 任务使用 DeepSeek Harness 的 minimal mode 运行,但该 Harness 尚未发布。
DSBench-FullStack(68.7)和 DSBench-Hard(59.6)是内部测试集。Agent 得分对 Harness 十分敏感,因此独立测试的结果可能存在差异。
只需添加一个 vLLM flag 即可启用 DSpark:--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'。DSpark 论文报告称,在整体吞吐量相同的情况下,V4-Flash 相较于 MTP-1 baseline,可将单用户生成速度提升 60%~85%。
该模型没有 Jinja chat template。作为替代,DeepSeek 提供了一个 encoding/ 文件夹,其中包含 encode_messages 和 parse_message_from_completion_text。reasoning_effort 可设置为 low、high 或 max。DeepSeek 建议 Agent 场景使用 temperature = 1.0、top_p = 0.95,其他场景使用 top_p = 1.0;在 high 和 max 模式下,最多可输出 384K token。
架构与 4 月发布的预览版相同,仍为 284B 总参数、每个 token 激活 13B 参数:此次飞跃完全来自 post-training。
在 DeepSeek 公布的每一项 Agent benchmark 中,它都击败了 V4-Pro(Preview),而输出价格仅为后者的三分之一。
采用 MIT 许可证且无需申请访问权限,因此本地商业部署已不存在许可障碍。
Self-hosting 在 3-bit 量化下需要约 110 GB 内存,full-precision 推理则需要一个 4×GB300 节点。
所有 benchmark 数据均由厂商基于尚未公开的 Harness 报告——请务必先运行自己的 eval。
可前往 HF 查看此次模型更新。也欢迎在 Twitter 上关注我们,别忘了加入我们拥有超过 15 万名成员的 ML SubReddit,并订阅 Newsletter。等等!你使用 Telegram 吗?现在也可以加入我们的 Telegram 了。
需要与我们合作,推广你的 GitHub Repo、Hugging Face Page、产品发布或 Webinar 等内容吗?请联系我们。
Asif Razzaq 是 Marktechpost Media Inc. 的 CEO。作为一位富有远见的创业者和工程师,Asif 致力于挖掘 Artificial Intelligence 推动社会公益的潜力。他最近创办了 Artificial Intelligence 媒体平台 Marktechpost。该平台以深入报道 machine learning 和 deep learning 新闻而脱颖而出,内容既保持了技术严谨性,也便于广大读者理解。该平台每月浏览量超过 200 万,充分体现了其在受众中的受欢迎程度。