DeepSeek 发布 552B MoE 多模态模型,支持 100 万 token 上下文,通过 FP4 KV Cache 和跨层注意力复用显著降低长上下文场景下的 HBM/SSD 压力。
长上下文 Agent 已将 LLM 服务变成一类输入密集型工作负载。重复的 prefill 和百万 token 上下文产生的 KV 缓存,给 HBM、SSD 容量和带宽带来压力。DeepSeek AI 围绕这一核心瓶颈构建了最新版本。DeepSeek-V4.1-Flash 是一个多模态混合专家模型,拥有 552B 主干参数、196B 额外 Engram 参数,以及 1M token 的上下文窗口。Prefill 阶段每个 token 激活 8B 参数,Decode 阶段激活 16B。核心数字是:每个 token 的全局 KV 缓存占用为 890 字节,约为 DeepSeek-V4-Flash 的 1/4,大约是 DeepSeek-V1 的 1/437。
能否部署?可以。开源权重以 MIT 许可证发布,Hugging Face 上提供了 vLLM、SGLang 和 Transformers 路径,研发团队还描述了一个分为低推理、高推理和最大推理三档的公共 API。
40 层主干网络被拆分为 20 层因果编码器和 20 层解码器。受 YOCO 启发,解码器不自行计算全局 KV,而是通过逐层投影权重从编码器最终隐藏状态派生。因此 prompt token 停在编码器,prefill 计算量几乎减半。滑动窗口注意力(SWA)在每一层仍以 128 token 的窗口运行,因此解码器 SWA 状态只需重放最近 128 个 prompt token 即可重建。研发团队将此称为 Decoder SWA Bounded Replay。
DeepSeek-V4 将 CSA 与重度压缩注意力混合使用。V4.1-Flash 采用纯 CSA2,从层维度攻击缓存大小。每个 CSA2 层被静态分配 3 种模式之一:
Full:自行计算主 KV,从主 KV 投影 indexer K,并选择新的 Top-512 索引。
Reindex:复用上一个 Full 层的主 KV 和 indexer K,但用自己的 indexer Q 对它们重新评分。
Reuse:同时复用主 KV 和最新的 Top-K 索引,完全跳过 indexer。
每一层都保留自己的主 Q 和 SWA KV。18 个 CSA2 编码器层采用 2 的压缩比,分成 3 组每组 6 层(1 Full、5 Reuse)。20 个解码器层采用 1 的压缩比,分成 5 组每组 4 层:第一组为 Full 加 3 Reuse,其余为 Reindex 加 3 Reuse。解码器中的 Hierarchical Sparse Indexer 让 Full 层构建最多 16,384 个位置的候选池(2,048 个每块 8 token 的块),因此后续 Reindex 层只需对一个有界的集合评分,而不必评分整个上下文。
主 KV 缓存被量化为 E2M1,每 16 个通道一个 E4M3 scale,遵循 NVFP4 但不使用其全局 scale。这通过后训练中的量化感知训练引入,相比 V4 的 FP8 缓存,存储空间几乎减半。
在部署层面,SWA KV 不再持久化到 SSD。它驻留在从主机 DRAM 中划分出 10% 的分布式池中,TTL 为几分钟,而全局 KV 保证 72 小时的寿命。未命中时,Encoder SWA Bounded Replay 仅重放 128 个 token,而非层数乘以窗口大小。
其他变化包括 Single-Pass mHC,它将输入混合系数移动一个块,使融合的 Mega-mHC 内核能将激活内存流量减半;位于第 1 层和第 14 层的 Engram 条件记忆模块;DSpark 投机解码(在预训练后、主干冻结的条件下训练);以及 head-wise Muon。当上下文从 4K 扩展到 1M 时,单 token decode FLOPs 仅增加 1/4。
预训练覆盖 45T 多模态 token,文本与多模态比例为 7:1。稀疏注意力从头开始在 64K 序列长度上训练,无需密集 warmup,上下文在 34T token 时扩展到 1M。Base 模型在世界知识和编码任务上与 DeepSeek-V4-Pro-Base 持平,同时只使用了 1/3 的总参数和 1/4 的激活参数。
后训练未引入新算法。收益来自于大规模合成可验证的 Agent 任务、跨异构脚手架的 RL(Claude Code、Codex、OpenCode、Pi、mini-SWE、DeepSeek Harness),以及从 40 多个教师模型进行的状态蒸馏。精选的最大努力结果:
| Benchmark | DS-V4.1-Flash | DS-V4-Flash | Opus-5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 91.1 | 90.6 | 82.7 | 89.1 |
| DeepSWE v1.1 | 74.2 | 74.4 | 74.0 | 73.0 |
| Terminal-Bench 4.0 | 31.2 | 27.0 | 51.8 | 39.9 |
| Automation-Bench | 54.8 | 37.7 | 50.3 | 45.8 |
| GPQA Diamond | 90.9 | 89.9 | 93.4 | 91.0 |
| Codeforces (rating) | 3471 | 3289 | n/a | n/a |
在 Hugging Face 上查看该模型和技术报告。也欢迎关注我们的 Twitter,不要忘记加入我们的 15 万+ ML SubReddit 并订阅我们的 Newsletter。等一下!你用 telegram 吗?现在也可以加入我们了。
需要与我们合作推广您的 GitHub 仓库或 Hugging Face 页面或产品发布或网络研讨会吗?联系我们
Asif Razzaq 是 Marktechpost Media Inc. 的首席执行官。作为一位有远见的企业家和工程师,Asif 致力于将人工智能的潜力用于社会公益。他最近的举措是推出了一个人工智能媒体平台 Marktechpost,该平台以深度报道机器学习和深度学习新闻而著称,内容既有技术深度又通俗易懂。该平台每月浏览量超过 200 万次,证明了其在受众中的受欢迎程度。