百万级 token 上下文窗口设计充分考虑 agent 实际需求。大幅扩展 agent 系统能力边界。
聚焦长期运行的 agent 工作负载。当今在 frontier 开放模型中运行 agent 会以可预见的方式失败。模型停止。你重新提示。trace 超过上下文预算,或 KV 缓存填满 GPU,或工具调用的往返延迟在长任务的中途恶化。V4 就是为了修复这些已知故障而构建的,并为社区指明道路。
本文涵盖三个方面:该架构在什么方面有所不同以使长上下文推理更便宜,在其之上的 agent 特定后训练决策,以及来自论文的一些见解,帮助我们理解这些变化。
1M 上下文窗口仅仅是容量,不是性能。你能否使用它取决于在该深度下每次前向传播的成本。对于运行长工具使用轨迹的 agent(SWE-bench 任务、多步骤浏览会话、包含数百条命令的终端会话),每个工具结果都被追加到上下文中,每个后续 token 都要付出完整的注意力成本,与之前的所有内容相比。
两个数字很重要:单 token 推理 FLOPs 和 KV 缓存大小。两者都随序列长度增长。在 1M token 处,DeepSeek-V4-Pro 相对于 DeepSeek-V3.2 需要 27% 的单 token 推理 FLOPs,因此在相同硬件上运行更快。它还使用 10% 的 KV 缓存内存。V4-Flash 将这些数字进一步降低:10% 的 FLOPs 和 7% 的 KV 缓存。
如果我们将 KV 缓存内存与已建立的架构(如具有 8 个头的分组查询注意力,以通常的 bfloat16 格式存储)进行比较,DeepSeek V4 所需的缓存大小大约是 2%。这使得部署以处理非常大的上下文变得容易得多。
Figure 1: benchmark comparison (left), per-token FLOPs and accumulated KV cache against sequence length (right).
效率增益来自将注意力分为两种机制并在各层之间交错。
压缩稀疏注意力(CSA)使用 softmax 门控池化和学习的位置偏差,将 KV 条目沿序列维度压缩 4 倍。闪电索引器(FP4、ReLU 评分的多头点积)为每个查询选择前 k 个压缩块。它继承了 DeepSeek V3.2 中稀疏注意力的稀疏选择思想,但在已经比原始序列短 4 倍的块上运行它。索引器的搜索空间随之缩小。
Figure 3: CSA. The compressor collapses every 4 tokens into one compressed KV entry. The lightning indexer picks the top-k compressed blocks per query. A sliding-window branch handles the most recent uncompressed tokens.
重度压缩注意力(HCA)将 KV 条目压缩 128 倍,并放弃稀疏选择。每个查询都对每个压缩块进行密集注意。压缩序列足够短,密集注意力是廉价的。
Figure 4: HCA. A heavier compressor (128x vs. 4x) followed by dense attention over the compressed stream, with the same sliding-window branch for recency.
各层在 CSA 和 HCA 之间交替。不同的层携带不同的注意力模式,强制一个机制跨所有层浪费容量。在 V4-Pro 的 61 层堆栈中,第 0-1 层是 HCA,第 2-60 层在 CSA 和 HCA 之间交替,末尾的 MTP 块仅运行滑动窗口。
两条路径都对大多数 KV 条目使用 FP8 存储,仅对 RoPE 维度使用 BF16。CSA 内的闪电索引器以 FP4 运行。这些存储选择与压缩比相结合,产生 2% 的 KV 缓存数据。
Figure 2: overall architecture. Attention layers alternate between CSA and HCA. Feed-forward layers use DeepSeekMoE. Residual connections are replaced with manifold-constrained hyper-connections (mHC).
高效的长上下文注意力对 agent 工作流来说是必要的,但不充分。论文描述了三个后训练和基础设施选择,直接针对 agent 用例。
V3.2 在工具结果轮次中保留了推理 trace,但只要新的用户消息到达,就丢弃它们。对于处理单个用户轮次的 agent,这很好。对于多轮 agent 工作流,其中用户在 agent 已经链接了多个工具调用后发送后续消息,模型丢失了累积的推理并不得不重新构造状态。
V4 在对话包含工具调用时,在用户消息边界之间保留推理内容。模型在所有轮次中保留完整的推理历史,包括跨用户轮次。这允许在长期 agent 任务中形成连贯的、累积的思维链。对于不含工具的会话使用,保留旧行为:在每个轮次丢弃推理,以保持上下文简洁。
Figure 7: thinking with tools (top) preserves reasoning across all turns. Thinking without tools (bottom) discards reasoning at each new user message.
V4 引入了 |DSML| 特殊 token 和基于 XML 的工具调用格式。与 JSON 字符串工具调用相比,XML 格式减少了转义失败,这是模型在发出嵌套引用内容时的常见失败模式。
该模式将字符串参数(使用 string="true" 传递)与结构化参数(使用 string="false" 传递为 JSON)分开。这消除了 JSON 工具调用格式经常遇到的关于数字和布尔值的一类解析错误。
agent 行为是使用 RL 针对真实工具环境训练的。论文描述了为此目的构建的沙箱基础设施。DeepSeek 弹性计算(DSec)是一个 Rust 平台,在一个 Python SDK 后面暴露四个执行基底:函数调用、容器、microVM(Firecracker)和完整 VM(QEMU)。单个集群运行数十万个并发沙箱。
三个 DSec 特性对 agent 训练很重要:通过分层 3FS 存储实现快速镜像加载(这样 RL 推出不会等待容器启动),抢占安全的轨迹重放(这样被中断的训练步骤可以恢复而无需重新运行工具调用),以及跨基底的统一 API(这样训练工具可以针对函数调用或完整 VM,无需重写)。这些基础设施决策支撑了 agent 基准分数。
知识和推理数字具有竞争力但不是领先的。agent 数字是 V4-Pro-Max 与其他领域分离的地方。
来自表 6 agent 部分的具体数字:
Terminal Bench 2.0:V4-Pro-Max 得分 67.9,领先于 GLM-5.1(63.5)和 K2.6(66.7),落后于 GPT-5.4-xHigh(75.1)和 Gemini-3.1-Pro(68.5)。
SWE Verified:80.6 已解决,与 Opus-4.6-Max(80.8)和 Gemini-3.1-Pro(80.6)相差不超过一分。
MCPAtlas Public:73.6,仅次于 Opus-4.6-Max(73.8)。
Toolathlon:51.8,领先于 K2.6(50.0)、GLM-5.1(40.7)和 Gemini-3.1-Pro(48.8)。
在论文的内部研发编码基准中,这是跨 PyTorch、CUDA、Rust 和 C++ 的 30 个精心策划的任务,V4-Pro-Max 达到 67% 的通过率,而 Sonnet 4.5 达到 47%,Opus 4.5 达到 70%。在对使用 V4-Pro 作为日常驾驶员的 85 名 DeepSeek 开发者的调查中,52% 表示它已准备好替换他们当前的主要编码模型,39% 倾向于是。
长上下文检索数字在图 9 中。MRCR 8 针精度在 256K token 处保持在 0.82 以上,在 1M 处保持在 0.59。
Figure 9: MRCR 8-needle retrieval. V4-Pro-Max stays above 0.82 through 256K and holds at 0.59 at 1M.
Hub 上有四个检查点。instruct 模型为 MoE 专家权重使用 FP4,为其他所有内容使用 FP8。base 模型始终为 FP8。
deepseek-ai/DeepSeek-V4-Pro (1.6T / 49B activated, instruct)
deepseek-ai/DeepSeek-V4-Flash (284B / 13B activated, instruct)
deepseek-ai/DeepSeek-V4-Pro-Base (1.6T / 49B activated, base)
deepseek-ai/DeepSeek-V4-Flash-Base (284B / 13B activated, base)
两个 instruct 模型都支持三种推理模式:Non-think(快速,无思维链)、Think High(显式推理在 <think> 块中)和 Think Max(最大推理努力,带有专用系统提示)。Think Max 需要至少 384K token 的上下文窗口。所有模式推荐的采样参数是 temperature=1.0,top_p=1.0。
V4-Pro 在 SWE Verified、MCPAtlas 和内部研发基准上的数字使其与前沿闭源模型在 agent 任务上达到奇偶性。开放问题是社区的工具工具框架如何适应 |DSML| 模式,以及交错思考的收益是否转移到域外 agent 框架。
本博客文章中的图表来自技术报告 DeepSeek_V4.pdf。
根据我的个人测试,DeepSeek V4 Flash(非思考模式)在 32k 和 435k 实际提示 token 上都通过了 Needle-in-a-Haystack 检索测试,在 0-100% 深度范围内获得 100% 的结果。在没有针的负控制中使用 NOT_FOUND 指令,模型也返回了 100% 的正确失败,降低了污染和假阳性的风险。
所以思考模式可能会在某些测试中降低行为。