MoE 模型实现 1M token 上下文,V4-Pro 仅用 V3.2 的 27% FLOPs 和 10% KV cache,V4-Flash 更降至 10% FLOPs 和 7% KV cache。
在 2024 年和 2025 年的大部分时间里,每家前沿实验室都在承诺同一件事:更大的上下文窗口。200K,然后 1M,然后 2M token。营销幻灯片看起来很棒,但账单就不是那么回事了。把一个真正的百万 token 提示词送入标准 transformer,光是 KV cache 就能吃掉数十 GB 的 VRAM,而每个 token 的推理成本也会攀升到吞噬任何产品利润的地步。
2026 年 4 月 24 日,DeepSeek 悄然交出了答案。据 MIT Technology Review 报道,这家中国实验室发布了 DeepSeek-V4-Pro(总计 1.6T 参数,49B 活跃参数)和 DeepSeek-V4-Flash(总计 284B,13B 活跃参数),均采用 MIT 许可发布,两者均支持原生 100 万 token 上下文窗口。据官方发布说明,核心数据是:V4-Pro 在 1M token 场景下,每个 token 的推理 FLOPs 仅为前代 V3.2 的 27%,KV cache 仅为 10%。V4-Flash 则进一步降至 FLOPs 的 10% 和 KV cache 的 7%。
本文将深入解析 V4 到底是什么、其混合注意力机制为何重要、相对闭源竞品的基准表现如何,以及如果你正在构建依赖长上下文推理的产品应该怎么做。

DeepSeek V4 是一个 MoE(Mixture-of-Experts,混合专家)语言模型家族,以开放权重形式发布在 Hugging Face 上。该家族包含两个变体:
V4-Pro — 总计 1.6 万亿参数,每个 token 激活 490 亿参数。面向前沿推理、编程和 Agent 负载。
V4-Flash — 总计 2840 亿参数,每个 token 激活 130 亿参数。面向对延迟敏感的服务和边缘推理,质量接近前沿水平。
两者共享同一架构创新:混合注意力栈,在不同层之间交替使用两种压缩策略,而非在所有层运行密集自注意力。两者原生支持 1,048,576 token 上下文。两者均采用 MIT 许可发布,意味着你可以自由微调、蒸馏和商业化部署,无需谈判许可。
权重是真实可用的,不是论文。你今天就可以下载它们,在 vLLM 或 SGLang 上运行,并将其部署在你自己的端点上。
标准 transformer 注意力有两个随上下文长度扩展性很差的成本:
计算量随序列长度呈二次增长。 1M token 的提示词成本不是 128K token 的 8 倍——每层成本大约是 64 倍。
KV cache 内存随上下文长度和模型深度线性增长。 一个拥有 1M token cache 的万亿参数模型,其激活内存需求可能超过权重本身的内存。
2025 年的大多数"长上下文"模型通过线性注意力变体、Ring Attention 或激进量化来掩盖这个问题。但质量通常会受损——大海捞针(NIAH)分数在超过 256K 后就会崩溃,任何需要跨文档真实推理的任务都会崩溃。
DeepSeek 的答案,记录在其 V4 技术博客中,并由 Andrew Lukyanenko 在 Medium 上进行了分析,承认了一个基本事实:并非每一层都需要相同的细节级别。早层受益于局部精度,深层受益于廉价的全局路由。于是他们构建了两种注意力机制并交替使用。
V4 注意力栈在两种自定义机制之间交替运行。
CSA 通过带学习位置偏置的 softmax 门控池化,在序列维度上将键值压缩 4 倍。每个查询然后通过一个"闪电索引器"来选择值得关注的前 k 个压缩块,并行的一个滑动窗口分支处理最新的未压缩 token。
结果是:一层以 token 级精度保留附近上下文的细粒度(滑动窗口),而将所有更早内容的聚合块级精度以每层约四分之一的标准注意力成本维持。
HCA 将同一思路推进得更远:约 128 倍的压缩,然后在结果的小块表示上运行密集注意力。这是刻意为之的廉价和有意有损。它给了模型一个整个上下文的粗粒度全局视图——足以大致知道某物在哪里——而无需为它本来也不会使用的 token 级分辨率付费。
在整个模型深度上交替使用 CSA 和 HCA,意味着每个 token 都会同时看到细粒度附近注意力和粗粒度全局注意力,但你永远无需在 1M token 序列上支付全密集注意力的代价。据 dasroot.net 上的技术解析,这就是 V4 的 KV cache 缩小一个数量级而质量保持的根本结构原因。

如果质量暴跌,效率故事就没有意义了。并没有。以下是 V4-Pro 相对于其他前沿模型在开发者真正关心的基准测试上的对比,数据来自 MorphLLM 的对比和 BuildFastWithAI 的评测:
表中比其余所有数字都重要的两个数字:
SWE-bench Verified 80.6% 与 Gemini 3.1 Pro 并列开放权重榜首,与最佳闭源模型在误差范围内持平。SWE-bench 是一个真实代码库测试,不是合成基准——它要求模型端到端地修复实际的 GitHub issue。
每百万输出 token 0.87 美元 大约是同类闭源模型的 1/10 到 1/15,这还只是 API 价格。如果你自行托管权重,边际成本还会进一步下降。
97% 的 1M token 大海捞针准确率 是大多数人忽略的部分。1M token 窗口 NIAH 得分 60% 只是一个营销窗口——对上下文填空有用,但无法可靠检索任何具体内容。97% 意味着你可以真正依赖模型找到你放进去的东西。
如果你一直在等待开放权重模型成为生产级 Agent 负载的严肃选项,这就是那个时刻。几个具体的变化值得关注:
# V4 之前:按 token 付费的闭源 API 主导长上下文 Agent
# 在 Claude Sonnet 4.6 上典型 500K-token 研究 Agent 运行:
# 每次查询约 $8.00,TTFT 4 秒
# V4 之后:同样的工作负载运行在自托管 V4-Flash 上
# 每次查询约 $0.18(电费 + 分摊 GPU 成本),TTFT 1.2 秒
# 此外:权重留在你的硬件上,数据不离开边界
三个实际影响:
长上下文 RAG 成为默认选项。 当你可以用不到一美元的费用将 800K token 的公司文档塞进单个提示词时,对于许多内部工具来说,向量检索的工程复杂性就不再合理了。你会看到团队今年拆除他们的 RAG 管道。
自托管从"有则更好"变成"明显更便宜"。 单台 8xH100 机器可以生产级延迟地运行 V4-Flash。与闭源 API 的盈亏平衡点约为每天 500-1000 万 token,大多数正经产品一周内就能越过这个门槛。
Agent 工作流变得更长。 如今大多数编程 Agent 会激进地截断,因为每增加 100K 上下文会使成本翻倍。有了 V4 的压缩 cache,你可以将整个代码库、之前的工具调用和完整的推理追踪保持在作用域内,而无需为此费神。
如果你更喜欢视频形式的架构解析,以及 CSA 和 HCA 背后的设计选择,Welch Labs 制作了一个清晰的视觉讲解视频,涵盖注意力机制、MoE 路由和 DeepSeek 使用的训练数据课程。
DeepSeek V4 真的可以免费商业使用吗? 是的。权重以 MIT 许可发布在 Hugging Face 上,允许商业使用、修改、分发和私人使用,无版税。唯一的要求是保留版权声明。托管 API 是单独定价的,但你没有义务使用它。
我可以在单 GPU 上运行 DeepSeek V4-Pro 吗? 不能。V4-Pro 的 1.6T 参数即使使用 FP8 量化也需要多 GPU 推理——全质量服务最少需要 8xH100 或 8xH200 节点。V4-Flash(总计 284B,活跃 13B)则更容易处理,可以在单高 VRAM 节点或使用激进量化的 2x40GB 配置上运行。
混合注意力在短提示词上会损害质量吗? 实际上,没有可测量的影响。当序列足够短以至于滑动窗口覆盖一切时,CSA 层会优雅地降级到接近标准注意力的水平,而 HCA 的粗粒度全局视图变得冗余而非有害。标准短上下文评估的基准分数与 V3.2 持平或更高。
V4 与 Fable 5 编程能力相比如何? Fable 5 目前在纯软件工程基准上领先,但差距很小(SWE-bench 上几分之差),而且 V4 是开放权重,Fable 5 是闭源且每 token 成本大约高 10-15 倍。对于大多数生产级编程工作流,即使原始质量略低,V4 的每次修复成本效益比仍然更优。
这会杀死闭源前沿模型吗? 不会——但会大幅收紧闭源定价的螺丝。当一个免费的 MIT 许可模型以十分之一的成本匹配你的基准分数时,你要么降价,要么证明一个有意义的能力领先来证明溢价的合理性。期待闭源实验室在 Agent 框架、工具使用和集成产品上竞争,而非单纯的原始模型质量。
DeepSeek V4 是长上下文推理从奢侈品变为基础配置的时刻。混合注意力设计并非魔法——它只是正确地承认了一个事实:统一的密集注意力在 1M token 场景下从来都是浪费。结合 MIT 许可的权重、前沿的基准分数和一个数量级的定价优势,V4 重新设定了 2026 年每款其他模型必须跨越的底线。
如果你正在构建任何涉及长上下文推理的产品——研究 Agent、代码审查机器人、文档分析管道、具有深度记忆的多轮助手——问题不再是要不要评估开放权重模型。而是你要先把哪个闭源模型依赖迁移出去。