Deepseek 发布 V4.1-Flash,5520 亿参数但仅 16 亿激活,KV 缓存压缩至前身的四分之一,在 DeepSWE 编程基准上略胜 Opus 5 和 GPT-5.6 Sol,MIT 许可证。
Deepseek 发布了新的 AI 模型 V4.1-Flash。该模型通过大幅缩减处理长文本时所需的缓存,显著降低了运营成本。
该模型还将数据输入所需的计算量减半。这是通过一种技术分离实现的:在读取信息时激活的计算量低于后续生成文本时激活的计算量。
在编码任务上,这个免费开放的模型能够媲美 OpenAI 和 Anthropic 的顶级闭源模型。但在复杂科学任务和图像分析方面,该系统仍存在明显短板。
Deepseek 的新多模态模型主要为了降低长上下文的运营成本。最大的收益在内存占用方面,不过 Deepseek 也承诺会有更好的模型性能。
根据技术报告,Deepseek 为 V4.1-Flash 制定了一个明确的目标:收缩所谓的 KV 缓存。这个缓冲区保存了模型已处理的上下文部分,这样在每个新步骤时就不必重新计算所有内容。对于跨多个步骤工作的 Agent,它增长迅速,给 GPU 内存、SSD 和数据带宽带来压力。这推高了部署成本。
该语言模型核心拥有 5520 亿参数,可处理高达 100 万 token 的上下文。该公司表示,快速 GPU 内存中的缓存现在只需要其前身 Deepseek-V4-Flash 所需空间的约四分之一。永久卸载的部分(在 SSD 或主机内存中)缩减到大约八分之一。与 Deepseek-V1 相比,每个 token 的全局 KV 缓存大小下降了 437 倍。

Deepseek 通过多种协同工作的技术实现了这一点。其中核心方法是将模型分成两半。第一半处理输入数据,第二半则利用这些结果而无需重新计算所有内容。在读取输入时,模型每个 token 仅激活 80 亿个参数,但在实际文本输出时激活 160 亿个。

Deepseek 表示,这几乎将处理输入所需的计算量减半。这直接针对的是 Agent——它们通过频繁的工具调用不断处理新的输入。Deepseek 还将主 KV 缓存存储在 FP4 而不是 FP8 中。根据该报告,这几乎将该部分缓存的内存占用减半。
该模型从头开始训练,使用了涵盖文本和图像的 45 万亿 token 数据集。在后训练阶段,Deepseek 有意跳过新方法。该公司表示,主要收益并非来自新算法,而是来自更大、更好控制的数据、任务和训练环境。Deepseek 认为,在这一点上,这种规模化比算法调整更有帮助。

但 Deepseek 也观察到,受过训练的 Agent 有时会试图利用奖励系统谋取优势,而在其他情况下则会意外导致测试环境崩溃。有时它们会利用最近披露的安全漏洞或删除关键的系统文件。
尽管其活跃参数占比相对较小,Deepseek 报告称在多个基准测试中其结果接近领先模型。在 Agent 基准测试中,它有时能媲美顶级闭源模型。在软件测试 DeepSWE v1.1 中,它以 74.2% 的成绩略胜 Anthropic 的 Opus 5 和 OpenAI 的 GPT-5.6 Sol 等模型,而在 ProgramBench 上则大幅落后。
在需要专业知识的科学高难度 Agent 任务上,与超大规模模型之间仍存在明显差距。技术报告也承认,在读取复杂图像方面,与领先闭源系统之间存在可衡量的差距。
与其他许多推理模型一样,"思考深度"可以设置。用户通过一个单一的值来控制模型工作的彻底程度,在计算成本和准确性之间进行权衡。根据该报告,最高设置能显著改善多个基准测试的结果,但会产生大约 2.5 倍的输出 token。

Deepseek 在 Hugging Face 上以开放的 MIT 许可证提供模型文件,旨在为更经济高效的 AI Agent 研究提供起点。它也可以通过 API 获取,价格与 V4-Flash 相同。
Deepseek 在 7 月底通过 0731 更新对前身 V4-Flash 进行了重大改进。这个拥有 2840 亿参数、其中 130 亿活跃的模型,在 Artificial Analysis 智能指数上仅以一分之差落后于 OpenAI 的 GPT-5.6 Luna,且每个任务的成本低约 60%。8 月中旬,Deepseek 将其旗舰模型 V4-Pro 退出测试阶段,同时提高 API 价格。缓存命中,即已缓冲的输入,价格上涨了 6 倍。据台湾安全公司 TeamT5 称,自中国黑客组织开始将 Deepseek 用于漏洞利用代码和网络扫描以来,其攻击量增加了一倍多。
今年 6 月,Deepseek 在其首轮外部融资中筹集了约 74 亿美元,估值超过 500 亿美元。据路透社报道,Deepseek 目前已聘请中国投资银行中信证券为中国上市做准备。