DeepSeek-V4-Flash 正式版 API 开放公测,Agent 基准表现显著提升,原生支持 Responses API 并针对 Codex 完成适配;本次仅升级 Flash API,Pro 与 APP/WEB 端保持不变。
DeepSeek-V4-Flash 正式版 API 上线公测。API 调用方式不变,将模型名设置为 deepseek-v4-flash,即可使用最新版本。
Terminal Bench 2.1:82.7
Toolathlon Verified:70.3
Agent Last Exam:25.2
Automation Bench(Public):25.1
DSBench-FullStack:68.7
注 1:对于公开基准测试集中的 Code Agent 任务,正式版 DeepSeek-V4-Flash 使用 DeepSeek Harness 极简模式(即将发布)作为框架进行测试,并使用 max 档位,topp=0.95、temperature=1.0。
注 2:DSBench-FullStack 是内部使用的全栈开发测试集,DSBench-Hard 是内部使用的 Coding Agent 难题测试集。
DeepSeek API 已支持 V4-Pro 与 V4-Flash,并支持 OpenAI ChatCompletions 接口与 Anthropic 接口。访问新模型时,base_url 保持不变,model 参数需要改为 deepseek-v4-pro 或 deepseek-v4-flash。
旧有 API 接口中的两个模型名 deepseek-chat 与 deepseek-reasoner 将于三个月后(2026-07-24)停止使用。当前阶段,这两个模型名分别指向 deepseek-v4-flash 的非思考模式与思考模式。
deepseek-chat 和 deepseek-reasoner 都已升级为 DeepSeek-V3.2。
deepseek-chat 对应 DeepSeek-V3.2 的非思考模式。
deepseek-reasoner 对应 DeepSeek-V3.2 的思考模式。
我们非正式部署了 DeepSeek-V3.2-Speciale 的 API 服务。API 用户可以通过设置 base_url="https://api.deepseek.com/v3.2_speciale_expires_on_20251215" 访问该模型。该模型的 API 价格不变,只支持思考模式下的对话功能,不支持工具调用等功能;最大输出长度默认为 128K,服务支持至北京时间 2025-12-15 23:59。
deepseek-chat 和 deepseek-reasoner 都已升级为 DeepSeek-V3.2-Exp。
deepseek-chat 对应 DeepSeek-V3.2-Exp 的非思考模式。
deepseek-reasoner 对应 DeepSeek-V3.2-Exp 的思考模式。
deepseek-chat 和 deepseek-reasoner 都已升级为 DeepSeek-V3.1-Terminus。deepseek-chat 对应 DeepSeek-V3.1-Terminus 的非思考模式,deepseek-reasoner 对应 DeepSeek-V3.1-Terminus 的思考模式。
此次更新在保持模型原有能力的基础上,针对用户反馈的问题进行了改进,包括:
deepseek-chat 和 deepseek-reasoner 都已升级为 DeepSeek-V3.1。deepseek-chat 对应 DeepSeek-V3.1 的非思考模式,deepseek-reasoner 对应 DeepSeek-V3.1 的思考模式。
DeepSeek-V3.1 包含以下主要变化:混合推理架构,一个模型同时支持思考模式与非思考模式;更高的思考效率,相比 DeepSeek-R1-0528,DeepSeek-V3.1-Think 能在更短时间内给出答案;更强的 Agent 能力,通过 Post-Training 优化,新模型在工具使用与智能体任务中的表现有较大提升。SWE-bench Verified:66.0,SWE-bench Multilingual:54.5,Terminal-bench:31.3。
混合推理架构:一个模型同时支持思考模式与非思考模式。
更高的思考效率:相比 DeepSeek-R1-0528,DeepSeek-V3.1-Think 能在更短时间内给出答案。
更强的 Agent 能力:通过 Post-Training 优化,新模型在工具使用与智能体任务中的表现有较大提升。SWE-bench Verified:66.0,SWE-bench Multilingual:54.5,Terminal-bench:31.3。
SWE-bench Verified:66.0
SWE-bench Multilingual:54.5
deepseek-reasoner 模型升级为 DeepSeek-R1-0528:
推理能力增强。基准测试成绩显著提升(Pass@1):AIME 2025:70.0 → 87.5(+17.5),GPQA:71.5 → 81.0(+9.5),LCB_v6:63.5 → 73.3(+9.8),Aider:57.0 → 71.6(+14.6)。注:处理复杂推理问题时,相比旧版 R1 会使用更多 tokens。
基准测试成绩显著提升(Pass@1):AIME 2025:70.0 → 87.5(+17.5),GPQA:71.5 → 81.0(+9.5),LCB_v6:63.5 → 73.3(+9.8),Aider:57.0 → 71.6(+14.6)。
AIME 2025:70.0 → 87.5(+17.5)
GPQA:71.5 → 81.0(+9.5)
LCB_v6:63.5 → 73.3(+9.8)
Aider:57.0 → 71.6(+14.6)
注:处理复杂推理问题时,相比旧版 R1 会使用更多 tokens。
Web 前端开发能力优化:生成的网页与游戏更加美观。
幻觉降低:极大程度抑制了旧版 R1 中存在的幻觉问题。
支持 Json Output 与 Function Calling。Function call 性能:Tau-bench score:53.5(Airline)/63.9(Retail)。
Function call 性能:Tau-bench score:53.5(Airline)/63.9(Retail)。
Tau-bench score:53.5(Airline)/63.9(Retail)。
deepseek-chat 模型升级为 DeepSeek-V3-0324:
推理能力增强。基准测试成绩显著提升:MMLU-Pro:75.9 → 81.2(+5.3),GPQA:59.1 → 68.4(+9.3),AIME:39.6 → 59.4(+19.8),LiveCodeBench:39.2 → 49.2(+10.0)。
基准测试成绩显著提升:MMLU-Pro:75.9 → 81.2(+5.3),GPQA:59.1 → 68.4(+9.3),AIME:39.6 → 59.4(+19.8),LiveCodeBench:39.2 → 49.2(+10.0)。
MMLU-Pro:75.9 → 81.2(+5.3)
GPQA:59.1 → 68.4(+9.3)
AIME:39.6 → 59.4(+19.8)
LiveCodeBench:39.2 → 49.2(+10.0)
Web 前端开发能力优化:代码生成准确率提升,生成的网页与游戏前端更加美观。
中文写作能力升级:风格与内容得到优化,实现与 R1 写作风格对齐,中长篇写作内容质量提升。
风格与内容优化:实现与 R1 写作风格对齐,中长篇写作内容质量提升。
功能增强:多轮交互式改写能力提升,翻译质量与书信写作得到优化。
中文搜索能力优化:针对报告分析类请求进行了优化,输出内容更加详实。
Function Calling 能力改进:Function Calling 准确率提升,修复 V3 之前的问题。
Function Calling 准确率提升,修复 V3 之前的问题。
deepseek-reasoner 是我们的新模型 DeepSeek-R1,可以通过指定 model=deepseek-reasoner 调用。
详细更新请参考:DeepSeek-R1 正式发布。
deepseek-chat 模型升级为 DeepSeek-V3,接口保持不变,可以通过指定 model=deepseek-chat 调用。
详细更新请参考:DeepSeek-V3 正式发布。
deepseek-chat 模型升级为 DeepSeek-V2.5-1210,模型各项能力均有提升,相关基准测试如下:
与此同时,新版本模型还优化了文件上传和网页总结功能的用户体验。
DeepSeek V2 Chat 和 DeepSeek Coder V2 两个模型已经合并升级,升级后的新模型为 DeepSeek V2.5。
为保持向前兼容,API 用户通过 deepseek-coder 或 deepseek-chat 均可访问新模型。
新模型在通用能力和代码能力方面都显著超过了旧版本的两个模型。
新模型更好地对齐了人类偏好,并针对写作任务、指令跟随等多个方面进行了优化:
新模型在原 Coder 模型的基础上进一步提升了代码生成能力,针对常见编程应用场景进行了优化,并在标准测试集中取得了以下成绩:
LiveCodeBench(1—9 月):41%
DeepSeek API 创新采用硬盘缓存,价格再降一个数量级。
更新详情请参阅文档:API 上线硬盘缓存,2024/08/02。
更新接口 /chat/completions:JSON 输出、Function 调用、对话前缀续写(Beta)、8K 最长输出(Beta)。
新增接口 /completions:FIM 补全(Beta)。
更新详情请参阅文档:API 升级新功能,2024/07/25。
deepseek-coder 模型升级为 DeepSeek-Coder-V2-0724。
deepseek-chat 模型升级为 DeepSeek-V2-0628,模型推理能力提升,相关基准测试如下:
在 Arena-Hard 测评中,与 GPT-4-0314 的对战胜率从 41.6% 提升至 68.3%。
模型的角色扮演能力显著增强,可以在对话中按要求扮演不同角色。
deepseek-coder 模型升级为 DeepSeek-Coder-V2-0614,代码能力显著提升,在代码生成、代码理解、代码修复和代码补全方面达到了 GPT-4-Turbo-0409 的水平,同时拥有卓越的数学与推理能力,通用能力与 DeepSeek-V2-0517 持平。
deepseek-chat 模型升级为 DeepSeek-V2-0517,模型在指令跟随方面的性能得到显著提升,IFEval Benchmark Prompt-Level 准确率从 63.9% 跃升至 77.6%。此外,我们还优化了 API 端对 system 区域指令的跟随能力,显著改善了沉浸式翻译、RAG 等任务的用户体验。
模型输出 JSON 格式的准确性得到提升。在内部测试集中,JSON 解析率从 78% 提高至 85%;通过引入恰当的正则表达式,JSON 解析率可进一步提高至 97%。