DeepSeek推出实验性多模态视觉理解模型,在Code Agent类benchmark上大幅超越前版,多模态Agent能力接近Opus-4.8,已可在DeepSeek API调用。
今天,全新的多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 上线 DeepSeek API 平台,这是一个实验性质的模型,用户可以通过设置 model='deepseek-v4-flash-vision-exp' 访问该模型。
Terminal Bench 2.1: 83.9
AutomationBench (Public): 25.7
ApexBench (Pass@1): 36.5
Agents' Last Exam: 27.3
Chartography: 64.3 (p0.95); 63.3 (p1.0)
ZeroBench (Pass@5): 35.0
对于公开基准测试集中的 Code Agent 文本任务,DeepSeek 系列模型使用 DeepSeek Harness 极简模式作为框架进行测试,并使用 max 档位,topp=0.95,temperature=1.0;在 ApexBench 与 Agents' Last Exam 测评中,文本模型 DeepSeek-V4-Flash 会忽略其中的多模态元素
在纯文本能力(Agent、推理、世界知识等)方面,DeepSeek-V4-Flash-Vision-Exp 与 DeepSeek-V4-Flash 正式版持平。
在需要视觉理解的 Agent Benchmark 上,DeepSeek-V4-Flash-Vision-Exp 相比 DeepSeek-V4-Flash 实现了大幅跃升,多模态 Agent 能力已接近 Opus-4.8。
DeepSeek-V4-Pro 正式版已同步在 APP、网页端和 API 更新上线。API 调用方式不变,模型名设置为 deepseek-v4-pro,即可使用最新版本。
正式版 DeepSeek V4 Pro 极大增强了 Agent 能力,在生产环境中的性能表现提升尤为显著。
HLE (wo / w tools): 42.7/60.0
Terminal Bench 2.1: 87.9
Toolathlon-Verified: 74.1
Agents' Last Exam: 25.7
AutomationBench (Public): 31.8
DSBench-FullStack: 71.1
DeepSeek API 现已原生支持 OpenAI Responses API 格式,并针对性适配 Codex。用户可以参考官方文档,通过一键配置脚本完成 Codex 的配置。
V4-Pro 和 V4-Flash 思考模式现支持 low / high / max 三档思考强度,用户在实际使用中可以根据任务复杂度灵活选择:简单任务使用 low,日常 Agent 任务使用 high,更复杂的任务场景使用 max。设置方法请参考官方 API 文档:思考模式。
随着 DeepSeek V4 全系列模型正式版上线,我们将对 API 价格进行更新调整。为了更加合理地调配资源,我们将采用峰谷定价,闲时价格为高峰时段价格的一半,鼓励用户根据实际使用情况调整任务时间。新价格将于北京时间 2026 年 8 月 17 日 0 时开始生效。
DeepSeek-V4-Flash 正式版 API 上线公测,API 调用方式不变,模型名设置为 deepseek-v4-flash 即可使用最新版本。
Terminal Bench 2.1: 82.7
Toolathlon verified: 70.3
Agent Last Exam: 25.2
Automation Bench (Public): 25.1
DSBench-FullStack: 68.7
注1:对于公开基准测试集中的 Code Agent 任务,正式版 DeepSeek-V4-Flash 使用 DeepSeek Harness 极简模式(即将发布)作为框架进行测试,并使用 max 档位,topp=0.95,temperature=1.0 注2:DSBench-FullStack 是内部使用的全栈开发测试集,DSBench-Hard 是内部使用的 Coding Agent 难题测试集
DeepSeek API 已支持 V4-Pro 与 V4-Flash,支持 OpenAI ChatCompletions 接口与 Anthropic 接口。访问新模型时,base_url 不变,model 参数需要改为 deepseek-v4-pro 或 deepseek-v4-flash。
旧有的 API 接口的两个模型名 deepseek-chat 与 deepseek-reasoner 将于三个月后(2026-07-24)停止使用。当前阶段内,这两个模型名分别指向 deepseek-v4-flash 的非思考模式与思考模式。
deepseek-chat 和 deepseek-reasoner 都已升级为 DeepSeek-V3.2。
deepseek-chat 对应 DeepSeek-V3.2 的非思考模式deepseek-reasoner 对应 DeepSeek-V3.2 的思考模式我们非正式部署了 DeepSeek-V3.2-Speciale 的 API 服务,API 用户可以通过设置 base_url="https://api.deepseek.com/v3_2_speciale_expires_on_20251215" 访问该模型。该模型 API 价格不变,只支持思考模式下的对话功能,不支持工具调用等功能,最大输出长度默认为 128K,支持时间截止至北京时间 2025-12-15 23:59。
deepseek-chat 和 deepseek-reasoner 都已升级为 DeepSeek-V3.2-Exp。
deepseek-chat 对应 DeepSeek-V3.2-Exp 的非思考模式deepseek-reasoner 对应 DeepSeek-V3.2-Exp 的思考模式deepseek-chat 和 deepseek-reasoner 都已升级为 DeepSeek-V3.1-Terminus。deepseek-chat 对应 DeepSeek-V3.1-Terminus 的非思考模式,deepseek-reasoner 对应 DeepSeek-V3.1-Terminus 的思考模式。
此次更新在保持模型原有能力的基础上,针对用户反馈的问题进行了改进,包括:
deepseek-chat 和 deepseek-reasoner 都已升级为 DeepSeek-V3.1。deepseek-chat 对应 DeepSeek-V3.1 的非思考模式,deepseek-reasoner 对应 DeepSeek-V3.1 的思考模式。
DeepSeek-V3.1 包含以下主要变化:
SWE-bench Verified: 66.0
SWE-bench Multilingual: 54.5
Terminal-bench: 31.3
deepseek-reasoner 模型升级为 DeepSeek-R1-0528:
推理能力增强
基准测试提升显著(Pass@1)
注:复杂推理问题相比老版本 R1 会使用更多 tokens
Web 前端开发能力优化:生成的网页与游戏更加美观
幻觉降低:极大程度抑制了老版本 R1 所存在的幻觉问题
JSON Output 与 Function Calling 支持
Function call 性能:Tau-bench score: 53.5 (Airline) / 63.9 (Retail)
deepseek-chat 模型升级为 DeepSeek-V3-0324:
推理能力增强
基准测试提升显著
Web 前端开发能力优化:代码生成准确率提升,生成的网页与游戏前端更加美观
中文写作能力升级
功能增强
中文搜索能力优化:报告分析类请求优化,输出内容详实
Function Calling 能力改进:Function Calling 准确率提升,修复 V3 之前的问题
deepseek-reasoner 是我们的新模型 DeepSeek-R1。可以通过指定 model=deepseek-reasoner 调用。
详细更新,请参考:DeepSeek-R1 正式发布
deepseek-chat 模型升级为 DeepSeek-V3,接口不变,可以通过指定 model=deepseek-chat 调用。
详细更新,请参考:DeepSeek-V3 正式发布
deepseek-chat 模型升级为 DeepSeek-V2.5-1210,模型各项能力提升,相关基准测试:
与此同时,全新版本的模型对文件上传和网页总结功能的用户体验进行了优化。
deepseek-coder & deepseek-chat 升级为 DeepSeek V2.5 模型
DeepSeek V2 Chat 和 DeepSeek Coder V2 两个模型已经合并升级,升级后的新模型为 DeepSeek V2.5。
为向前兼容,API 用户通过 deepseek-coder 或 deepseek-chat 均可以访问新的模型。
新模型在通用能力、代码能力上,都显著超过了旧版本的两个模型。
新模型更好地对齐了人类的偏好,在写作任务、指令跟随等多方面进行了优化:
新模型在原 Coder 模型的基础上进一步提升了代码生成能力,对常见编程应用场景进行了优化,并在标准测试集上取得了以下成绩:
LiveCodeBench (1-9月): 41%
DeepSeek API 创新采用硬盘缓存,价格再降一个数量级
更新详情请跳转文档 API 上线硬盘缓存 2024/08/02
更新详情请跳转文档 API 升级新功能 2024/07/25
deepseek-coder 模型升级为 DeepSeek-Coder-V2-0724。
deepseek-chat 模型升级为 DeepSeek-V2-0628,模型推理能力提升,相关基准测试:
在 Arena-Hard 测评中,与 GPT-4-0314 的对战胜率从 41.6% 提升到了 68.3%。
模型角色扮演能力显著增强,可以在对话中按要求扮演不同角色。
deepseek-coder 模型升级为 DeepSeek-Coder-V2-0614,代码能力显著提升,在代码生成、代码理解、代码修复和代码补全上达到了 GPT-4-Turbo-0409 的水平,并拥有卓越的数学和推理能力,其通用能力与 DeepSeek-V2-0517 持平。
deepseek-chat 模型升级为 DeepSeek-V2-0517,模型在指令跟随方面的性能得到了显著提升,IFEval Benchmark Prompt-Level 准确率从 63.9% 跃升至 77.6%。此外,我们对 API 端的 system 区域指令跟随能力进行了优化,显著增强了沉浸式翻译、RAG 等任务的用户体验。
模型对于 JSON 格式输出的准确性得到了提升。在内部测试集中,JSON 解析率从 78% 提高到了 85%。通过引入恰当的正则表达式,JSON 解析率进一步提高至 97%。