Deepseek V4-Flash-Vision-Exp实验版新增图像理解能力,在自家多模态Agent基准上接近Opus 4.8水平。
中国 AI 公司 Deepseek 发布了 V4-Flash-Vision-Exp,这是一款实验性多模态模型,在其文本能力基础上加入了图像理解功能。Deepseek 表示,该模型在保持基座模型推理和世界知识文本性能的同时,为 Deepseek-V4-Flash 赋予了图像处理能力。在该公司内部的多模态 Agent 基准测试中,视觉版本的得分已接近 Opus 4.8。
Deepseek 正在瞄准视觉 Agent 工作流
Deepseek 将该模型定位为基于 Agent 的应用场景而设计。它能够与不同的 Agent 框架配合使用,并将视觉理解与工具调用相结合。在实际应用中,它可以描述图像内容、从截图中提取文字、分析图表。它支持 JPEG、PNG、GIF 和 WebP 格式,并依据实际文件内容而非文件名或声明的 MIME 类型来判断格式——据 API 文档所述。
新增视觉能力后,新款 Deepseek 模型在 Agent 基准测试中已接近甚至有时超越 Opus 4.8。| 图片来源:Deepseek

该模型支持 OpenAI 的 Chat Completions 和 Responses API,以及 Anthropic 的 Messages 端点。Deepseek 还发布了 Harness 框架的 0.1.1 版本,该版本开箱即用支持新款模型。
定价与图片限制
向该模型发送图片有三种方式。开发者可以直接使用 Base64 编码嵌入图片、引用公开可访问的 URL(最大 32 MiB),或使用全新的免费 Files API。Files API 允许你上传一次文件,然后在多次请求中通过 ID 引用该文件,大小限制为 64 MiB。
可选的 "detail" 字段会将图片缩小至 512 x 512 像素,在不需要精细视觉细节时节省 token。该模型在处理前会自动将图片规范化为大约 800 x 800 像素(具体取决于宽高比)。无论原始分辨率如何,每张图片最多消耗 384 token。计费标准遵循 V4-Flash 的费率。
单次请求最多可包含 600 张图片。每边最大边长为 8,192 像素,但一旦请求包含 15 张或更多图片,该限制将降至 4,096 像素。图片只能放在用户消息中。
无炒作的 AI 新闻——人工精选
订阅 THE DECODER,享受无广告阅读、每周 AI 时事通讯、六期/年独家"AI Radar"前沿报告、完整档案访问权限,以及评论 section 访问权限。