梳理 DeepSeek 公开论文中视觉理解的技术脉络,区分了论文披露、API 文档与未验证信息,对理解其多模态能力边界有参考价值。
这是一篇独立的技术分析,基于 DeepSeek 公开的研究成果和文档。不是 DeepSeek 的官方声明,也不声称当前 Vision-Exp API 可通过我们的上游渠道获取。
当 DeepSeek 发布 deepseek-v4-flash-vision-exp 时,表层叙事是一个专注文本的模型终于获得了原生图像输入。更有价值的故事要更长远一些:DeepSeek 已经在视觉数据、视觉-语言对齐、OCR、图表、文档以及统一的视觉理解与生成方面探索了多年。
本文重构了这条公开研究脉络,并区分了三件经常被混为一谈的事情:
DeepSeek-VL 的 2024 年论文《Towards Real-World Vision-Language Understanding》没有将视觉局限在 captioning 问题中,而是明确瞄准了网页截图、PDF、OCR、图表以及知识类视觉内容等实际输入。
该项目还描述了一个从真实用户场景中推导出的分类体系。该分类体系被用于构建指令微调数据,涵盖识别、转录、转换、分析、常识推理、逻辑推理、多图对比以及安全相关提示等任务。
该模型家族由三大组件构成:
混合编码器将基于 SigLIP-L 的低分辨率语义分支与源自 SAM-B 风格编码器的高分辨率分支配对使用。设计目标是实用导向的:全局语义理解对于小文本、密集文档、OCR 和视觉定位来说是不够的。
论文描述了一种分阶段方法:
一个特别重要的细节是模态间的平衡。最终预训练混合数据中保留了大约 70% 的文本数据和 30% 的多模态数据。DeepSeek 还描述了一种模态预热策略——逐渐引入多模态数据,而不是让模型突然从文本切换到图像。
这是视觉 Agent 的一条通用经验:仅添加图像编码器是不够的。训练过程必须保留语言模型现有的推理和指令跟随能力。
DeepSeek-VL 发布了约 1.3B 和 7B 两种规格变体,同时附带了项目代码和模型权重。这使得早期研究脉络比封闭的 API 模型更易于审视,但可审视不等于每个训练样本都具有公开可追溯性。
DeepSeek-VL2 在视觉-语言方向上进行了两项重大改进。
首先,针对不同宽高比和更高分辨率的图像引入了动态切片(dynamic tiling)。这一点很关键,因为固定 resize 会抹掉文档或截图任务恰好需要的那些细节。
其次,它使用了 DeepSeek 高效注意力设计的 MoE(Mixture-of-Experts)语言组件。目标是在不让每个参数对每个 token 都激活的情况下提升多模态能力。
论文评估了以下任务:
DeepSeek-VL2 作为 Tiny、Small 和更大规格的模型家族发布。在公开研究记录中,这是视觉堆栈开始更明确地围绕高分辨率输入、结构化文档和高效推理进行工程化的节点,而非仅做通用图像对话。
DeepSeek 的 Janus 论文探索了一个相关但不同的问题:一个自回归框架能否同时处理视觉理解和图像生成?
核心思想是将视觉编码解耦为不同的路径:
两条路径仍然可以连接到统一的自回归 Transformer。动机是理解与生成需要不同的视觉粒度。一个非常擅长识别图表的表示,并不自动成为生成像素的最佳表示。
Janus-Pro 后来对模型进行了扩展并优化了训练和数据策略。它的研究脉络与 DeepSeek 更广泛的视觉野心相关,但不应与当前的 API 视觉模型混为一谈:
共同的是在视觉表示上的研究投入。产品与接口是不同的。
DeepSeek 当前文档将 deepseek-v4-flash-vision-exp 列为接受图像输入的实验性模型。支持以下格式的图像:
模型可通过 DeepSeek 与 OpenAI 兼容的 Chat Completions 和 Responses API 访问,也可通过与 Anthropic 兼容的 Messages 端点访问。
文档还描述了 resize 后每个图像最多 384 个 token、每个请求最多 600 张图像,以及外部/base64 输入与 Files API 引用不同的限制。这些是 API 合约细节,而非模型内部训练数据已完整归档的证据。
截至发稿时,我们的上游渠道未暴露此模型。因此本文中的 API 示例基于文档,不应被视为 ZipFlow 生产测试。
公开论文提供了一种有用的研究级溯源形式。它们告诉我们:
但这与完整的源代码级溯源账本不同。
公开材料无法确定当前 Vision-Exp 模型使用的每张图像的完整列表、每个来源的完整许可链、完整的去重和污染报告,也无法从当前模型行为到命名训练样本建立一对一映射。
审慎的结论是:
DeepSeek 有一个长期运行且部分有文档记录的视觉数据研究项目。研究脉络是可见的;最新 API 模型的完整训练数据溯源则不可见。
这个区别对于正在进行技术、法律或采购尽职调查的开发者很重要。架构文档回答"我如何调用模型?"但不能自动回答"每个训练样本来自哪里?"
历史解释了几个在当前 API 中可见的设计选择。
早期 DeepSeek-VL 工作明确瞄准了网页截图、PDF、OCR 和图表。这使得当前 API 的图像输入支持与真实应用工作流相关,而非仅限于照片 captioning。
研究路径从视觉理解向工具使用工作流演进。一个能读取截图的模型是有用的;一个能读取截图、识别下一步操作并返回结构化证据的模型,对 Agent 更有用。
高分辨率图像携带更多细节,但消耗更多计算资源和上下文。从混合编码器和动态切片到 API 级图像 token 预算的演进,反映了相同的权衡:在保持推理可预测性的同时保留足够的细节。
DeepSeek-VL 和 DeepSeek-VL2 公开了论文、代码和模型产物。更新一些的 API 模型只暴露了接口和使用文档。这些在不同方面都有价值,但它们不提供同等的可审视性。
在将视觉模型放入生产 Agent 之前,请问:
新的 DeepSeek 视觉 API 最好被理解为更长研究轨迹上最新的公开面。它是 DeepSeek-VL 建立的真实世界视觉数据焦点的延续。DeepSeek-VL2 推进了更高分辨率理解和高效 MoE 推理。Janus 探索了理解和生成的独立视觉路径。Vision-Exp 将图像输入带入了当前的 API 工作流。
这条脉络是有意义的,但不应被夸大。我们可以追溯研究方向、架构思路、任务类别和选定的数据策略。我们无法负责任地声称最新 API 模型的完整训练数据溯源已被发布。
对于开发者来说,这仍然是有用的信息:利用公开论文理解设计轨迹,利用 API 文档构建集成,并将溯源和许可问题与能力声称分开。
相关论文