开源轻量级多模态模型,专为文档理解和企业应用优化,3B 参数量实现了性能与部署的平衡。
表格提取:准确解析来自文档图像的复杂表格结构(例如多行、多列等)
图表理解:将图表和图形转换为结构化的机器可读格式、摘要或可执行代码
语义键值对(KVP)提取:识别和定位跨不同文档布局的语义上有意义的键值字段对
该模型以 LoRA 适配器的形式构建在我们的稠密语言模型 Granite 4.0 Micro 之上,保持视觉和语言模块化设计,支持纯文本回退和无缝集成到混合管道中。它继续支持视觉语言任务,如从图像生成详细自然语言描述(例如"详细描述这张图像")。该模型可以单独使用,也可以与 Docling 结合使用,以便在文档处理管道中增强深度视觉理解能力。
Granite 4.0 3B Vision 的性能源于三个关键投资:通过新颖的代码引导数据增强方法构建的专用图表理解数据集、支持高细节视觉特征注入的 DeepStack 架构新变体,以及使模型对企业部署更实用的模块化设计。
对视觉语言模型(VLMs)而言,图表是一个挑战,因为理解图表需要同时推理视觉模式、数值数据和自然语言,这种组合大多数 VLMs 无法处理得很好,尤其是当空间精度至关重要时——比如从线图中读取精确的数值。为了弥补这一差距,我们开发了 ChartNet:一个百万级别的多模态数据集,专为图表解释和推理而构建,详细内容将在我们即将发表的 CVPR 2026 论文中描述。
ChartNet 使用代码引导的合成管道生成 170 万个多样化的图表样本,跨越 24 种图表类型和 6 个绘图库(见图 1)。其独特之处在于,每个样本包含五个对齐的组件——绘图代码、渲染图像、数据表、自然语言摘要和问答对——为模型提供了对图表含义的深度跨模态视角,而不仅仅是外观。该数据集还包括人工标注和真实世界的子集,这些子集经过视觉保真度、语义准确性和多样性的筛选。
其结果是一个训练资源,能够让 VLMs 从单纯描述图表升级到真正理解它们所编码的结构化信息——在所有模型大小、架构和任务上都带来一致的性能提升。
图 1:ChartNet 的合成数据生成管道
大多数 VLMs 在单一点处将视觉信息注入到它们的语言模型中,这迫使模型同时处理高级语义和细粒度空间细节。Granite 4.0 3B Vision 采用了不同的方法,即 DeepStack 注入:抽象视觉特征被路由到更早的层进行语义理解,而高分辨率空间特征被馈入更后面的层以保留细节。其结果是一个既理解文档中有什么,又理解在哪里的模型——这对表格提取、图表理解和 KVP 解析等任务至关重要,因为在这些任务中布局和内容一样重要。详细的技术说明请参见模型卡中的"模型架构"部分。
Granite 4.0 3B Vision 被打包为 Granite 4.0 Micro 之上的 LoRA 适配器,而不是独立模型。实际上,这意味着同一个部署可以同时服务多模态和纯文本工作负载,在不需要视觉功能时自动回退到基础模型。这使得企业集成简单直接,同时不牺牲性能。
图表:在人工验证的 ChartNet 基准上使用 LLM-as-a-judge 评估,Granite 4.0 3B Vision 在 Chart2Summary(86.4%)上实现了所有评估模型中最高的得分,包括明显更大的模型(见图 2)。它在 Chart2CSV(62.1%)上也排名第二,仅次于 Qwen3.5-9B(63.4%),后者的大小是它的两倍多。
图 2:Granite 4.0 3B Vision 在 chart2csv 和 chart2summary 上的性能,与同级视觉语言模型使用 LLM-as-a-judge 进行对比
表格:我们在两种设置中评估表格提取:裁剪表格(隔离区域)和全页文档(表格嵌入在复杂布局中)(见图 3)。基准套件包括 TableVQA-extract(裁剪的表格图像)、OmniDocBench-tables(全页文档)和 PubTables-v2(裁剪和全页设置)。模型被要求以 HTML 格式提取表格,并使用 TEDS 评分,这是一个捕获结构和内容准确性的指标。Granite 4.0 3B Vision 在所有基准上都实现了最强的性能,在 PubTablesV2 上的裁剪(92.1)和全页(79.3)、OmniDocBench(64.0)和 TableVQA(88.1)得分在所有评估模型中处于领先。
图 3:Granite 4.0 3B Vision 在裁剪和全页基准(TableVQA-extract、PubTables-v2、OmniDocBench-tables)上的表格提取性能,通过 TEDS 衡量
语义 KVP:VAREX 是一个专为区分小型提取模型而设计的基准,包含 1,777 份美国政府表格,从简单的平面布局到复杂的嵌套和表格结构。使用精确匹配(EM)对模型进行评估,这是一个严格的指标,要求模型提取的键值对与真实标签匹配。Granite 4.0 3B Vision 在零样本情况下达到 85.5% 的 EM 准确率。
Granite 4.0 3B Vision 可以作为独立的视觉信息提取引擎运行,也可以作为与 Docling 的完全自动化文档处理管道的一部分运行。该模型旨在支持跨多种文档类型和视觉格式的可扩展、准确的提取。
Granite 4.0 3B Vision 可以直接运行在单个图像上,这个选项对于现有工作流需要有针对性的视觉提取而无需修改上游系统的应用很有用。这提供了轻松集成到现有自动化工作流的方式,适合轻量级的特定任务工具(例如表单解析器、图表分析器等)。
Granite 4.0 3B Vision 也可以与 Docling 无缝集成以支持完整的端到端文档理解。这种模式可以提供:
多页 PDF 的大规模处理
通过 Docling 自动检测、分割和裁剪图形、表格及其他视觉元素,并将清晰的裁剪重定向到 Granite Vision 模型进行细粒度提取
工作流高效,总体计算成本更低且吞吐量更快
更高的准确性、更可靠的提取,以及在大型文档集合中明显改进的效率
表单处理:使用 KVP 功能从发票、表单和收据中提取结构化字段,或使用 image2text 功能生成图像的自然语言描述(例如"详细描述这张图像")。
财务报告分析:使用 Docling 解析报告、检测图形并裁剪视觉元素。使用 Granite Vision 的 chart2csv、chart2code 处理图表,使用 tables_json 功能处理表格,将其转换为结构化的机器可读数据,从而实现可操作的见解。
研究文档智能:利用 Docling 跨密集学术 PDF 处理 OCR 和布局解析,并将提取的图形传递给 chart2summary,将表格裁剪传递给 tables_html,以便在单一管道中使视觉内容与自由格式文本一起可被发现。
Granite 4.0 3B Vision 现已在 HuggingFace 上推出,以 Apache 2.0 许可证发布。完整的技术细节、训练方法和基准结果可在模型卡中获得。我们很想听到你用它构建了什么——在社区标签页中分享你的反馈。