前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8626
  • LLM Wiki:"想法文件" 知识管理范例
  • sllm:GPU 节点共享,实现不限量 Token 调用
  • 编程智能体如何利用工具和上下文实现高效编码
  • Claude Code发现隐藏23年的Linux漏洞
  • 用虚拟文件系统替代RAG的AI文档助手架构
  • Gemma 4开源模型发布:推理与Agent优化
  • 通义千问Qwen3.6-Plus:Agent应用专优
  • Lemonade:AMD开源本地LLM服务器
  • Claude Code安全泄露事件
  • Cursor IDE发布3代新界面
  • Gemma 4多模态模型:设备端部署优化
  • AI 落地三大洞察:帕累托法则、非确定性与早期机遇
  • Falcon Perception:Hugging Face 新开源模型
  • Claude 自动生成内核级 RCE 漏洞利用代码
  • Claude Code 完全指南:工作原理与最佳实践
  • 学习开源代码的四步递进法:从跑通到从零搭建
  • Gradio 后端驱动:快速构建自定义 AI 应用前端
  • OpenAI 领导层:自我改进、Super App 与 AGI 路径
  • Claude Dispatch:接口设计如何制约 AI 能力释放
  • PostgreSQL 的 BM25 全文搜索扩展开源
  • Granite 4.0 3B:企业文档的轻量级多模态模型
  • Claude Code 源码泄露分析:假工具、匹配坑、隐藏模式
  • Claude Code 用户遭遇使用限制提前耗尽
  • Claude Code 源码因 NPM 地图文件泄露
  • 产品思维是 AI 编程工具替不了的能力
  • 通用 Claude.md 秘诀:切减输出 Token
  • TRL 1.0:随行业发展的开源微调库
  • 做中学:Claude Code 实战教程
  • AI 代理审计发现:内容问题逐一报警
  • Zerobox:隔离运行命令的沙箱工具
  • 长链路 Agent 的能力与限制
  • Claude Code 工具 Bug:强制重置代码仓库
  • 谷歌重新想象 AI 时代的鼠标指针
  • LLM 推理优化:KV Cache 压缩方案
  • AI 辅助求解 Knuth 经典问题的进展
  • AI 破译古代亚述泥板的新尝试
  • Notion 创始人不写代码:AI 编程工具成熟见证
  • CLI 成为 AI Agent 接入产品的标准方式
  • 为什么管理层看好 AI,工程师持保留态度?
  • GitHub 活动自动转博客:MCP 工作流自动化
  • .claude/ 文件夹深度解析
  • Cursor 秘用中文 AI 模型未披露,为何程序员应关注
  • OpenClaw 开源项目发布
  • OpenClaw + Pieces 长期记忆一体化配置指南
  • 7 美元 VPS 上跑 AI Agent:IRC 网关新思路
  • 500 美元 GPU 编程性能超越 Claude Sonnet
  • Gemini 3.1 Flash 新增音频模型,延迟更低
  • 两周看透中国 AI 生态:创始人、芯片和泡沫
  • 为 Claude Code 设计纯文本认知架构
  • Claude 生成代码 90% 流向小项目,质量面临考验
  • 为 Agent 提供临时数据库的基础设施
  • 已加载 51 / 8626
7.0
热点
AI SCORE
模型发布2026-03-31 23:10

Granite 4.0 3B:企业文档的轻量级多模态模型

Hugging Face Blog#多模态#开源#文档处理
Editor brief · 编辑速览

开源轻量级多模态模型,专为文档理解和企业应用优化,3B 参数量实现了性能与部署的平衡。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

表格提取:准确解析来自文档图像的复杂表格结构(例如多行、多列等)

图表理解:将图表和图形转换为结构化的机器可读格式、摘要或可执行代码

语义键值对(KVP)提取:识别和定位跨不同文档布局的语义上有意义的键值字段对

该模型以 LoRA 适配器的形式构建在我们的稠密语言模型 Granite 4.0 Micro 之上,保持视觉和语言模块化设计,支持纯文本回退和无缝集成到混合管道中。它继续支持视觉语言任务,如从图像生成详细自然语言描述(例如"详细描述这张图像")。该模型可以单独使用,也可以与 Docling 结合使用,以便在文档处理管道中增强深度视觉理解能力。

Granite 4.0 3B Vision 的构建方式

Granite 4.0 3B Vision 的性能源于三个关键投资:通过新颖的代码引导数据增强方法构建的专用图表理解数据集、支持高细节视觉特征注入的 DeepStack 架构新变体,以及使模型对企业部署更实用的模块化设计。

ChartNet:教会模型真正理解图表

对视觉语言模型(VLMs)而言,图表是一个挑战,因为理解图表需要同时推理视觉模式、数值数据和自然语言,这种组合大多数 VLMs 无法处理得很好,尤其是当空间精度至关重要时——比如从线图中读取精确的数值。为了弥补这一差距,我们开发了 ChartNet:一个百万级别的多模态数据集,专为图表解释和推理而构建,详细内容将在我们即将发表的 CVPR 2026 论文中描述。

ChartNet 使用代码引导的合成管道生成 170 万个多样化的图表样本,跨越 24 种图表类型和 6 个绘图库(见图 1)。其独特之处在于,每个样本包含五个对齐的组件——绘图代码、渲染图像、数据表、自然语言摘要和问答对——为模型提供了对图表含义的深度跨模态视角,而不仅仅是外观。该数据集还包括人工标注和真实世界的子集,这些子集经过视觉保真度、语义准确性和多样性的筛选。

其结果是一个训练资源,能够让 VLMs 从单纯描述图表升级到真正理解它们所编码的结构化信息——在所有模型大小、架构和任务上都带来一致的性能提升。

图 1:ChartNet 的合成数据生成管道

DeepStack:更智能的视觉特征注入

大多数 VLMs 在单一点处将视觉信息注入到它们的语言模型中,这迫使模型同时处理高级语义和细粒度空间细节。Granite 4.0 3B Vision 采用了不同的方法,即 DeepStack 注入:抽象视觉特征被路由到更早的层进行语义理解,而高分辨率空间特征被馈入更后面的层以保留细节。其结果是一个既理解文档中有什么,又理解在哪里的模型——这对表格提取、图表理解和 KVP 解析等任务至关重要,因为在这些任务中布局和内容一样重要。详细的技术说明请参见模型卡中的"模型架构"部分。

模块化:一个模型,两种模式

Granite 4.0 3B Vision 被打包为 Granite 4.0 Micro 之上的 LoRA 适配器,而不是独立模型。实际上,这意味着同一个部署可以同时服务多模态和纯文本工作负载,在不需要视觉功能时自动回退到基础模型。这使得企业集成简单直接,同时不牺牲性能。

性能评估

图表:在人工验证的 ChartNet 基准上使用 LLM-as-a-judge 评估,Granite 4.0 3B Vision 在 Chart2Summary(86.4%)上实现了所有评估模型中最高的得分,包括明显更大的模型(见图 2)。它在 Chart2CSV(62.1%)上也排名第二,仅次于 Qwen3.5-9B(63.4%),后者的大小是它的两倍多。

图 2:Granite 4.0 3B Vision 在 chart2csv 和 chart2summary 上的性能,与同级视觉语言模型使用 LLM-as-a-judge 进行对比

表格:我们在两种设置中评估表格提取:裁剪表格(隔离区域)和全页文档(表格嵌入在复杂布局中)(见图 3)。基准套件包括 TableVQA-extract(裁剪的表格图像)、OmniDocBench-tables(全页文档)和 PubTables-v2(裁剪和全页设置)。模型被要求以 HTML 格式提取表格,并使用 TEDS 评分,这是一个捕获结构和内容准确性的指标。Granite 4.0 3B Vision 在所有基准上都实现了最强的性能,在 PubTablesV2 上的裁剪(92.1)和全页(79.3)、OmniDocBench(64.0)和 TableVQA(88.1)得分在所有评估模型中处于领先。

图 3:Granite 4.0 3B Vision 在裁剪和全页基准(TableVQA-extract、PubTables-v2、OmniDocBench-tables)上的表格提取性能,通过 TEDS 衡量

语义 KVP:VAREX 是一个专为区分小型提取模型而设计的基准,包含 1,777 份美国政府表格,从简单的平面布局到复杂的嵌套和表格结构。使用精确匹配(EM)对模型进行评估,这是一个严格的指标,要求模型提取的键值对与真实标签匹配。Granite 4.0 3B Vision 在零样本情况下达到 85.5% 的 EM 准确率。

部署方式

Granite 4.0 3B Vision 可以作为独立的视觉信息提取引擎运行,也可以作为与 Docling 的完全自动化文档处理管道的一部分运行。该模型旨在支持跨多种文档类型和视觉格式的可扩展、准确的提取。

1. 独立图像理解

Granite 4.0 3B Vision 可以直接运行在单个图像上,这个选项对于现有工作流需要有针对性的视觉提取而无需修改上游系统的应用很有用。这提供了轻松集成到现有自动化工作流的方式,适合轻量级的特定任务工具(例如表单解析器、图表分析器等)。

2. 与 Docling 集成的文档理解管道

Granite 4.0 3B Vision 也可以与 Docling 无缝集成以支持完整的端到端文档理解。这种模式可以提供:

多页 PDF 的大规模处理

通过 Docling 自动检测、分割和裁剪图形、表格及其他视觉元素,并将清晰的裁剪重定向到 Granite Vision 模型进行细粒度提取

工作流高效,总体计算成本更低且吞吐量更快

更高的准确性、更可靠的提取,以及在大型文档集合中明显改进的效率

使用场景

表单处理:使用 KVP 功能从发票、表单和收据中提取结构化字段,或使用 image2text 功能生成图像的自然语言描述(例如"详细描述这张图像")。

财务报告分析:使用 Docling 解析报告、检测图形并裁剪视觉元素。使用 Granite Vision 的 chart2csv、chart2code 处理图表,使用 tables_json 功能处理表格,将其转换为结构化的机器可读数据,从而实现可操作的见解。

研究文档智能:利用 Docling 跨密集学术 PDF 处理 OCR 和布局解析,并将提取的图形传递给 chart2summary,将表格裁剪传递给 tables_html,以便在单一管道中使视觉内容与自由格式文本一起可被发现。

Granite 4.0 3B Vision 现已在 HuggingFace 上推出,以 Apache 2.0 许可证发布。完整的技术细节、训练方法和基准结果可在模型卡中获得。我们很想听到你用它构建了什么——在社区标签页中分享你的反馈。

Original source

本文由 AI 翻译整理自 Hugging Face Blog,原文版权归原作者所有。

阅读英文原文
上一篇
PostgreSQL 的 BM25 全文搜索扩展开源
下一篇
Claude Code 源码泄露分析:假工具、匹配坑、隐藏模式