Falcon Perception:Hugging Face 新开源模型
Falcon 系列新增成员发布。具体能力和改进点需进一步了解。
Falcon 系列新增成员发布。具体能力和改进点需进一步了解。
我们还发布了 Falcon OCR,一个 0.3B 参数的模型,在 olmOCR 基准和 OmniDocBench 上分别达到 80.3 和 88.6 的分数,同时具有任何开源 OCR 模型中最高的吞吐量。
本文是我们构建内容、构建方式和过程中学到内容的简明实用总结。
许多开放词汇感知系统被构建为模块化管道:一个(通常是冻结的)视觉骨干网络提取特征,单独的融合/解码阶段将其与语言结合,额外的组件处理匹配和后处理。这类设计在许多场景中都能很好地工作,但它带有权衡:很难干净地扩展,很难将改进归属于正确的组件,并且当我们为每个故障模式添加新修复时,很容易堆积复杂性。
我们问了一个更简单的问题:如果选择正确的注意力模式、输出接口和训练信号,单个早期融合 Transformer 骨干网络能否同时处理感知和语言建模?
在我们的实验中,答案基本上是肯定的。本文的其余部分描述了主要设计选择及其背后的证据。
单个自回归 Transformer 处理图像块、文本和任务标记的统一序列。模型按固定顺序预测对象属性:<coord> → <size> → <seg>。边界框坐标和大小通过专门头部解码并作为傅里叶特征重新注入。高分辨率分割掩码通过 <seg> 标记与上采样图像特征之间的点积生成。
Falcon Perception 的核心是一个密集 Transformer,从第一层开始在共享参数空间中处理图像块和文本标记。与单独的视觉骨干网络后接晚期融合解码器不同,我们保持单个骨干网络,并依靠掩码和轻量级输出接口来使密集预测问题易于处理。
图像和文本具有不同的结构:像素是 2D 的并受益于双向上下文,而预测接口本质上是顺序的。我们通过混合注意力掩码来解决这个问题:
图像标记双向关注所有其他图像标记,构建全局视觉上下文(就像视觉编码器一样)。
文本和任务标记因果关注它们之前的所有内容 —— 完整的视觉前缀加上前面的文本。
这允许同一骨干网络在图像标记上表现得像双向视觉编码器,同时仍支持任务标记上的自回归预测。
密集感知不是固定大小的预测问题:图像可能包含零个实例或数百个实例。自回归生成提供了干净的可变长度接口,但完全自回归的密集生成(例如,逐标记的多边形或高分辨率掩码)很快变得昂贵。
我们使用一个小的结构化接口 Chain-of-Perception,将每个实例分解为三个步骤:
<coord> → <size> → <seg>
坐标标记:模型首先预测实例的中心 —— 确定它谈论的是哪个对象。
大小标记:然后预测空间范围 —— 确定它有多大。
分割标记:最后是单个嵌入,当与上采样图像特征点积时,生成全分辨率二进制掩码。
这个顺序是刻意的。首先提交几何形状减少了歧义("哪个实例?"),并使掩码预测步骤更接近以已解析对象为条件的像素精细化。
骨干网络是共享的,而解码使用针对输出类型定制的轻量级头部:
坐标和大小头部使用傅里叶特征编码:通过随机高斯投影将连续坐标映射到高维正弦空间。这克服了神经网络的谱偏差,比离散分箱单独产生更精确的定位。解码后的坐标作为后续标记的条件重新注入序列。
坐标和大小头部使用傅里叶特征编码:通过随机高斯投影将连续坐标映射到高维正弦空间。这克服了神经网络的谱偏差,比离散分箱单独产生更精确的定位。解码后的坐标作为后续标记的条件重新注入序列。
分割头部计算 <seg> 标记的隐藏状态与内容感知上采样图像特征之间的点积。因为 <seg> 标记是在几何之后生成的,并可以访问早期融合的视觉上下文,我们可以避免在基于解码器的实例分割训练中常见的单独的掩码查询机制和匈牙利匹配。
分割头部计算 <seg> 标记的隐藏状态与内容感知上采样图像特征之间的点积。因为 <seg> 标记是在几何之后生成的,并可以访问早期融合的视觉上下文,我们可以避免在基于解码器的实例分割训练中常见的单独的掩码查询机制和匈牙利匹配。
现有的引用表达基准(如 RefCOCO)已饱和 —— 模型例行达到 90%+ —— 并且它们混淆了问题所在。模型失败是因为它不能读取文本?不能理解空间关系?不能处理人群?
我们引入 PBench,这是一个诊断基准,按所需的主导能力分离样本:
每个样本针对一种主导能力:OCR 提示避免空间限定符,空间提示避免图像内文本歧义器。这产生了能力配置文件而不是单一不透明的分数,并使决定下一步投资去向(数据、训练课程或训练后)更容易。
与从随机权重训练不同(在我们的消融中对分割不稳定),Falcon Perception 通过多教师蒸馏初始化。两个强大的视觉教师贡献互补信号:
DINOv3 (ViT-H):对分割至关重要的强局部特征
SigLIP2:用于开放词汇理解的语言对齐特征
蒸馏初始化在 ImageNet-1k 上达到 74.25% 零样本精度和在 Pascal VOC 上达到 85.11% 线性探针 mIoU,在感知特定训练之前提供强视觉基础。
我们通过多阶段管道构建训练集:
通过 DINOv3 嵌入对网络抓取的图像进行分层聚类,确保统一的概念覆盖。
VLM 驱动的列表为每个图像生成密集对象描述,按 PBench 复杂性级别分类(60% 基础,40% 高级)。
负样本挖掘产生语义、视觉和细粒度困难负样本以对抗幻觉。
集成共识 —— SAM 3、Qwen3-VL-30B 和 Moondream3 必须同意(IoU > 0.8)才能自动接受。
人工验证 —— 分歧由标注员处理,恢复使自动化系统困惑的困难样本。
我们维护严格的 1:1 正负样本比率。这使存在校准成为一流目标:模型应该可靠地说"缺失",而不仅仅在确信时绘制掩码。
阶段 1 —— 上下文列表(450 GT):模型学习自回归列表场景库存 —— 预测文本表达及其位置。查询之间的完整因果注意力可以学习对象共现("叉子,然后刀子,然后盘子")。这建立了广泛的场景理解。
阶段 2 —— 任务对齐(225 GT):注意力掩码被修改,以便查询无法再相互看到,模拟推理时的独立查询。文本标记的损失被掩码,将梯度信号完全集中在存在分类和定位上。这个阶段从"场景理解"转变为"回答这个具体问题"。
阶段 3 —— 长上下文微调(10 GT):短阶段,掩码限制提高到每个表达 600,学习率最小恒定。这使模型能够适应极端人群密度,同时不会忘记早期能力。
通过消融验证的关键设计选择:
Muon 优化器用于专门头部(相对于 AdamW)—— 在 SA-Co 检测上产生 +4.8 分
实例的光栅顺序(相对于随机/大小)—— 在 SA-Co 上比随机顺序高 +10 分
Gram 特征正则化 —— 防止从蒸馏特征漂移,将分割改进 +1.5 分
跨秩的全局损失归一化 —— 纠正 FSDP 中可变长度打包序列的偏差
在 SA-Co 开放词汇分割基准测试中,Falcon Perception(6 亿参数)取得了 68.0 的 Macro-F1,而 SAM 3 为 62.3;其中,在高度依赖属性(+8.2)、食品与饮料(+12.2)和运动器材(+4.0)几个划分上的提升尤为显著。与此同时,Falcon Perception 在存在性校准方面仍落后于 SAM 3(MCC:0.64 对 0.82),这是目前最明确的改进方向。
下面是一个输出示例——提示词“Falcon”能够生成精确的实例掩码:
Falcon Perception 在指代表达方面也表现出色,能够在视频的每一帧中正确分割出黑色面包胚的汉堡:
早期融合设计在这里展现出了最大的差异:
对于简单对象,差距并不大。随着提示词变得更加组合化——需要基于 OCR 消除歧义、施加空间约束或进行关系绑定——差距会逐渐扩大。
在我们的 PBench Dense 划分中,Falcon Perception(6 亿参数)显著优于通用 VLM 基线(例如,在我们的评估设置中,其得分为 72.6,而 Qwen3-VL-30B 为 8.9),并且在空间和关系层级上达到或超过了 8B 模型。
随着提示词变得更加组合化——需要基于 OCR 消除歧义、施加空间约束、进行关系绑定,或扩展到数百个实例——早期融合的优势在视觉上变得非常明显:
OCR 引导的定位(Level 2): 当区分目标的关键信号是物体上书写的文字时,Falcon Perception 能够正确读取,而 SAM 3 无法加以区分。
空间理解(Level 3): 当提示词指定空间关系时,Falcon Perception 能够构建连贯的二维场景地图。
关系推理(Level 4): 当目标是通过交互关系而非外观定义时,Falcon Perception 能够理解场景图。
密集场景:扩展到数百个实例: 当场景极其拥挤时,自回归接口尤其有用,因为固定查询解码器可能会遇到实际限制。
“168 wine bottles”:Falcon Perception 能够识别标签为“168”的瓶子,而 SAM 3 会高亮所有瓶子。“Honolulu direction sign”:Falcon 能够读取文字,找到正确的标志牌。
“Lower meat skewer on left grill”、“black car to the right of red car at bottom”、“Belgian flag on the left”——Falcon Perception 能够根据空间约束确定正确实例。SAM 3 则会将多个候选对象误判为正例。
“Pastry next to brown round bread”、“person using phone”、“person holding helmet in hand”——Falcon Perception 能够识别参与交互的实例。SAM 3 会高亮该物体类别的所有实例,忽略关系约束。
“Snow goose”、“pigeon”、“colorful canned drinks”——Falcon Perception 能够以自回归方式分割数百个实例。SAM 3 的固定大小解码器在实例数量超过约 200 个后便会耗尽查询 token。
现代 OCR 早已不再局限于从清晰扫描件中提取文本。如今的系统必须在一次处理中应对多栏布局、数学公式、表格、图表和多语言内容。大多数具有竞争力的 OCR VLM 都采用一种熟悉的方案:由视觉编码器向独立的文本解码器提供输入,再加上特定于任务的衔接组件。这些系统确实有效,但往往规模庞大(参数量达到 10 亿至 30 亿以上)。
我们选择了一条不同的路径:复用 Falcon Perception 中相同的早期融合稠密 Transformer,但从头开始训练一个专门用于 OCR、参数量更小的 3 亿参数变体。由此产生了 Falcon OCR——它使用单一骨干网络,在共享参数空间中处理图像块和文本 token,并采用相同的混合注意力掩码(图像 token 使用双向注意力,文本 token 使用因果注意力),通过提示词而非附加模块切换任务。
我们选择从头开始训练(不采用多教师蒸馏),因为 OCR 所需的视觉特征——细粒度字形识别和笔画级区分——与分割任务中有用的对象级特征存在显著差异。从零开始可以让骨干网络自底向上形成针对文本优化的表示。
我们的训练使用了经过精选的英语数据混合,涵盖三项核心任务:通用文档文本解析(数字 PDF、旧扫描件、打字文档)、数学与科学公式识别,以及表格结构识别。该数据混合还包括手写内容、真实场景文本,以及通过渲染 LaTeX 和 HTML 源文件生成的合成样本。训练目标是在结构化文本输出上进行纯粹的下一 token 预测。
训练分为两个阶段:首先是一个较长的预训练阶段,使用恒定学习率,让模型学习涵盖所有元素类型的核心 OCR 能力;随后是一个较短的余弦衰减微调阶段,将学习率逐步退火至接近零。
我们在 olmOCR(针对多样化输入执行二元正确性检查)和 OmniDocBench(针对整页解析采用连续指标)上进行评估。所有对比模型的规模都大得多,和/或使用了专有基础设施。Falcon OCR 仅使用 3 亿参数,便在 olmOCR 上取得 80.3% 的成绩,与排名第一的系统仅相差 1.7 个百分点,并在多栏文档(87.1%)和表格(90.3%)上领先所有模型。在 OmniDocBench 上,其总分达到 88.64,超过 DeepSeek OCR v2、GPT 5.2 和 Mistral OCR 3。
Falcon OCR 仅有 3 亿参数,规模约为 9 亿参数级 OCR VLM 的三分之一,这会直接转化为更高的服务吞吐量。以下数据是在单张 A100-80GB 上使用 vLLM、以高并发方式测得的:
紧凑的模型体积加上 vLLM 集成(连续批处理、PagedAttention、优化的 CUDA 内核),使其适用于需要处理数百万页文档的大规模数字化场景。
更广泛地说,这些结果表明,早期融合的单栈 Transformer 是 OCR 中“视觉编码器加文本解码器”方案的一种可行替代方案。一个骨干网络、一个共享参数空间、一个解码接口,通过更好的数据和训练信号获得提升,而不是构建日益复杂的流水线。我们希望这能推动该方向上的更多研究。
Falcon OCR 能够处理在严苛真实环境下拍摄的图像,应对不同的光照条件、多样化的文本语义(数学公式、结构化表格、手写笔记)和复杂的文档布局,并生成结构化文本输出。
点击下方各类别即可展开。
Falcon OCR 能够从手写文档和真实照片中提取文本,应对多变的光照、方向和内容复杂度。
Falcon OCR 能够准确还原不同格式和复杂程度表格中的单元格内容与结构布局。
Falcon OCR 能够正确转录从简单方程到包含嵌套运算符的多行推导等各种数学表达式。
Falcon OCR 从包含多栏布局、图表和脚注的文档中提取文本时,能够保留阅读顺序和结构保真度。
本次发布包含一套基于 PyTorch FlexAttention 构建的推理栈,可以方便地表达自定义注意力模式,并高效地为打包后的可变长度序列提供服务。
在我们的 H100 环境中,典型延迟约为:prefill 约 100ms,上采样约 200ms(若命中缓存则为 0ms),少量实例的解码约 50ms。(这些数据取决于分辨率、序列长度和预测实例数量。)
对于 Falcon-OCR 模型,我们还提供了用于快速部署的 vLLM Docker 服务器,以及面向 Apple Silicon 的 MLX 集成。
详情请查看 GitHub 仓库。
Falcon Perception 有意保持极简:一个骨干网络、一个目标函数族,仅在输出连续且稠密时使用小型头部。其基本假设是,大多数收益应来自数据、计算和训练信号,而不是不断向流水线中添加专用模块。
该架构不会阻碍任何显而易见的扩展路径:加入更多图像和更难的提示词以获得更好的定位能力,混入纯文本数据以获得更好的语言能力,增加上下文长度以处理更密集的场景。它始终只是一个序列模型。
Falcon Perception 由阿联酋阿布扎比技术创新研究院(TII)的 Falcon Vision Team 开发。
如果你使用 Falcon-Perception,请引用
@article{bevli2026falcon,
title = {Falcon Perception},
author = {Bevli, Aviraj and Chaybouti, Sofian and Dahou, Yasser and Hacid, Hakim and Huynh, Ngoc Dung and Le Khac, Phuc H. and Narayan, Sanath and Para, Wamiq Reyaz and Singh, Ankit},
journal = {arXiv preprint arXiv:2603.27365},
year = {2026},
url = {https://arxiv.org/abs/2603.27365}
}
本文提及的模型 2
本文提及的数据集 1
该作者的更多文章
QIMMA قِمّة ⛰:质量优先的阿拉伯语 LLM 排行榜
Alyah ⭐️:迈向对阿拉伯语 LLM 阿联酋方言能力的稳健评估
非常酷的发布!很快就会基于它进行开发 🤗
很棒的文章,谢谢!
· 注册或登录后发表评论
本文提及的模型 2
本文提及的数据集 1