NeoMME系列包含260M和800M参数双向编码器,在单一Transformer内同时处理多语言文本和原始图像块,无需预训练视觉塔和因果解码器。
当前生产环境中大多数视觉文档检索器都是"继承"来的。ColPali 及其后续模型的做法是从一个生成式视觉-语言模型出发,将其改造成编码器使用。但这样出来的模型仍然带着一个独立预训练的视觉塔(vision tower)和一个从不生成 token 的因果解码器(causal decoder)。对于只需要表示(representation)的任务来说,这是参数和算力的浪费。
H 公司发布了 NeoMME,这是一个包含 260M 和 800M 两种规格的双向编码器家族,两个组件统统不要了。一个 Transformer 统一处理多语言文本 token 和原始 32×32 RGB 图像块,从随机初始化开始训练。在 260M 参数规模下,检索微调版本 NeoMME-Retriever 在 ViDoRe v3 上达到了 0.523 nDCG@10。
能部署吗?能。每个 checkpoint 均以 Apache 2.0 许可证发布,Hugging Face Transformers 提供零日支持。260M 模型在单张 NVIDIA L40S 上每秒索引 51.3 页,在纯 CPU 主机上编码一条查询只需 78.3 ms。
https://arxiv.org/pdf/2609.01657

文本通过 ALBERT 风格的分治嵌入(factorized embedding)进入:256 维查找表投影到模型宽度。图像被切分为不重叠的 32×32 图像块,由一个从头训练的 2 层 MLP 投影。没有块合并模块(patch-merging module),没有 SigLIP2 视觉塔。
两个模型均支持 16,384 token 的上下文长度,经分块后足够容纳两张标准 3,840×2,160 4K UHD 图像。大多数层使用对称滑动窗口注意力;每隔六层以及最后一层做全局注意力。模型栈使用分组查询注意力(grouped-query attention)、查询-键归一化(query-key normalization)、门控注意力(gated attention)、二维旋转位置嵌入(2D RoPE)以及平方 ReLU MLP。精确参数量为 262,937,906 和 793,715,032。
分词器是空格无约束的 BPE,词汇表 131,072 条目,从头训练。在 FLORES-200 devtest 的 14 种目标语言上,它生成的 token 数量比 ModernBERT 少 44.4%。
预训练采用离散掩码扩散处理文本,可选地以可见图像块为条件。纯文段落从 0 到 1 均匀采样腐败率。多模态段落从 0.30 到 1 采样,这一设置消除了语言捷径(language-only shortcut),强制模型阅读页面。
跨模态消融探针证实了这一设计有效。在 90% 掩码率下,可见页面块使 260M 模型的掩码 token 准确率提升了 38.4 个点,800M 模型提升了 40.5 个点。每次运行处理约 5,240 亿个打包输入 token,其中约 2,900 亿为纯文本,分别在 16 张和 32 张 H100 加速卡上完成。
NeoMME-Retriever 在共享backbone 上新增两个联合训练的预测头:一个带 Matryoshka 宽度的平均池化稠密头,以及一个将每个 token 和图像块投影到 128 维的晚期交互头(late-interaction head)。一次前向传播同时返回两者。
在 ViDoRe v3 上,260M 模型得 0.523 nDCG@10,800M 模型得 0.556。260M 模型的结果与 3.75B 参数的 ColQwen2.5-v0.2 仅差 0.002,比其他 300M 以下最佳模型高 26.1 个点。800M 模型比同量级的 Vultron Retriever Flash 低 0.9 个点。在 ViDoRe v1 和 v2 上,两个模型分别达到 0.860/0.522 和 0.874/0.559 nDCG@5。
纯文本检索能力偏弱。在 BEIR-15 上,晚期交互分别达到 0.4881 和 0.5126,而 149M 参数的 LateOn 为 0.5722。作者将此部分归因于监督规模:NeoMME 约见过 43 万条文本查询样本,而 mLateOn 约见过 6.6 亿条对比样本。
晚期交互索引代价高昂。一张 2048×2048 的页面产生 4,162 个向量,在 ViDoRe v3 文档中约合 1.5 MB(float32)。两种方法可以压缩之。层级 token 池化(因子 10)配合 int8 查询和文档,每页 39.0 kB,体积缩小 39.4 倍,仍保留 99.16% 的基线 nDCG@10。池化因子 8 配合 int8 查询和二元文档,每页仅 6.0 kB,缩小 255.5 倍,保留 95.19%。
就向量数量而言,索引速度很快。在相同 2048×2048 输入条件下,NeoMME-260M 在一张 L40S 上每秒编码 51.3 页,而 ColModernVBERT 为 26.0,差距 1.97 倍。
一个双向 Transformer 统一处理文本和原始图像块,无视觉塔,无解码器。
NeoMME-Retriever-260M 在 ViDoRe v3 上得 0.523 nDCG@10,击败所有参数量低于 800M 的评估模型。
在 ViDoRe v3 上与 3.75B 参数的 ColQwen2.5 持平,体积却小 14.4 倍。
Token 池化配合非对称量化,将每页索引从约 1.5 MB 压缩至 6 kB。
纯文本检索和冻结自然图像迁移仍是明显短板。
Check out the Paper, Model Collection and Demo. Also, feel free to follow us on Twitter and don't forget to join our 150k+ ML SubReddit and Subscribe to our Newsletter. Wait! are you on telegram? now you can join us on telegram as well.
Need to partner with us for promoting your GitHub Repo OR Hugging Face Page OR Product Release OR Webinar etc.? Connect with us
Asif Razzaq is the CEO of Marktechpost Media Inc.. As a visionary entrepreneur and engineer, Asif is committed to harnessing the potential of Artificial Intelligence for social good. His most recent endeavor is the launch of an Artificial Intelligence Media Platform, Marktechpost, which stands out for its in-depth coverage of machine learning and deep learning news that is both technically sound and easily understandable by a wide audience. The platform boasts of over 2 million monthly views, illustrating its popularity among audiences.