Knowledgator开源GLiFormer,575M参数在嵌套JSON提取任务上达91.10 F1,逼近GPT-5.6-luna的91.96,且不生成Token。
Knowledgator 工程团队发布了 GLiFormer,这是一个用于信息抽取的 schema-conditioned 编码器框架。一个模型可以处理命名实体识别(NER)、文本分类、关系抽取、嵌套 JSON 结构化以及文本向量。你在推理时传入标签和抽取 schema。Hugging Face 上有两个检查点。GLiFormer Base v1 有 264.2M 参数,GLiFormer Large v1 有 575.6M。
现在就能部署吗?能。两个检查点均采用 Apache 2.0 协议,可通过 pip install gliformer 安装,支持 CPU 或 GPU 运行。
当前的抽取流程通常是串联多个独立模型:一个标注实体,另一个分类文档,第三个重建记录。研究团队认为这些任务共享一个核心操作——对源文本进行编码,表示所请求的概念,然后对它们的兼容性打分。
LLM 能够输出嵌套 JSON,但它们逐 token 生成字段名、标点和值。GLiFormer 将输出生成从这条路径中移除。
GLiFormer 基于 GLiNER 构建,通过一个「锚点」(anchor)将其标签匹配泛化。锚点是每个运行时标签的评分对象——可以是分类的组向量、关系的实体对,或记录的槽位。
源文本只需编码一次。同一文档的多个 schema 然后作为任务本地的组在该共享编码上运行。头部计算量仍随组数、标签数和锚点数增长。
对于 NER,头部对每个 token 和标签对评分起始、结束和内部证据。独立的 sigmoid 输出使嵌套提及和共享边界可以共存。
结构化分为 4 个阶段:
值是源文本跨度,因此模型不会杜撰输入中不存在的值文本。跨度选择、记录分配和层次结构仍可能出错。
两个 v1 检查点均使用 gliformer-layout 模型类型,配备 5 个头:NER、分类、联合关系、多级结构化和文本向量。每个配置了 12 个词的最大跨度宽度和 100 个记录锚点。完整规格见预训练模型文档。
| 规格 | Base v1 | Large v1 |
|---|---|---|
| 参数量 | 264.2M | 575.6M |
| 编码器层数 | 12 | 24 |
| 嵌入维度 | 768 | 1024 |
| 配置 max_len | 16,384 | 8,192 |
GLiFormer-base 以 DeBERTa 骨干为基础,在 1000 亿 token 上进一步预训练。论文记录了 1,357,671 个样本用于广泛多任务训练,372,090 个样本用于任务聚焦的 post-training。
以下所有分数均由 Knowledgator 报告。
嵌套 JSON(500 个样本):Large 得分 91.10 F1,Base 得分 87.20。GPT-5.6-luna 得分 91.96,GPT-5-mini 得分 82.56。该指标是顺序无关且边界容忍的,而非精确 JSON 匹配。
分类(13 个数据集):Large 达到 75.03 平均 macro-F1,Base 达到 72.36。GLiNER2.5 得分 64.89,而 GPT-5-mini 以 79.79 领先。
CrossNER(5 个领域):Base 平均 65.10 F1,Large 平均 64.35。Gemma-4-31B-IT 达到 70.74。
关系(4 个基准):Large 平均 21.33 micro-F1,Base 平均 18.94。GLiNER-Relex 达到 25.6,Gemma-4-31B-IT 达到 25.08。
在 NER 和分类的综合聚合上,论文报告 Large 以约 14× 更少的参数击败了 Gemma-4-E4B。
Knowledgator 在 40 篇结构化文档上对 GLiFormer-base 进行了计时,批大小为 1。在 NVIDIA RTX PRO 6000 Blackwell GPU(FP16)上,中位延迟为 69 ms。在 8 线程 AMD EPYC 9B45 CPU(FP32)上,为 547 ms。
关键主张「最高快 95.8×」这个数字是分析估算,而非实测 LLM 运行结果。它假设 prefill 速度为每秒 2000 个输入 token,生成速度为每秒 60 个输出 token。估算中排除了排队、网络延迟和隐藏推理,且未假设精度持平。
GitHub 仓库和模型卡片展示了一个简短的结构化调用:
records = model.structure(
"Alice works at Acme.",
{"employee": ["name", "company"]},
)
print(records)
# {'employee': [{'name': 'Alice', 'company': 'Acme'}]}
嵌套 Pydantic schema 可用于多级记录。一次推理调用也可以同时运行实体、类别和结构。使用 joint_relations 处理关系,因为 v1 检查点没有开放关系头。
GLiFormer 在一个编码器上运行 NER、分类、关系、嵌套 JSON 和文本向量。
Large 在结构化任务上达到 91.10 F1,接近 GPT-5.6-luna 的 91.96。
Base 报告 GPU 中位延迟为 69 ms,输出 token 数为零。
关系抽取仍落后于 GLiNER-Relex 和更大的 LLM。
Apache 2.0 权重可通过 pip 安装,支持在 CPU 或 GPU 上自托管。
查看论文、模型权重、GitHub 仓库和文档。该项目所有荣誉归功于研究人员。此外,欢迎在 Twitter 上关注我们,不要忘记加入我们的 15 万+ ML SubReddit 并订阅我们的通讯。等一下!你用 telegram 吗?现在你也可以加入我们的 telegram 群了。
需要与我们合作推广您的 GitHub 仓库或 Hugging Face 页面或产品发布或网络研讨会等?请联系我们
Asif Razzaq 是 Marktechpost AI Media Inc. 的首席执行官。作为一位有远见的企业家和工程师,Asif 致力于利用人工智能的潜力为社会公益服务。他最近的举措是推出了一个人工智能媒体平台 Marktechpost,该平台以深度报道机器学习和深度学习新闻而脱颖而出,内容既有技术深度又易于广大读者理解。该平台每月访问量超过 200 万次,彰显其在受众中的受欢迎程度。