开源双向编码器 LFM2.5(230M/350M 版本),支持 8K token 上下文,GLUE 基准性能突出。适用于 NLP 和向量搜索场景。
人工智能
Liquid AI 发布了两款开放权重的双向 Encoder:LFM2.5-Encoder-230M 和 LFM2.5-Encoder-350M。二者都是基于 LFM2 混合骨干架构构建的掩码语言模型,均支持 8,192 token 的上下文长度。
Encoder 是分类器、意图路由器、安全过滤器和个人身份信息(PII)检测器等系统的底层基础。这些任务通常需要持续运行,大多没有 GPU 可用,而且要处理的输入也越来越长。BERT 开创了这一模型类别,ModernBERT 则进一步提升了准确率、速度和上下文长度。Liquid AI 认为,LFM2 架构延续了这条演进路线,因为随着输入长度增加,它的计算成本增长得更慢。
这些 Encoder 并非从零开始训练。它们分别使用 LFM2.5-230M 和 LFM2.5-350M 的 Decoder 骨干进行初始化,然后通过三项改动完成转换:
第一,将因果注意力掩码替换为双向注意力掩码,让每个 token 都能关注其左右两侧的内容。
第二,通过对称居中填充,将 LFM2 的短卷积改为非因果卷积,使每个 token 的卷积运算都能融合左右两侧的相邻 token。
第三,采用掩码语言建模目标进行训练,mask rate 为 30%。这高于 BERT 的 15%;Liquid AI 引用的研究证据表明,在这一模型规模下,更高的 mask rate 能带来更好的效果。
训练分为两个阶段:
第一阶段在大规模 Web 语料库上,以 1,024 token 的短上下文 MLM 目标建立通用语言能力。
第二阶段使用完整的数据混合,将上下文扩展至 8,192 token,并增强模型在事实、法律和多语言方面的能力。
在架构上,该骨干网络交替使用带门控的短卷积模块和分组查询注意力(grouped-query attention),与 LFM2 技术报告中描述的设计相同。两个 checkpoint 的隐藏层大小均为 1024,词表大小为 65,536 token,并支持 15 种语言。其许可证为 LFM Open License v1.0。
下方嵌入内容详细拆解了模型转换过程、完整排名表、各任务得分以及 CPU 延迟数据。
Liquid AI 从 GLUE、SuperGLUE 和多语言分类基准中选取了 17 项任务,对 14 个模型进行了评测。每个模型都会针对每项任务进行完整 fine-tuning,报告的分数就是 fine-tuning 后模型的实际结果。
LFM2.5-Encoder-350M 在 17 项任务上的平均得分为 81.02(±1.00),排名第四。排在它前面的三个模型规模都更大,分别是 3.5B 参数的 XLM-R XL(83.06)、395M 参数的 ModernBERT-large(81.68)以及 560M 参数的 XLM-R large(81.34)。排名第一的模型参数量接近它的 10 倍。
LFM2.5-Encoder-230M 得分为 79.29(±1.02),排名第六。它超过了得分 78.19 的 ModernBERT-base,以及表格中的所有 EuroBERT 模型,包括 EuroBERT-610M(75.87)和 EuroBERT-2.1B(72.19)。两款新 Encoder 的得分也都高于 Liquid AI 自家的检索模型:LFM2.5-ColBERT-350M(76.18)和 LFM2.5-Embedding-350M(75.68)。Liquid AI 表示,这一性能差距正是其选择构建通用 Encoder、而不是复用检索模型的原因。
更值得关注的是评测方法,而且这套方法已采用 Apache-2.0 许可证开源。所有模型均使用 fp32 主权重和 bf16 autocast 加载,从而确保表格比较的是模型本身,而不是不同数值格式带来的差异。所有模型都采用相同的 AdamW 配置,该配置取自 EuroBERT model card。每个模型在每项任务上的学习率,都会从 10 个候选学习率和 3 个随机种子的组合中进行选择。随后,再使用 5 个从未参与参数选择的全新随机种子运行,并报告平均得分。transformers 版本固定为 4.56.2,避免依赖版本漂移成为不可控变量。
此次发布列出了三类应用场景。首先是边缘设备和嵌入式设备。汽车的车载计算平台或工业控制器没有空闲 GPU,也无法承受与云端往返通信的开销。其次是金融、医疗和法律领域中受监管的本地部署系统,这些系统处理的文档篇幅长、敏感度高,不能离开内部基础设施。最后是大规模、成本敏感的处理流水线,在这类场景中,小型 Encoder 可以作为大型模型之前成本低廉的第一道处理环节。
Liquid AI 还对上下文窗口给出了一个直观的换算:8,192 token 大约相当于 13 至 15 页内容。一次 forward pass 就可以覆盖一整份合同或一份完整的患者病历。
为了展示 fine-tuning 后的 Encoder 能做什么,研究团队发布了五个 Demo,每个 Demo 都运行在仅使用 CPU 的 Hugging Face Space 中。它们涵盖 zero-shot prompt 路由、zero-shot 策略检查和拼写检查。其中一个 PII 检测器可以处理 16 种语言中的 40 类信息。另有一个额外的掩码扩散 Demo,将 Encoder 作为聊天机器人运行,通过迭代解除掩码的方式生成内容。
两款 Encoder 都可以通过 transformers 加载。模型主体以 Lfm2BidirectionalModel 的形式提供,掩码语言模型则使用 Lfm2BidirectionalForMaskedLM 加载。二者都通过 auto_map 完成接入,因此每次加载调用都必须设置 trust_remote_code=True。
基础 Encoder 生成的是通用表示,而不是具体任务的输出,因此必须进行 fine-tuning。Liquid AI 的 fine-tuning 教程演示了如何在 8k 上下文配置下处理长篇法律文档。模型选择建议也很直接:最看重准确率时选择 350M;硬件资源更紧张或需要更高吞吐量时选择 230M。
Liquid AI 发布了 LFM2.5-Encoder-230M 和 LFM2.5-Encoder-350M,它们是支持 8,192 token 上下文的开放权重双向 Encoder。
二者通过双向掩码、非因果短卷积和 30% MLM,将 LFM2.5 Decoder 转换为 Encoder。
LFM2.5-Encoder-350M 在 14 个模型中以 81.02 的得分排名第四,排在它前面的三个模型规模都更大。
在 CPU 上处理 8K token 时,230M 模型完成一次 forward pass 约需 28 秒,而 ModernBERT-base 则需要 90 多秒。
你可以查看 Liquid AI 的博客文章、Hugging Face 介绍文章,以及 LFM2.5-Encoder-230M 和 LFM2.5-Encoder-350M 的 model card。
Asif Razzaq 是 Marktechpost Media Inc. 的 CEO。作为一位富有远见的创业者和工程师,Asif 致力于发掘人工智能造福社会的潜力。他最近推出了人工智能媒体平台 Marktechpost。该平台凭借对机器学习和深度学习新闻的深入报道脱颖而出,其内容既具备扎实的技术基础,又能让广大读者轻松理解。该平台每月浏览量超过 200 万,充分体现了它在读者群体中的受欢迎程度。