LFM2.5-VL-3B 是一款 3.1B 参数的端侧 VL 模型,在 ScreenSpot-v2 达 80.7 分,支持工具调用,可在 Apple M5 Max 以 228 tokens/s 解码。
昨日,Liquid AI 发布了 LFM2.5-VL-3B。这是一款参数量为 3.1B 的视觉语言模型,专为端侧部署而构建。该模型可读取移动端、Web 端和桌面端的数字屏幕,能够将物体定位到坐标、解析文档和图表,并根据文本或图像输入调用工具。Liquid AI 报告称,该模型在 28 项视觉基准测试中平均得分为 69.4,与 InternVL-3.5-4B 持平,仅落后 Qwen3.5-4B 0.7 分——后两者均为 4.7B 参数模型。该模型为非推理模型,直接给出答案以保持低延迟。它约占 3 GB 内存,在 Apple M5 Max 上解码速度为 228 tokens/s。
是的,模型权重以四种格式发布:native、GGUF、ONNX 和 MLX。发布首日即可在 llama.cpp、MLX、vLLM、SGLang 和 ONNX 上运行。它约占 3 GB 内存。
LFM Open License v1.0 基于 Apache-2.0,只做了一处修改:一旦企业年收入达到 1000 万美元,免费商业使用即终止。因此,低于该门槛的个人开发者、初创公司和中小企业可以免费商业发布。超过该门槛的企业须与 Liquid AI 协商商业许可。研究、教育和非营利使用不受年收入限制。
消费电子、汽车、工业与机器人技术、金融服务、医疗健康和电子商务。还包括 QA 和 RPA 供应商,专注于 GUI 自动化。
端侧屏幕 Agent、GUI 测试自动化、带布局标签的 PDF 转结构化文本、发票和收据 OCR、车辆内近实时目标检测、菜单和路标的离线翻译,以及多图像对比。
LFM2.5-VL-3B 从四个维度对 LFM2-VL-3B 进行了扩展。
该模型在 ScreenSpot-v2 上平均得分为 80.7,其中桌面端 78.7、移动端 81.2、Web 端 82.2。Liquid AI 报告 Gemma-4-E4B 为 51.2、Qwen3.5-4B 为 78.5,而更大的 InternVL-3.5-4B 以 84.1 领先。
这是 VL 系列的新增能力。ToolSandbox 从 26.4 提升至 59.5。BFCL v4 从 20.5 提升至 32.5。工具调用以 Pythonic 调用形式输出在 <|tool_call_start|> 和 <|tool_call_end|> token 之间。
RefCOCO-avg 精确率@1 从 57.1 提升至 87.9,增幅达 30 点,主要得益于规模化的合成定位数据。
BLINK 从 50.2 提升至 61.5,MuirBench 从 34.9 提升至 58.3。
语言骨干是 LFM2.5-2.6B。视觉塔是 SigLIP2 NaFlex 形状优化的 400M 编码器。NaFlex 通过将大图分割成不重叠的 512×512 patches 加上一个缩放后的整图缩略图来处理原生分辨率。上下文长度为 32,768 tokens,支持 16 种语言。
预训练使用了约 34T tokens。词表通过就地扩展现有 tokenizer 扩大到 128K,这改善了非拉丁字母体系的覆盖率。视觉预训练在 token 规模上扩大了 4 倍,使用了精选和合成的 caption、OCR、定位和指令遵循数据。
后训练采用 SFT,并从更大的教师模型进行知识蒸馏,以及 Antidoom 训练,随后进行多奖励强化学习。
该模型为非推理设计,直接给出答案,这是其低延迟特性背后的设计选择。
Liquid AI 使用 vLLM 0.26.0(推理模式)评估了 28 项视觉基准测试。LFM2.5-VL-3B 平均得分为 69.4,与 InternVL-3.5-4B(69.4)持平,仅落后 Qwen3.5-4B(70.1)0.7 分。两个对比模型均为 4.7B 参数。
值得关注的单项成绩:RealWorldQA 73.1(InternVL-3.5-4B 为 67.7)、TextVQA 84.3(Qwen3.5-4B 为 81.2)、MMStar 63.3、MathVista-mini 68.5、ChartQA 81.3、DocVQA 91.1、OCRBench v1 84.2。CountBenchQA 从上一版本的 92.2 退步至 87.3。
纯文本评估方面,IFEval 达到 82.3,高于之前的 72.9。Gemma-4-E4B 在该指标上仍以 87.9 领先。