专为边缘设备优化的视觉语言模型,以更小参数量实现边缘端SOTA性能,支持快速推理。
LFM2.5-VL-3B 在四个主要方面提升了之前版本的视觉-语言能力:
屏幕/UI 理解:跨设备数字屏幕的强大理解能力。
视觉定位:通过自然语言查询改进了定位和目标检测能力。
多图输入:跨多张图像的推理能力得到提升。
Function Calling:无论纯文本还是视觉-文本场景下,Function Calling 能力显著增强。

LFM2.5-VL-3B 搭配了 SigLIP2 400M NaFlex 视觉编码器和与 LFM2.5-2.6B 文本模型相同的预训练骨干网络。模型在约 34T tokens 上进行预训练,其中视觉数据量是之前的 4 倍,来源于精心筛选和合成图像描述、OCR、视觉定位以及指令遵循数据集。为支持非拉丁文字体系,我们通过原地扩展分词器而非从头训练,将词表扩大至 128K。
后训练分为两个阶段:第一阶段是监督微调(SFT),包含来自更大教师模型的知识蒸馏以及 Antidoom 训练。第二阶段是多奖励强化学习(RL)。
我们在视觉和文本基准上对 LFM2.5-VL-3B 进行了评估。
视觉基准涵盖多语言视觉理解、指令遵循、视觉数学与科学推理、文档理解、目标检测、多图理解以及屏幕理解。LFM2.5-VL-3B 在实际图像任务上领先同规模级别模型,同时在阅读数字内容方面表现出色——无论是文档、图表还是屏幕上的 UI 元素。
*表中所有数值均归一化至 0–100。评估使用 vLLM 0.26.0,并采用各模型推荐的生成参数(如有)。所有评估均使用非推理模式,并指示模型直接回答而不进行推理。
我们还在纯文本基准上对 LFM2.5-VL-3B 进行了评估,涵盖指令遵循和工具使用。指令遵循能力全面提升,工具使用能力则大幅跃升。在工具使用方面,LFM2.5-VL-3B 与 Gemma-4-E2B 和 Qwen3.5-2B 持平。
*InternVL 3.5 模型不支持 Function Calling。
这些结果表明,LFM2.5-VL-3B 是一个强大、通用的视觉-语言模型。它覆盖日常任务(图像描述、视觉问答、文档理解),尤其擅长定位物体、阅读屏幕和文档,以及调用工具。
LFM2.5-VL-3B 在发布首日即获得整个推理生态的支持,包括 llama.cpp、MLX、vLLM、SGLang 和 ONNX。
端侧推理。LFM2.5-VL-3B 在 M5 Max 上可达 228 tokens/s,在 Ryzen AI Max+ 395 上可达 116 tokens/s,内存占用约 3 GB。它甚至在 Galaxy S26 Ultra 上达到 20 tokens/s,因此可以完全在端侧运行。

GPU 推理。LFM2.5-VL-3B 保持稳定的低延迟,是多帧输入场景下速度最快的模型。

LFM2.5-VL-3B 也是我们测试的所有模型中输出吞吐量最高的,在高并发下达到约 11K tokens/s。这大约是更大 4B 级别模型的 2 倍,甚至领先于更小的 2B 级别模型——在单块 H100 上一天可输出近 10 亿 tokens。

当你需要端侧智能来处理大规模工作负载时,选择 LFM2.5-VL-3B。
安装最新版本的 transformers(兼容 transformers>=5.0.0):
%pip install -q torch torchvision accelerate "transformers>=5.10.1"
然后加载并运行模型:
import torch
from transformers.image_utils import load_image
from transformers import AutoModelForImageTextToText, AutoProcessor
from IPython.display import display
MODEL_ID = "LiquidAI/LFM2.5-VL-3B"
processor = AutoProcessor.from_pretrained(MODEL_ID)
model = AutoModelForImageTextToText.from_pretrained(
MODEL_ID,
device_map="auto",
dtype="bfloat16",
)
img_url = "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/coco_sample.png"
input_image = load_image(img_url)
display(input_image)
messages = [
{
"role": "user",
"content": [
{"type": "image", "image": input_image},
{"type": "text", "text": "Describe this image in two concise sentences."},
],
}
]
inputs = processor.apply_chat_template(
messages,
add_generation_prompt=True,
tokenize=True,
return_dict=True,
return_tensors="pt",
).to(model.device)
with torch.inference_mode():
outputs = model.generate(
**inputs,
do_sample=True,
temperature=0.2,
top_k=50,
repetition_penalty=1.0,
max_new_tokens=256,
)
output = processor.batch_decode(outputs[:, inputs["input_ids"].shape[1]:], skip_special_tokens=True)[0]
print(output)

Two cats are sleeping on a pink couch with two remote controls.
你可以在我们的文档中找到更多关于多图输入、视觉定位、OCR、工具调用等场景的 LFM2.5-VL-3B 实用示例。查看我们的发布博客了解视频示例。
体验这个浏览器 demo,LFM2.5-VL-3B 为具备视觉能力的聊天界面提供支持。它允许你拍摄或上传多张图像,并让模型与它们交互,包括视觉定位、OCR 和工具调用。
LFM2.5-VL-3B 现已在 Hugging Face 上发布。
借助 LFM2.5,我们正在实现"AI 随处运行"的愿景。这些模型的特点是:
下载:Hugging Face 上的 LFM2.5-VL-3B。
体验:在浏览器中运行 WebGPU demo,无需任何配置。
微调:参考我们的微调教程,将 LFM2.5-VL-3B 适配到你的任务中。
期待看到你们的作品。
请引用本文:
Liquid AI, "LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge", Liquid AI Blog, Aug 2026.
或使用 BibTeX 引用:
@article{liquidAI2026VL3B,
author = {Liquid AI},
title = {LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge},
journal = {Liquid AI Blog},
year = {2026},
note = {www.liquid.ai/blog/lfm2-5-vl-3b},
}