新型视觉语言模型架构结合LFM技术,在保持精度的同时显著提升推理速度。
更快的推理:设备端 decode 加速最高 3.13 倍,H100 上最高 2.66 倍;端到端加速分别最高 2.62 倍和 2.27 倍。
极低的内存代价:drafter 仅增加 2.8 亿参数,在 3B 目标模型基础上仅增加 8.9%。
发布即支持:LFM 兼容的 DSpark 集成,首日即支持 llama.cpp、MLX-VLM 和 SGLang。
视觉 drafter 与文本 LFM2.5-DSpark drafter 使用相同的架构:它在固定的 tap 层集合处捕获目标模型的隐藏状态,并以此为条件来草拟 k 个候选 token 块。图像 patches 和文本 token 在经过这些层之前会被投影到同一个共享表示空间中,因此 drafter 操作的隐藏状态向量维度与输入模态无关。推理算法因此与文本模型完全一致。

我们遵循 DSpark 配方,使用视觉语言 SFT 数据混合集进行训练,权重向预期服务的工作负载倾斜。在 3、4、5 层的消融实验基础上,draft 模型简化为仅含注意力的 drafter,包含 4 层,block size 为 9。我们在最终混合数据上跑了 10 个 epoch,并在每个 epoch 后测量接受率——随着训练 token 增加,接受率持续提升,直至边际收益递减。推理时,我们建议根据硬件不同选择 block size 为 8 或 9。
最终 drafter 约有 2.8 亿参数,仅使已部署模型的参数总量增加 8.9%。
LFM2.5-VL-3B 的 DSpark draft 模型首日即支持 llama.cpp、MLX-VLM 和 SGLang。
我们在设备端推理和 GPU 推理两种配置下分别测量。两套配置均使用 DSpark block size 为 8,在六项多样化的视觉任务上进行评估,涵盖通用 VQA、文本 VQA、图像描述、图表 VQA、复杂推理和多轮对话,遵循 MMSpec 基准。
设备端推理。 在 M5 Max 上使用 MLX,decode 速度提升 2.30 倍至 3.13 倍;端到端延迟改善 1.56 倍至 2.62 倍。在 M3 Ultra 上使用 llama.cpp,decode 改善 1.57 倍至 2.14 倍,端到端改善 1.30 倍至 1.77 倍。

GPU 推理。 在 H100 上,同一 drafter 带来 2.04 倍至 2.66 倍的 decode 加速,端到端改善 1.64 倍至 2.27 倍。

在 LLM 中,prefill 阶段主要由计算驱动,其成本随 prompt 长度呈(亚)二次增长。VLM 在此基础上更进一步,因为图像首先需要经过视觉编码器处理,然后语言主干网还要处理数百个视觉 token 以及文本 prompt。边缘设备的算力远不及数据中心 GPU,因此 prefill 在端到端延迟中占比更大,MMSpec 基准在 Apple 芯片和 H100 上测得的首 token 时间与 decode 测量结果均说明了这一点。(M5 的每核 GPU 神经加速器缩小了这一差距)。
推测解码只能加速 decode 阶段,无法加速视觉编码或 prefill 阶段。当这些阶段已经占据了大部分墙上时间时,即使 decode 加速幅度很大,端到端收益也仅是温和的。这正是阿姆达尔定律(Amdahl's law)的体现——整体加速比受限于工作负载中未被加速的那部分。
在 SGLang 中运行 DSpark draft 模型,需要使用带有 LFM2 目标 DSpark 支持的 SGLang 构建版本(PR #40651)。启动 target 并附加 draft:
python -m sglang.launch_server \
--model-path LiquidAI/LFM2.5-VL-3B \
--speculative-algorithm DSPARK \
--speculative-draft-model-path LiquidAI/LFM2.5-VL-3B-DSpark \
--speculative-draft-attention-backend flashinfer \
--speculative-dspark-block-size 9 \
--disable-radix-cache
然后向 http://localhost:30000/v1 的 OpenAI 兼容端点发送请求。Block size 从 draft 的 config.json 中读取;基线对比使用相同命令但不加这三个 --speculative-* 参数。
在 llama.cpp 中运行需要对应的 llama.cpp 构建版本(PR#29339)。
llama-server -m models/LFM2.5-VL-3B-F16.gguf \
--mmproj models/mmproj-LFM2.5-VL-3B-F16.gguf \
-md LFM2.5-2.6B-DSpark-F16.gguf \
--spec-type draft-dspark --spec-draft-n-max 8 --spec-draft-n-min 0 \
-fa on -ngl 99 -c 8192
在 MLX-VLM 中运行需要对应的构建版本(PR#2280)。
mlx_vlm.server --model LiquidAI/LFM2.5-VL-3B --draft-model LiquidAI/LFM2.5-VL-3B-DSpark
Block size 从 sidecar 元数据中读取(n-max 被钳位到该值)。推测解码是精确的:target 会验证每一个提议的 token,因此贪婪输出的结果与单独使用 target 完全一致;每个响应的时序数据会报告 draft_n / draft_n_accepted。
我们的视觉 DSpark draft 模型已在 Hugging Face 上发布,提供 Safetensors 和 GGUF 两种格式。
借助 LFM2.5,我们正在兑现「让 AI 随地运行」的愿景。这些模型的特性:
开源权重 — 无限制地下载、微调和部署。
发布即高速 — 首日即支持 llama.cpp、MLX 和 SGLang。
完整模型家族 — 从用于定制的基座模型到专门的音频和视觉变体,一个架构覆盖多样化使用场景。
期待看到你们用它构建出的产品。
如需引用,请使用以下参考文献或 BibTeX:Liquid AI, "LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond", Liquid AI Blog, Sep 2026.
@article{liquidAI2026vldspark,
author = {Liquid AI},
title = {LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond},
journal = {Liquid AI Blog},
year = {2026},
note = {www.liquid.ai/blog/lfm2-5-vl-dspark},
}