Liquid AI推出279.5M参数的draft模型,为其视觉语言模型提供推测解码能力,在M5 Max上加速3.13倍、H100上2.66倍,已集成进llama.cpp、MLX-VLM和SGLang。
Liquid AI 发布了 LFM2.5-VL-3B-DSpark,这是一款用于 LFM2.5-VL-3B 视觉语言模型的实验性推测解码草稿模型。草稿模型增加了约 2.8 亿参数,在不改变模型输出的前提下加速解码。Liquid AI 团队报告,在 Apple 芯片上解码速度提升最高 3.13 倍,在 NVIDIA H100 上提升最高 2.66 倍。
可以。权重已在 Hugging Face 上以 Safetensors 和 GGUF 格式发布,SGLang、MLX-VLM 和 llama.cpp 在发布首日即提供支持。Liquid AI 团队将此版本标记为实验性,并采用 LFM Open License v1.0 授权,允许年营收不足 1000 万美元的公司免费商用。
标准模型每次前向传播只生成一个 token。推测解码增加一个小型草稿模型,提前预测若干个 token,然后由大型目标模型一次性验证整批 token,保留其认可的部分。
DSpark 遵循 Liquid AI 文本模型 DSpark 草稿模型的配方,详见 DSpark 论文。草稿模型从目标模型的多个层读取隐藏状态,预测接下来的 k 个 token。
关键设计点:模态对草稿模型无关紧要。当 token 到达隐藏层时,文本和图像 patch 都只是张量。因此 Liquid AI 团队将其视觉语言模型复用完全相同的推理算法。
草稿模型是一个简化的纯注意力模型。消融实验选定 4 层、block 大小为 9。推理时 Liquid AI 推荐根据硬件选择 block 大小 8 或 9,Apple 芯片使用 8。
| 组件 | 参数量 |
|---|---|
| 解码器堆栈(4 层) | 193.0M |
| 隐藏状态投影 | 21.0M |
| Markov 头 | 65.5M |
| Norm + 置信度头 | 6.4k |
| 总计 | 279.5M |
embedding 和 LM head 与目标模型共享权重,因此草稿模型不携带这些部分。Liquid AI 表示这使部署的参数量增加了 8.9%。训练使用了覆盖常见视觉语言任务的监督微调数据,共 10 个 epoch。所有消融实验和训练均完全在 AMD 硬件上运行。
评估遵循 MMSpec 基准,覆盖 6 类任务:通用 VQA、Text VQA、图像描述、Chart VQA、复杂推理和多轮对话。所有实验均使用 batch size 1、temperature 0、视觉编码器和骨干网络 16 位权重。数据采集自 Pipette——Liquid AI 的公开设备基准测试基础设施。
| 部署栈 | 解码加速 | 端到端加速 | 每轮接受 token 数 |
|---|---|---|---|
| MLX-VLM,M5 Max MacBook Pro(block 8) | 2.30x 至 3.13x | 1.56x 至 2.62x | 3.24 至 4.34 |
| llama.cpp,M3 Ultra(block 8) | 1.57x 至 2.14x | 1.30x 至 1.77x | 3.31 至 4.50 |
| SGLang,1× H100 80GB(block 9) | 2.04x 至 2.66x | 1.64x 至 2.27x | 3.46 至 4.57 |
"最高"解码和端到端数据往往来自不同任务。在 M5 Max 上,3.13 倍解码来自 COCO Captioning,而 2.62 倍端到端来自 MMMU-Pro。
在 Apple 芯片栈上,接受率落在相近区间。Liquid AI 将此解读为:接受率取决于草稿模型和工作负载,而非运行时。
在更高并发下,DSpark 在单卡 H100 的 SGLang 测试中保持吞吐量优势。并发越高,差距越小。
在贪婪解码下,目标模型验证每个提议的 token,因此输出与基础模型完全一致。在非零 temperature 下配合匹配采样时,推测解码保留目标的输出分布,Leviathan 等人已证明。
Temperature 影响速度。温度越高,概率越分散到更多候选 token 上,草稿模型和目标模型的分歧越多。Liquid AI 的测试中,这降低了接受率和吞吐量。
推测解码仅加速解码。图像编码和 prefill 速度不变。VLM 必须先编码图像,然后处理数百个视觉 token 和 prompt 的结合。
在边缘设备上,算力弱于数据中心 GPU,prefill 占延迟的比例更大。Liquid AI 将此解释为阿姆达尔定律:总加速受限于未被加速的部分。这解释了 M5 Max 上 TextVQA 等案例——解码快 2.69 倍,端到端只有 1.56 倍。
SGLang 需要 v0.5.19 或更高版本。用 --speculative-algorithm DSPARK 启动 LFM2.5-VL-3B,用 --speculative-draft-model-path 指向草稿模型路径。在 Apple 芯片上,MLX-VLM v0.7.2 或更新版本通过 --draft-model 接受草稿模型。MLX-VLM 中的 DSpark 当前仅支持贪婪采样,需将 temperature 设为 0。对于 llama.cpp,将 GGUF 草稿模型与 LFM2.5-VL-3B-GGUF 目标模型配对使用。
集成工作在 llama.cpp、SGLang 和 MLX-VLM 的 pull request 中公开。量化模型加速不在本次发布范围内。