Hugging Face 发布基于量化感知蒸馏(LFM2.5 Q4_0)训练的模型检查点,可用于模型压缩与端侧部署场景。
采用量化感知蒸馏(QAD)训练:将高精度教师模型蒸馏为量化学生模型
与原生 Q4_0 相同的内存和速度:保持 Q4_0 GGUF 的低内存占用和高吞吐
恢复率:因量化而损失的 BF16 平均准确率中恢复了 97%
对于全部四个模型,我们将其发布的、采用后训练量化(PTQ)生成的 GGUF 与训练得到的 QAD Q4_0 检查点,在一套覆盖推理、指令遵循、工具使用和代理能力的基准测试上进行了对比:GPQA Diamond、MMLU-Pro、IFEval、IFBench、Multi-IF 和 BFCLv4。BF16 GGUF 作为格式内上限基准。我们还加入了一项规模适配的数学评测:LFM2.5-230M 和 LFM2.5-350M 使用 GSM8K,LFM2.5-1.2B-Instruct 和 LFM2.5-2.6B 使用 AIME25。报告结果为五次重复的平均值。

在全部四个模型上,QAD 均显著改善了 Q4_0 检查点。QAD 检查点分别保留了各自 BF16 基线性能的 97.1%、96.5%、97.4% 和 96.6%。
真实边缘硬件上的速度与体积
我们测量了四个模型 LFM2.5-230M、LFM2.5-350M、LFM2.5-1.2B-Instruct 和 LFM2.5-2.6B 在四个目标设备上的解码吞吐:MacBook Pro、NucBox EVO-X2、三星 Galaxy S26 Ultra 和树莓派 5。MacBook Pro 和 NucBox 使用 GPU 推理,而三星和树莓派使用 Arm CPU 推理。BF16 和 F16 作为全精度参考一并给出。




230M 和 350M 的 QAD Q4_0 检查点在评估方差范围内达到了 Q5_K_M 的质量,同时解码吞吐高出 4-33%。1.2B 和 2.6B 的 QAD Q4_0 检查点达到了 Q4_K_M 的质量,同时吞吐高出 3-14%。QAD Q4_0 检查点还与 Unsloth 的 UD-Q4_K_XL(在适用的情况下,即 230M 和 1.2B)相当——后者是一款表现优异的后训练量化检查点。
使用 llama.cpp 或任何支持 GGUF Q4_0 工件格式的运行时来运行这些文件。
llama-cli -hf LiquidAI/LFM2.5-350M \
--hf-file LFM2.5-350M-QAD-Q4_0.gguf \
-p "What is C. elegans?"
开始使用 QAD GGUF
QAD GGUF 现已在 Hugging Face 上开放:LFM2.5-230M、LFM2.5-350M、LFM2.5-1.2B-Instruct 和 LFM2.5-2.6B。
迫不及待想看到你们用它构建出的成果。
引用请使用以下参考文献或 BibTeX:
Liquid AI, "LFM2.5 Q4_0: Quantization-Aware Distillation for Edge Deployment", Liquid AI Blog, Aug 2026.
或使用 BibTeX 引用
@article{liquidAI2026Q40,
author = {Liquid AI},
title = {LFM2.5 Q4_0: Quantization-Aware Distillation for Edge Deployment},
journal = {Liquid AI Blog},
year = {2026},
note = {www.liquid.ai/blog/qad},
}