Hugging Face 博客介绍 LFM(Large Foundation Model)2.5-2.6B 系列模型,专为本地设备端 AI Agent 场景优化,支持消费级硬件部署。
最佳 Agent:在工具使用、指令遵循和多步骤 Agent 任务上,可与 4 倍规模的模型竞争。
Agent 强化学习:在最流行的 Agent 评测框架中训练,提升兼容性。
高效推理:在 Apple M5 Max 上达到 220 tok/s,AMD Ryzen CPU 上达到 113 tok/s,内存占用低于 2.5 GB。

LFM2.5-2.6B 在约 34T tokens 上进行预训练,并通过中期训练阶段将上下文窗口扩展至 128K。后训练通过四个阶段将基座模型转化为 Agent:
监督微调(SFT):两轮 SFT,大量权重投向 Agent 数据,如工具使用、网页搜索和评测框架轨迹。
教师专业化:为每个领域(数学、代码、工具使用等)训练一个专业教师模型。
多领域在线策略蒸馏(MOPD):将专业教师蒸馏为一个统一的学生模型。
Agent 强化学习(Agentic RL):在真实的 Agent 评测框架中运行多轮 RL,模型在其中学习跨不同工具、系统提示词和多轮任务环境的协作。

Agentic RL 流程将模型优化、推理和环境执行分离为不同的组件。训练引擎(Training Engine)负责优化模型,Rollout 引擎生成动作并使用最新策略。RL 框架通过启动 rollouts、收集轨迹和奖励并更新模型来编排训练循环。
动作在沙盒服务(Sandbox Service)中执行,其中 Blackbox Harness 托管 Agent(如 OpenClaw 或 Hermes Agent)并协调与任务环境的交互。Harness Proxy 使我们能够将 Agent 评测框架视为黑盒,无需修改,同时透明地捕获标记级轨迹,用于重建和验证 RL 训练样本。

我们在 STEM、指令遵循、工具使用和 Agent 任务上对 LFM2.5-2.6B 进行了评估,参数量最高可达其 4 倍的模型均纳入对比。它是参数量最小的模型,却能与 rest 竞争甚至胜出。
对于你的应用来说,优势在于指令遵循和工具使用。LFM2.5-2.6B 在所有指令遵循基准测试中均位列第一,在工具使用基准测试中也几乎全面领先,仅 BFCLv4 例外——该测试中只有 9.7B 的 Qwen 略胜一筹。在 Agent 任务上,它击败了两个 Gemma 模型,并与 Qwens 持平。在知识方面它也处于领先地位,数学方面差距很小。代码是唯一一个更大规模模型保持明显领先的方向,所以在这方面请选择更大的模型。
LFM2.5-2.6B 在发布首日即获得整个推理生态的支持,包括 llama.cpp、MLX、vLLM、SGLang 和 ONNX。
CPU 推理。由于其高效的 LFM2 架构,LFM2.5-2.6B 是我们测试中最快的模型,在 M5 Max 上解码速度达 220 tokens/s,Ryzen AI Max+ 395 上达 113 tokens/s。以 30 tokens/s 的速度,它甚至允许你在手机上运行能力出色的 Agent。

GPU 推理。LFM2.5-2.6B 是其参数量级别中最快的模型,在高并发下几乎达到每秒 15K 输出 tokens,在单块 H100 上每天约 1.3B tokens。

当你需要为高吞吐量工作负载部署设备端 Agent 时,选择 LFM2.5-2.6B。
安装最新版本的 transformers(兼容 transformers>=5.0.0):
pip install -U transformers
然后加载并运行模型:
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "LiquidAI/LFM2.5-2.6B"
model = AutoModelForCausalLM.from_pretrained(
model_id,
device_map="auto",
dtype="bfloat16",
# attn_implementation="flash_attention_2" # uncomment on a compatible GPU
)
tokenizer = AutoTokenizer.from_pretrained(model_id)
prompt = "What is C. elegans?"
input_ids = tokenizer.apply_chat_template(
[{"role": "user", "content": prompt}],
add_generation_prompt=True,
return_tensors="pt",
tokenize=True,
).to(model.device)
output = model.generate(
input_ids,
do_sample=True,
temperature=0.2,
top_k=80,
repetition_penalty=1.05,
max_new_tokens=512,
)
print(tokenizer.decode(output[0], skip_special_tokens=False))
查看这个浏览器演示,体验 LFM2.5-2.6B 驱动的科研 Agent。该 Agent 帮助你研究特定问题并生成摘要。
LFM2.5-2.6B 和 LFM2.5-2.6B-Base 现已在 Hugging Face 上发布。
通过 LFM2.5,我们正在兑现「AI 随地运行」的愿景。这些模型具有以下特性:
下载:LFM2.5-2.6B-Base 和 LFM2.5-2.6B,访问 Hugging Face。
体验:在浏览器中运行 WebGPU 演示,无需任何配置。
集成到你的评测框架中:参考我们的指南,了解如何运行本地 Agent,如 OpenClaw、Pi 等。
期待看到你们的作品。
请引用本文为:
Liquid AI, "LFM2.5-2.6B: Deploy Agents Everywhere", Liquid AI Blog, Aug 2026.
或使用 BibTeX 引用:
@article{liquidAI202626B,
author = {Liquid AI},
title = {LFM2.5-2.6B: Deploy Agents Everywhere},
journal = {Liquid AI Blog},
year = {2026},
note = {www.liquid.ai/blog/lfm2-5-2-6b},
}