Liquid AI 发布开放权重的 26.9 亿参数 LFM2.5,支持约 128K 上下文、工具调用和多步任务。模型提供 GGUF、MLX 与 ONNX 格式,在 M5 Max 上占用不足 2.5GB,解码速度达 220 token/s。
人工智能
Liquid AI 发布了 LFM2.5-2.6B,这是一款完全在设备端运行的 Agent 模型。它能够进行规划、调用工具,并在手机、笔记本电脑、PC 和机器人上完成多步骤任务。该模型共有 26.9 亿个参数,上下文窗口为 131,072 个 token,词表包含 128,000 个 token。预训练使用了约 34 万亿个 token。本次发布了两个 checkpoint:用于微调的 LFM2.5-2.6B-Base,以及经过后训练、面向 Agent 工作负载的 LFM2.5-2.6B。由于推理完全在本地进行,数据不会离开设备,每次运行的边际成本接近于零。Liquid AI 表示,该模型在工具使用和指令遵循方面的得分,可以与规模接近其四倍的模型竞争。
答案是肯定的。两个 checkpoint 均已基于 lfm1.0 许可证在 Hugging Face 上公开。模型权重提供原生、GGUF、MLX 和 ONNX 格式,并从发布首日起支持 llama.cpp、vLLM、SGLang 和 LM Studio。
适用企业:独立开发者和初创公司可以直接使用已有硬件开展试点。该模型在 M5 Max 上的解码速度可达每秒 220 个 token,占用内存不到 2.5 GB。中型企业团队可以使用一块 GPU 自托管:单张 NVIDIA H100 SXM5 每天大约可以处理 13 亿个 token。大型企业和 OEM 可以通过 GGUF 和 ONNX,将同一套权重部署到设备集群中。此外,还可以借助 TRL 和 Unsloth,通过 LoRA 进行微调。
适用行业:Liquid AI 的目标行业包括汽车、消费电子、工业机器人、医疗健康、金融服务、电子商务和国防。受监管环境和物理隔离环境尤其能从中受益,因为任何 prompt 都不会被发送给第三方 API。
应用场景:Liquid AI 推荐将该模型用于 Agent 工作负载、工具使用、数据提取、RAG 和长上下文工作流。实际应用包括设备端助手、针对 128K 输入的离线文档分类处理、表单与发票信息提取、机器人指令解析,以及无需承担按 token 计费、可持续运行的后台 Agent。Liquid AI 明确表示,不建议将该模型用于 Agent 编程或高度依赖知识的任务。
LFM2.5-2.6B 共有 26.9 亿个参数,分布在 30 层中。整个网络由 22 个双门控短卷积块和 8 个分组查询注意力块组成。词表大小为 128,000,上下文长度为 131,072 个 token。预训练使用了约 34 万亿个 token。
Liquid AI 没有从头重新训练 tokenizer,而是直接扩展现有 tokenizer,将词表规模翻倍至 128K。一个专门的中期训练阶段将上下文长度扩展到了 128K。该模型支持 16 种语言,并且仅支持文本。
基础 checkpoint 通过四个阶段转变为 Agent。
第一阶段,连续进行两轮监督微调,其 SFT 混合数据规模大约是 LFM2.5-8B-A1B 所用数据的七倍。
第二阶段,教师模型专业化:为每个领域训练一个专家模型,训练方式为基于可验证奖励的强化学习。
第三阶段,多领域 on-policy 蒸馏:学生模型按照自身策略进行 rollout,每个 prompt 都会被路由到对应领域的教师模型。
第四阶段,在真实 harness 中使用 GRPO 进行 Agent 强化学习,其中包括 Hermes Agent 和 OpenClaw。
Liquid AI 将 LFM2.5-2.6B 与 gemma-4-E2B-it(5.1B)、gemma-4-E4B-it(8B)、Qwen3.5-4B(4.7B)和 Qwen3.5-9B(9.7B)进行了比较。
| 基准测试 | LFM2.5-2.6B | gemma-4-E4B-it | Qwen3.5-9B |
|---|---|---|---|
| ToolSandbox | 77.83 | 65.00 | 76.44 |
| Multi-IF | 80.07 | 77.35 | 62.55 |
| IFStruct | 85.49 | 76.65 | 78.50 |
| IFBench | 59.17 | 39.24 | 56.47 |
| BFCLv4 | 56.88 | 46.39 | 60.13 |
在已公布的所有指令遵循基准测试和几乎所有工具使用基准测试中,它都取得了领先,仅在 BFCLv4 上落后于 Qwen3.5-9B。编程是大型模型依然保持优势的领域:LFM2.5-2.6B 的 LiveCodeBenchv6 得分为 59.41,而 Qwen3.5-9B 为 69.86。
26.9 亿参数,30 层(22 个短卷积块 + 8 个 GQA 块),128K 上下文,约 34 万亿训练 token。
在 ToolSandbox、Multi-IF 和 IFStruct 上超过 gemma-4-E4B-it 和 Qwen3.5-9B。
在 M5 Max 上达到每秒 220 个 token,在手机上达到每秒 30 个 token,内存占用不到 2.5 GB。
基于 lfm1.0 许可证开放权重,并从发布首日起提供 GGUF、MLX 和 ONNX 格式。
欢迎查看技术细节、LFM2.5-2.6B 和 LFM2.5-2.6B-Base。也欢迎在 Twitter 上关注我们,别忘了加入我们拥有超过 15 万成员的机器学习 SubReddit,并订阅 Newsletter。等等!你也使用 Telegram 吗?现在也可以加入我们的 Telegram。
需要与我们合作推广你的 GitHub Repo、Hugging Face 页面、产品发布或 Webinar 等内容吗?欢迎联系我们。
Asif Razzaq 是 Marktechpost Media Inc. 的 CEO。作为一名富有远见的创业者和工程师,Asif 致力于发掘人工智能造福社会的潜力。他最近开展的项目是推出人工智能媒体平台 Marktechpost。该平台以深入报道机器学习和深度学习新闻而脱颖而出,其内容既具备可靠的技术深度,也易于广大读者理解。该平台每月浏览量超过 200 万,足以体现其在受众中的受欢迎程度。