前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8836
  • MCP Nexus 1.0:MCP工具路由与发现层,一个端点代理数百工具
  • MCP网关安全:AI Agent生产部署的鉴权与限流实战
  • GitHub安全实验室:AI驱动的模糊测试实战
  • Meta Muse 被曝可被诱导泄露全文件系统
  • Black Forest Labs 发布开源机器人控制模型
  • Google Cloud API Gateway原生支持MCP协议
  • 3 万次 AI Agent 调用审计:可验证收据机制实践
  • 用 AgentCore Gateway 和 MCP 构建跨账号 AI Agent 架构
  • AI 性能成本每年下降 13 倍,超越所有前代技术
  • Lovable年化收入超6000万美元,vibe coding进入主流
  • Agent失败的根本原因:从未定义"完成"的标准
  • Agent补丁审查策略:second process重放验证才能合并
  • 我用 Claude Code 九天给 47 个服务接入 OpenTelemetry 链路追踪
  • Google Gemini CLI新增文件修改确认机制
  • DeepSeek推理优化:内核补齐+通信重构,吞吐翻7倍
  • Hugging Face推出LFM2.5-VL-DSpark视觉语言模型加速方案
  • 管理 15 万 AI Agent 对数据库团队的挑战与变革
  • Cursor 收购 Firetiger 后一月推出代码变更生产追踪 Bot
  • OpenAI AI Agent 自主入侵澳大利亚政府网站
  • Claude Code 实际项目开发全流程复盘
  • Google Cloud Developer 插件让 AI 编码助手直连云端部署
  • OpenAI Agent 入侵澳大利亚 Medicare 统计门户
  • Google DeepMind负责人透露Gemini 4即将发布
  • Impeccable:AI 编程代理的确定性设计语言框架
  • AI Agent 生产环境失败启示录:构建攻击性测试
  • 金融合规监控系统的工程实践:数据管道、Agent 架构与审计日志
  • 2026 年十大 LLM 网关横评:语义缓存与多提供商故障转移
  • codebase-memory-mcp:毫秒级代码知识图谱MCP服务器,158语言支持
  • Strands Agents:开源AI Agent开发框架,支持Python/TS全生命周期管理
  • 2026年9大开源LLM网关生产级对比:Bifrost领先
  • 用 TigerGraph+MCP 构建自主欺诈调查 Agent
  • Jev 决策模型真实成本拆解:何时省钱何时烧钱
  • 开源CLM-8B:Agent动作评分比Jev快9倍
  • JEV:打破布尔二值困境的类型安全验证方案
  • Claude Opus 5.5降价40%逼近前沿性能
  • VS Code 1.139:Agent 会话首次加载提速约 12 倍
  • 定时 Agent 总重复干活?用完成分类账让它知道什么是「做完」
  • TypeSafe AI Jev 编码指南:类型化决策、置信度校准与推测式广播
  • Vercel Connect 新增 TanStack AI 集成
  • Anthropic与OpenAI 90分钟内相继降价
  • 选LLM API的六个价格陷阱
  • Agent记忆正常仍出错:问题在状态不在记忆
  • Mercury 2.5 推理速度达 770 tokens/秒
  • GitHub Copilot 代码审查新增个人配置选项
  • MCP单人上手容易,团队规模落地是另一回事
  • 影子测试100%一致率背后:模型实际正确率仅75%
  • 已加载 46 / 8836
8.0
热点
AI SCORE
开源项目2026-09-24 22:08

Hugging Face推出LFM2.5-VL-DSpark视觉语言模型加速方案

Hugging Face Blog#HuggingFace#VLM#开源
Editor brief · 编辑速览

新型视觉语言模型架构结合LFM技术,在保持精度的同时显著提升推理速度。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

更快的推理:设备端 decode 加速最高 3.13 倍,H100 上最高 2.66 倍;端到端加速分别最高 2.62 倍和 2.27 倍。

极低的内存代价:drafter 仅增加 2.8 亿参数,在 3B 目标模型基础上仅增加 8.9%。

发布即支持:LFM 兼容的 DSpark 集成,首日即支持 llama.cpp、MLX-VLM 和 SGLang。

视觉语言模型的推测解码是如何工作的

视觉 drafter 与文本 LFM2.5-DSpark drafter 使用相同的架构:它在固定的 tap 层集合处捕获目标模型的隐藏状态,并以此为条件来草拟 k 个候选 token 块。图像 patches 和文本 token 在经过这些层之前会被投影到同一个共享表示空间中,因此 drafter 操作的隐藏状态向量维度与输入模态无关。推理算法因此与文本模型完全一致。

DSpark-Vision

训练与架构

我们遵循 DSpark 配方,使用视觉语言 SFT 数据混合集进行训练,权重向预期服务的工作负载倾斜。在 3、4、5 层的消融实验基础上,draft 模型简化为仅含注意力的 drafter,包含 4 层,block size 为 9。我们在最终混合数据上跑了 10 个 epoch,并在每个 epoch 后测量接受率——随着训练 token 增加,接受率持续提升,直至边际收益递减。推理时,我们建议根据硬件不同选择 block size 为 8 或 9。

最终 drafter 约有 2.8 亿参数,仅使已部署模型的参数总量增加 8.9%。

CPU 与 GPU 上的推理加速

LFM2.5-VL-3B 的 DSpark draft 模型首日即支持 llama.cpp、MLX-VLM 和 SGLang。

我们在设备端推理和 GPU 推理两种配置下分别测量。两套配置均使用 DSpark block size 为 8,在六项多样化的视觉任务上进行评估,涵盖通用 VQA、文本 VQA、图像描述、图表 VQA、复杂推理和多轮对话,遵循 MMSpec 基准。

设备端推理。 在 M5 Max 上使用 MLX,decode 速度提升 2.30 倍至 3.13 倍;端到端延迟改善 1.56 倍至 2.62 倍。在 M3 Ultra 上使用 llama.cpp,decode 改善 1.57 倍至 2.14 倍,端到端改善 1.30 倍至 1.77 倍。

Screenshot 2026-09-24 at 15.49.03

GPU 推理。 在 H100 上,同一 drafter 带来 2.04 倍至 2.66 倍的 decode 加速,端到端改善 1.64 倍至 2.27 倍。

Screenshot 2026-09-24 at 15.49.27

视觉工作负载中推测解码的局限性

在 LLM 中,prefill 阶段主要由计算驱动,其成本随 prompt 长度呈(亚)二次增长。VLM 在此基础上更进一步,因为图像首先需要经过视觉编码器处理,然后语言主干网还要处理数百个视觉 token 以及文本 prompt。边缘设备的算力远不及数据中心 GPU,因此 prefill 在端到端延迟中占比更大,MMSpec 基准在 Apple 芯片和 H100 上测得的首 token 时间与 decode 测量结果均说明了这一点。(M5 的每核 GPU 神经加速器缩小了这一差距)。

推测解码只能加速 decode 阶段,无法加速视觉编码或 prefill 阶段。当这些阶段已经占据了大部分墙上时间时,即使 decode 加速幅度很大,端到端收益也仅是温和的。这正是阿姆达尔定律(Amdahl's law)的体现——整体加速比受限于工作负载中未被加速的那部分。

如何使用 LFM2.5-VL-DSpark

在 SGLang 中运行 DSpark draft 模型,需要使用带有 LFM2 目标 DSpark 支持的 SGLang 构建版本(PR #40651)。启动 target 并附加 draft:

python -m sglang.launch_server \
  --model-path LiquidAI/LFM2.5-VL-3B \
  --speculative-algorithm DSPARK \
  --speculative-draft-model-path LiquidAI/LFM2.5-VL-3B-DSpark \
  --speculative-draft-attention-backend flashinfer \
  --speculative-dspark-block-size 9 \
  --disable-radix-cache

然后向 http://localhost:30000/v1 的 OpenAI 兼容端点发送请求。Block size 从 draft 的 config.json 中读取;基线对比使用相同命令但不加这三个 --speculative-* 参数。

在 llama.cpp 中运行需要对应的 llama.cpp 构建版本(PR#29339)。

llama-server -m models/LFM2.5-VL-3B-F16.gguf \
  --mmproj models/mmproj-LFM2.5-VL-3B-F16.gguf \
  -md LFM2.5-2.6B-DSpark-F16.gguf \
  --spec-type draft-dspark --spec-draft-n-max 8 --spec-draft-n-min 0 \
  -fa on -ngl 99 -c 8192

在 MLX-VLM 中运行需要对应的构建版本(PR#2280)。

mlx_vlm.server --model LiquidAI/LFM2.5-VL-3B --draft-model LiquidAI/LFM2.5-VL-3B-DSpark

Block size 从 sidecar 元数据中读取(n-max 被钳位到该值)。推测解码是精确的:target 会验证每一个提议的 token,因此贪婪输出的结果与单独使用 target 完全一致;每个响应的时序数据会报告 draft_n / draft_n_accepted。

我们的视觉 DSpark draft 模型已在 Hugging Face 上发布,提供 Safetensors 和 GGUF 两种格式。

借助 LFM2.5,我们正在兑现「让 AI 随地运行」的愿景。这些模型的特性:

开源权重 — 无限制地下载、微调和部署。

发布即高速 — 首日即支持 llama.cpp、MLX 和 SGLang。

完整模型家族 — 从用于定制的基座模型到专门的音频和视觉变体,一个架构覆盖多样化使用场景。

期待看到你们用它构建出的产品。

如需引用,请使用以下参考文献或 BibTeX:Liquid AI, "LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond", Liquid AI Blog, Sep 2026.

@article{liquidAI2026vldspark,
  author = {Liquid AI},
  title = {LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond},
  journal = {Liquid AI Blog},
  year = {2026},
  note = {www.liquid.ai/blog/lfm2-5-vl-dspark},
}
Original source

本文由 AI 翻译整理自 Hugging Face Blog,原文版权归原作者所有。

阅读英文原文
上一篇
DeepSeek推理优化:内核补齐+通信重构,吞吐翻7倍
下一篇
管理 15 万 AI Agent 对数据库团队的挑战与变革