前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9255
  • Trace 不是 Governance:Agent 系统长期运行的架构边界
  • LangGraph 多 Agent 流水线实战:18 天开发 doc2slides 的工程权衡
  • 自建 LLM 路由:用对模型省 28x 成本
  • 训练数据仅占 0.3%,却占输出 36%:微调模型的数据污染陷阱
  • Gemini 3.7 Flash发布
  • Gemini 3.7 Flash三周内连发
  • Google Sheets Canvas:自然语言构建交互式数据看板
  • CI/CD AI Agent 部署前需加人工审批门
  • MCP + RSS 目录:让 AI 工具获取领域最新信息
  • Agent工具调用200 OK背后的谎言:完成所有权问题
  • Google Sheets Canvas功能详解:打造互动数据看板
  • DeepSeek V4 Pro正式版发布,Agent框架Harness开源,API涨价
  • GPU 数值格式详解:FP32/BF16/FP8/FP4 交互式理解指南
  • 长时 Agent 循环如何设计记忆机制
  • 深度体验DeepSeek Harness:涨价也在情理之中
  • AWS AgentCore:统一监控多云/本地AI Agent
  • DFlash speculative decoding 测评:tokens/s 指标可能误导
  • Claude文本水印技术原理解析
  • 为什么AI demo便宜、上线后成本却翻10倍
  • 用 Bedrock AgentCore Browser Tool 自动化遗留 Web 系统
  • Liquid AI 发布 3B 端侧视觉语言模型
  • AI 编程 Agent 通过测试也可能做出架构错误决策
  • 基于 Bedrock AgentCore 构建 M&A 尽职调查多智能体系统
  • Token降价90%但我的AI账单没降:Jevons悖论在起作用
  • 我的Agent替我做营销:我只负责点批准
  • 文本 AI 水印容易被移除,技术局限性分析
  • ai-prompt-firewall:拦截敏感信息外泄的 Node.js 库
  • 用 FastMCP 快速为 Claude Code 构建自定义工具服务器
  • Ling 3.0 Flash 同尺寸最聪明开源模型
  • AI 辅助团队开发实际吞吐量研究:REPL 到 Swarm
  • 神秘模型 mona-lisa-1 曝光:疑似 GPT-Image 继任者
  • OpenAI Astra 和 ChatGPT 6 曝光: 多 Agent 协作与 GPT-6 真身
  • 微软统一 Copilot 超级应用路线图初现
  • Claude + MCP: 一行命令完成容器化部署
  • AI 陪伴应用技术架构解析
  • 把 Claude Code 脚手架工程写成一条命令,开源了
  • A2A 协议详解:多 Agent 通信架构与实战实现
  • R-CLI 开源:Terminal Bench 2.1 最高分背后的编程脚手架
  • CVE-2026-16584:AWS API MCP Server安全漏洞深度分析
  • GitHub Copilot已上线Gemini 3.7 Flash
  • Anthropic 为 Claude 输出文本添加水印:API 开放检测,版权认定存争议
  • Next.js 16.3发布:开发内存降低90%,AI编码Agent工作流优化
  • 一行代码修复PyTorch训练隐性内存泄漏:loss.detach().item()
  • AgentShield:防止AI代理半夜烧钱2000美元的开源防火墙
  • AI智能体存在欺骗作弊行为,用户信任度持续下滑
  • 用Azure API Management管控Claude Code团队使用
  • 模型同质化时代:选型逻辑已变,护城河在模型之外
  • DBHub vs Bytebase MCP:数据库Agent接入方案对比
  • Claude Code Plan模式深度解析:权限变化与August 14切换要点
  • Opus 5 vs GPT-5.6 Sol vs Kimi K3 三大模型编程能力实测对比
  • Grok 4.6 性能追平 GPT-5.6 Sol,价格仅为六分之一
  • 已加载 51 / 9255
8.0
热点
AI SCORE
模型发布2026-08-13 23:56

Liquid AI 发布 3B 端侧视觉语言模型

MarkTechPost#端侧模型#视觉语言模型#开源
Editor brief · 编辑速览

LFM2.5-VL-3B 是一款 3.1B 参数的端侧 VL 模型,在 ScreenSpot-v2 达 80.7 分,支持工具调用,可在 Apple M5 Max 以 228 tokens/s 解码。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

发布概览

昨日,Liquid AI 发布了 LFM2.5-VL-3B。这是一款参数量为 3.1B 的视觉语言模型,专为端侧部署而构建。该模型可读取移动端、Web 端和桌面端的数字屏幕,能够将物体定位到坐标、解析文档和图表,并根据文本或图像输入调用工具。Liquid AI 报告称,该模型在 28 项视觉基准测试中平均得分为 69.4,与 InternVL-3.5-4B 持平,仅落后 Qwen3.5-4B 0.7 分——后两者均为 4.7B 参数模型。该模型为非推理模型,直接给出答案以保持低延迟。它约占 3 GB 内存,在 Apple M5 Max 上解码速度为 228 tokens/s。

是的,模型权重以四种格式发布:native、GGUF、ONNX 和 MLX。发布首日即可在 llama.cpp、MLX、vLLM、SGLang 和 ONNX 上运行。它约占 3 GB 内存。

许可与商业模式

LFM Open License v1.0 基于 Apache-2.0,只做了一处修改:一旦企业年收入达到 1000 万美元,免费商业使用即终止。因此,低于该门槛的个人开发者、初创公司和中小企业可以免费商业发布。超过该门槛的企业须与 Liquid AI 协商商业许可。研究、教育和非营利使用不受年收入限制。

应用行业

消费电子、汽车、工业与机器人技术、金融服务、医疗健康和电子商务。还包括 QA 和 RPA 供应商,专注于 GUI 自动化。

应用场景

端侧屏幕 Agent、GUI 测试自动化、带布局标签的 PDF 转结构化文本、发票和收据 OCR、车辆内近实时目标检测、菜单和路标的离线翻译,以及多图像对比。

核心能力提升

LFM2.5-VL-3B 从四个维度对 LFM2-VL-3B 进行了扩展。

屏幕与 UI 理解

该模型在 ScreenSpot-v2 上平均得分为 80.7,其中桌面端 78.7、移动端 81.2、Web 端 82.2。Liquid AI 报告 Gemma-4-E4B 为 51.2、Qwen3.5-4B 为 78.5,而更大的 InternVL-3.5-4B 以 84.1 领先。

函数调用

这是 VL 系列的新增能力。ToolSandbox 从 26.4 提升至 59.5。BFCL v4 从 20.5 提升至 32.5。工具调用以 Pythonic 调用形式输出在 <|tool_call_start|> 和 <|tool_call_end|> token 之间。

定位(Grounding)

RefCOCO-avg 精确率@1 从 57.1 提升至 87.9,增幅达 30 点,主要得益于规模化的合成定位数据。

多图像输入

BLINK 从 50.2 提升至 61.5,MuirBench 从 34.9 提升至 58.3。

架构与训练

语言骨干是 LFM2.5-2.6B。视觉塔是 SigLIP2 NaFlex 形状优化的 400M 编码器。NaFlex 通过将大图分割成不重叠的 512×512 patches 加上一个缩放后的整图缩略图来处理原生分辨率。上下文长度为 32,768 tokens,支持 16 种语言。

预训练使用了约 34T tokens。词表通过就地扩展现有 tokenizer 扩大到 128K,这改善了非拉丁字母体系的覆盖率。视觉预训练在 token 规模上扩大了 4 倍,使用了精选和合成的 caption、OCR、定位和指令遵循数据。

后训练采用 SFT,并从更大的教师模型进行知识蒸馏,以及 Antidoom 训练,随后进行多奖励强化学习。

该模型为非推理设计,直接给出答案,这是其低延迟特性背后的设计选择。

基准测试结果

Liquid AI 使用 vLLM 0.26.0(推理模式)评估了 28 项视觉基准测试。LFM2.5-VL-3B 平均得分为 69.4,与 InternVL-3.5-4B(69.4)持平,仅落后 Qwen3.5-4B(70.1)0.7 分。两个对比模型均为 4.7B 参数。

值得关注的单项成绩:RealWorldQA 73.1(InternVL-3.5-4B 为 67.7)、TextVQA 84.3(Qwen3.5-4B 为 81.2)、MMStar 63.3、MathVista-mini 68.5、ChartQA 81.3、DocVQA 91.1、OCRBench v1 84.2。CountBenchQA 从上一版本的 92.2 退步至 87.3。

纯文本评估方面,IFEval 达到 82.3,高于之前的 72.9。Gemma-4-E4B 在该指标上仍以 87.9 领先。

核心数据一览

  • LFM2.5-VL-3B 在 28 项视觉基准测试中平均得分为 69.4,匹配 4.7B 级模型
  • ScreenSpot-v2 跃升至 80.7,RefCOCO-avg 达到 87.9(上一版本为 57.1)
  • 函数调用是 VL 系列的新增能力:ToolSandbox 26.4 → 59.5,BFCL v4 20.5 → 32.5
  • 内存占用约 3 GB,在 M5 Max 上解码速度 228 tok/s,在 Galaxy S26 Ultra 上为 20 tok/s
  • LFM Open License v1.0 年收入 1000 万美元以下可免费商业使用
Original source

本文由 AI 翻译整理自 MarkTechPost,原文版权归原作者所有。

阅读英文原文
上一篇
用 Bedrock AgentCore Browser Tool 自动化遗留 Web 系统
下一篇
AI 编程 Agent 通过测试也可能做出架构错误决策