Liquid AI 开源 d1-3B(图文)和 d1-omni-600M(图文+音频)两款多模态决策模型,单次前向返回校准后的类型化答案,无需生成 token,适合实时决策场景。
Liquid AI 发布了 Open d1,这是其 d1 决策模型系列中的两个开放权重多模态模型。d1-3B 可读取文本和图像。d1-omni-600M 可读取文本配图像,或文本配音频。两个模型均不生成文本,每次在前向传播中返回经过校准的带类型答案,输出 token 数为零。目标是 NVIDIA 技术栈上的实时决策:DGX 服务器、RTX 工作站和 Jetson 边缘设备。
可以。两个模型的 checkpoint 均已上传至 Hugging Face,可通过 Transformers 加载,且在发布首日即支持 llama.cpp。LFM Open License v1.0 允许年收入 1000 万美元以下的公司免费商业使用。d1-omni-600M 为早期研究版本,暂未公布延迟数据。
生成式 LLM 按 token 逐个生成答案,由你的代码解析。决策模型则接收一个状态和一组带名称的问题,一次读取后即为每个合法答案返回概率。Liquid AI 定义了三种问题类型:
一次调用中多个问题可以共享同一个状态。每个响应均报告 output_tokens: 0。Liquid AI 推荐将 d1 用于路由、审核、意图分类、重排、LLM-as-a-judge 评分、Agent 防护栏和视觉检查。两个 checkpoint 均非对话模型。
d1-3B 拥有 31.2 亿参数,以 LFM2.5-VL-3B(一个仅解码器的视觉语言模型)为起点。Liquid AI 将 LFM2.5-2.6B 的权重与该模型的文本主干进行了平均。然后用不同种子和数据配比微调了多个 checkpoint,再将它们合并。模型使用 4 亿参数的 SigLIP2 NaFlex 视觉编码器和 32768 token 的上下文。长输入、答案选项打乱以及修复数据捷径比高级技术更为关键。
d1-omni-600M 拥有 5.87 亿参数,以 LFM2.5-Encoder-350M(一个双向编码器)为起点。其中包括 3.81 亿参数的共享躯干和决策头、9400 万参数的视觉编码器以及 1.12 亿参数的音频编码器。音频编码器是一个 17 层的 FastConformer。上下文为 16384 token。音频片段上限为 30 秒。一次请求携带图像或音频,但不同时携带两者。音频训练仅覆盖英语说话者到助手的请求。
支持与工单分类:一次 d1-3B 调用即可就同一条消息回答是否退款检查、选择负责团队并评定紧急程度,无需解析任何输出 token。
边缘端的实时视觉检查和审核:d1-3B 在 Jetson AGX Thor 上读取一张 384px 图像仅需 35 毫秒,Liquid AI 的 Open d1 Arcade 以帧为单位处理实时摄像头输入,用于内容审核和手势控制。
小型设备上的语音指令路由:d1-omni-600M 可接收最长 30 秒的语音并配合文本,直接返回说话者的意图或主题。其卡片将语音指令路由和 Agent 防护栏列为核心用途。
在 Decision Index v0.2.1 上,d1-3B 得分为 48.57,超越了所有 100 亿参数以下的模型,并小幅领先 Decider 35B-A3B(47.11)。仅有 Winnow-12B 以 50.02 的分数更高。Liquid AI 使用官方评分器自行运行了评测,因此 d1 的分数并非排行榜提交成绩。d1-3B 在 Tools(74.5)和 Arts(36.3)类别中领先,但在 Knowledge(23.8)类别中落后。
在七项公开文本基准测试中,d1-3B 平均得分为 82.9,领先于 Decider 4B 的 81.1。d1-omni-600M 平均得分为 78.4,并在 Civil Comments(95.8)和 PAWS-X(79.5)上取得了最高分。在 11 项图像基准测试中,d1-3B 平均得分为 74.1,对比基座模型的 73.9 略有提升。Liquid AI 将音频决策基准测试视为一个开放性问题。
Liquid AI 测量了端到端延迟,每次仅处理一个预热请求。一个问题在 RTX 4090 上耗时 8 毫秒,在 AMD MI325X 上耗时 9 毫秒。在 Jetson 上,AGX Thor 耗时 16 毫秒,AGX Orin 耗时 26 毫秒,Orin Nano 耗时 50 毫秒。在 Jetson AGX Thor 上,对同一个状态提三个问题耗时 20 毫秒,而一个问题耗时 16 毫秒。RTX 4090 的数据使用了 model.compile(mode="reduce-overhead"),不启用该选项时一个问题的耗时为 16 毫秒。NVIDIA 的 Jetson AI Lab 也托管了 d1-3B 的使用指南。
| d1-3B | d1-omni-600M | Decider 4B | Decider 35B-A3B | Winnow-12B | |
|---|---|---|---|---|---|
| 厂商 | Liquid AI | Liquid AI | Mapika(独立) | Mapika(独立) | EldanRing(独立) |
| 参数量 | 3.12B | 587M | 4.2B | 347 亿总参数,30 亿活跃 | 12B |
| 基座模型 | LFM2.5-VL-3B | LFM2.5-Encoder-350M | Qwen3.5-4B-Base | Qwen3.5-35B-A3B-Base | Gemma 4 12B IT |
| 输入 | 文本、图像 | 文本+图像,或文本+音频 | 文本 | 文本 | 文本、图像 |
| 上下文 | 32768 | 16384 | 32K-token state | 32K-token state | 65536(Q8 测试) |
| Decision Index v0.2.1 | 48.57 | 15.95 | 40.70 | 47.11 | 50.02 |
| 许可证 | LFM Open v1.0 | LFM Open v1.0 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
| 已公布延迟 | RTX 4090 每问题 8 ms | 未公布 | B300 每 3 问题请求 5.2 ms | B300 每 3 问题请求 47 ms | RTX 5070 Ti 接近 64K 上下文 4 问题请求缓存 143 ms |
来源:d1-3B、d1-omni-600M、Decider 4B、Decider 35B-A3B、Winnow-12B 模型卡片。指数得分来自 d1 卡片所列数据。延迟数据使用了不同的硬件和工作负载,因此不可直接比较。
d1-3B 需要 transformers>=5.14 和 trust_remote_code=True。d1-omni-600M 需要 transformers>=5.15。两者均提供 system_one(state, questions) 用于单状态和 system_one_batch 用于打包请求。Liquid AI 推荐在 GPU 上对 d1-omni-600M 使用 float16,因为 bfloat16 会改变部分问题的首选答案。你可以在 Open d1 Arcade 空间中尝试十个摄像头驱动的 d1-3B 演示。与 NVIDIA 合作,Liquid AI 还展示了从 Jetson 运行 Isaac Sim 中的 d1-3B 导航。
d1 模型在前向传播中输出固定选项上的概率,从不生成 token。
查阅 d1-3B、d1-omni-600M 和技术详情。所有荣誉归该项目的研究者所有。也欢迎在 Twitter 上关注我们,不要忘记加入我们的 15 万+ ML SubReddit 并订阅我们的通讯。你用 telegram 吗?现在也可以加入我们了。
【赞助】Web 是大多数 Agent 缺失的 API。数据库日历和代码仓库都有 API,开放的 Web 基本上没有。TinyFish MCP 服务器为任何 MCP 客户端提供四个工具:TinySearch、TinyFetch(将完整页面转为 markdown,包含 JavaScript)、TinyBrowser(用于登录和表单)以及 TinyAgent(用于多步骤任务)。Search 和 Fetch 免费使用。
Asif Razzaq 是 Marktechpost AI Media Inc. 的 CEO。作为一位有远见的企业家和工程师,Asif 致力于将人工智能的潜力用于社会公益。他最近的成就是推出了一个人工智能媒体平台 Marktechpost,该平台以深入报道机器学习和深度学习新闻著称,内容既有技术深度又通俗易懂。该平台每月浏览量超过 200 万次,证明了其在受众中的受欢迎程度。