Pipette 是一个开源的边缘设备基础模型基准测试框架,破解了模型卡上服务器精度数据与手机实际表现脱节的问题,可同时评估量化策略、运行时性能和硬件表现。
模型卡片报告的是服务器级、全精度条件下的质量指标。这些数字往往无法预测同一个模型在手机上的实际表现。本周,Liquid AI 发布了 Pipette——一个面向边缘设备上基础模型基准测试的开源平台,由 Artificial Analysis 作为独立方法论验证方合作共建。Pipette 将端侧行为视为部署系统的属性,而非模型的孤立属性。其度量单位是完整配置:模型 + 量化 + 运行时 + 设备。发布数据集覆盖了超过 1,000 个模型 × 量化 × 运行时 × 设备 × 上下文配置的五个端侧性能指标,横跨 30+ 个模型、面向 macOS、iOS、Windows 和 Android 的 llama.cpp 构建,以及 256 到 8,192 个 token 的上下文长度。首批经过验证的结果来自 MacBook Pro(M5 Max)、iPhone 17 Pro 和 Galaxy S26 Ultra。实际 claim 是可验证的:两 个 350M 模型在同一手机上、相同量化下,在 4,096 个 token 时分别保留了 78.4% 和 33.8% 的解码吞吐量。
是的,Pipette 以 Apache 2.0 许可证发布基础设施(pipette-mgmt、pipette-clients、pipette-scores)、公开结果数据集、托管仪表盘,以及原生的 iOS 和 Android 基准测试应用。无需排队等待。社区提交结果的发布仍在 beta 阶段。
适用公司:任何将模型部署到非自有硬件上的团队。独立开发者和种子期创业公司无需基础设施即可使用仪表盘和应用。中型产品团队可以在内部设备集群上运行客户端。大型 OEM、芯片供应商和企业可以在自己的防火墙内运行完整流水线。
适用行业:消费电子与智能手机 OEM、汽车、工业与机器人、医疗设备、金融服务、国防——任何因延迟、隐私或连接性要求而必须将推理放到端侧的场景。
应用场景:冲刺开始前的模型与量化选择;SoC 和硬件采购验证;运行时、操作系统或驱动更新时的回归测试;上下文长度的容量规划;供应商性能声明的独立核实。
Liquid AI 与 Artificial Analysis 合作发布 Pipette,后者是审核并验证方法论的独立验证方。其前提简洁而有价值:端侧行为是部署系统的属性,而非模型的孤立属性。
发布数据集覆盖了超过 1,000 个模型 × 量化 × 运行时 × 设备 × 上下文配置的五个端侧性能指标。横跨 30+ 个模型、多种量化格式、面向 macOS、iOS、Windows 和 Android 的 llama.cpp 构建,以及 256 到 8,192 个 token 的上下文长度。首批发布结果来自 MacBook Pro(M5 Max)、iPhone 17 Pro 和 Galaxy S26 Ultra,AMD Ryzen AI Max+ 395 和 Radeon 8060S 的结果列明即将上线。
在 Pipette 中,度量单位是部署配置:模型 + 量化 + 运行时 + 设备。基准测试然后定义指标和 token 形状,产生延迟、吞吐量或内存结果。质量在 IFBench、GPQA Diamond 和 MATH-500 上单独追踪。这些质量分数目前来自 NVIDIA H100 80GB 参考系统上 llama.cpp 的评估运行,然后与共享相同模型和量化的端侧运行进行匹配——手机上显示的质量数字并非在手机上实测得出。
四组已发布的对比展示了配置能将决策推到多远:
上下文缩放在相同参数量下可能分叉。在 Galaxy S26 Ultra 上以 Q4_K_M 量化时,Granite-4.0-H-350M 从 256 到 4,096 个输入 token 保留了 78.4% 的解码吞吐量,而 Granite-4.0-350M 仅保留了 33.8%。
稀疏激活换来速度,而非内存。在同一手机上以 2,048 个输入 token 时,LFM2.5-8B-A1B 的解码速度比 Qwen3.5-4B 快 2.4 倍,比 Ministral-3-3B-Instruct-2512 快 2.6 倍。它每个 token 激活 8.5B 参数中的 1.5B,但峰值内存仍达 5.29 GiB,因为所有 expert 权重都占用内存。
速度和质量并不共置。在 iPhone 17 Pro 上以 Q4_K_M 量化时,MiniCPM5-1B 完成 2,048 输入 / 256 输出的工作负载耗时 3.47 秒,而 LFM2.5-1.2B-Instruct 耗时 4.12 秒,缩短了 15.8%。在同一测试集上,LFM 在 MATH-500 上高出 9.0 分。
几乎相同的系统配置可能隐藏任务级的逆转。在 M5 Max 上以 Q4_K_M 和 2,048 个输入 token 时,Granite-4.1-8B 和 Ministral-3-8B-Instruct-2512 的解码吞吐量相差 2.4%,峰值内存相差 1.2%。Granite 在 IFBench 上领先 7.3 分;Ministral 在 GPQA Diamond 上领先 14.0 分。
性能运行遵循已发布的方法论:固定 token 形状、贪婪解码、丢弃预热、五次有计量重复以及就绪门控。每次计时重复前,平台特定检查会验证热力和负载条件;失败的运行不会发布。评估使用独立协议,具有确定性、模型盲的评分机制,pipette-scores 从不获取生成来源。每个提交记录基准版本、token 形状、模型产物、量化、运行时版本和设置,以及设备硬件和操作系统。
Pipette 基准测试的是配置,而非模型:模型 + 量化 + 运行时 + 设备。
Apache 2.0 技术栈,1,000+ 配置,30+ 模型,发布时三个经过验证的设备。
质量评估在 H100 参考上运行,并与端侧性能匹配,而非在端侧实测。
相同参数量在不同配置下的上下文缩放保留率可能相差 78.4% 对 33.8%。
查看技术细节和排行榜。同时,欢迎关注我们的 Twitter,不要忘记加入我们 15 万+的 ML SubReddit 并订阅我们的通讯。等一下!你用 telegram 吗?现在你也可以加入我们了。
Asif Razzaq 是 Marktechpost Media Inc. 的 CEO。作为一位有远见的企业家和工程师,Asif 致力于将人工智能的潜力用于社会公益。他最近的举措是推出了一个人工智能媒体平台 Marktechpost,该平台以深度报道机器学习和深度学习新闻著称,内容既具有技术深度又易于广泛读者理解。该平台每月浏览量超过 200 万次,展示了其在受众中的受欢迎程度。