发布支持本地部署的快速计算机使用Agent框架,直接优化了自动化脚本和RPA场景。
用户希望在桌面和移动环境中运行相同的计算机使用功能,并与不同的 Agent 框架无缝集成。他们希望获得部署的灵活性,从云端推理到完全在终端用户设备上的本地执行。
这就是我们发布 Holo3.1 系列的原因。Holo3.1 在生产环境中最关键的三个维度上提高了鲁棒性:环境(网页、桌面、移动),Agent 框架,以及部署目标。我们首次发布了为本地推理优化的量化检查点,包括 FP8、Q4 GGUF 和 NVFP4。
Holo3.1 是实现我们通用计算机使用 Agent 愿景的重大一步:一种能在不同环境中运行、集成到任何 Agent 栈、以及在工作流所在的任何地方运行的系统。
Holo3.1 基于 Qwen 系列构建,其设计目的是提高计算机使用 Agent 在实际部署环境中的鲁棒性,同时保持最先进的性能水平。
当团队将 Holo3 从评估迁移到生产时,我们反复观察到同样的挑战:在一个场景中的强大性能不一定能转移到另一个场景。移动设备、替代 Agent 工具、以及不同的执行框架都会带来各自的分布偏移源。
Holo3.1 扩展了 Holo3 的功能,超越了浏览器和桌面控制,在移动环境中取得了重大进展。在 AndroidWorld 上,我们的 35B-A3B 模型从 67% 提升至 79.3%,而较小的 4B 和 9B 变体从 58% 提升至 72%。
为了更好地支持在第三方 Agent 栈内部署 Holo 的团队,Holo3.1 在已有的结构化 JSON 输出基础上,引入了对函数调用协议的原生支持。
在 OSWorld 以及涵盖电商、商业软件和协作工作流的内部基准套件上,函数调用和原生执行现在实现了近似的性能对等。在我们的 Holotab 产品框架内评估时,Holo3.1 相比 Holo3 还实现了超过 25% 的性能提升。
为了进一步支持本地和设备上推理,我们还发布了新的模型尺寸,包括小型模型(0.8B、4B 和 9B),用于成本高效和隐私保护的部署,此外还有更大的 35B-A3B 模型以获得最先进的性能。
Holo3.1 和 Qwen 3.5 系列的性能与成本对比。总体性能首先对四个 H Corporate 基准进行平均化(使得每个系列权重相等),然后在 OSWorld、AndroidWorld、H Corporate、ScreenSpot-Pro 和 OSWorld-G 上取平均。
这是我们第一次发布量化权重的版本。我们从 35B-A3B 检查点开始,提供 FP8、Q4 GGUF 和 NVFP4 三个版本。
对于 NVFP4,我们采用了 NVIDIA 的 Model Optimizer,使用 W4A16 配置。这些检查点能够以几乎没有模型性能下降的代价实现计算机使用 Agent 的快速本地推理。FP8 和 NVFP4 实现了相同的 OSWorld 分数,仅比完全精度的 BF16 检查点低两个点。
加速效果显著:在 DGX Spark 上,NVFP4 W4A16 相比 FP8 提供了 1.41 倍的总令牌吞吐量,相比 BF16 提供了 1.74 倍。
我们还发布了 Q4 GGUF 检查点,用于在消费类硬件上本地部署计算机使用 Agent。
Agent 本身在 Windows 或 Mac 机器上本地运行,而模型可以在同一台机器上运行——我们包含了 Apple Silicon 的参考数据——或在同一网络上的 DGX Spark 上运行。在两种情况下,执行都完全保持在用户网络内,不会有任何数据外泄。
在 Spark 上,我们与 NVIDIA 合作开发的 Agent 框架优化与上述 NVFP4 量化相结合,相比 FP8 基线提供了大约 2 倍的复合端到端加速,将平均步长时间从 6.8 秒缩短至 3.3 秒。
跨平台和精度的 Agent 请求速率。在 DGX Spark 上,vLLM 与 NVFP4 在 Default 和 Fast 两种模式下都实现了最高的请求速率,其次是 Q4 GGUF 和 FP8。这些改进和更多内容将在即将推出的桌面 Agent 框架中发布。
Holo3.1 系列提供四种尺寸:
我们还为本地和边缘部署发布了优化的 FP8、NVFP4 和 Q4 GGUF 检查点。
Holo Models API: https://hcompany.ai/holo-models-api
Hugging Face: https://huggingface.co/collections/Hcompany/holo31
我们期待看到开发者使用 Holo3.1 构建的应用。