Holotron-12B 模型专门优化 GUI 自动化任务,支持高并发 Agent 应用,推进 Computer Use 能力落地
我们很高兴发布 Holotron-12B,这是来自 H Company 的多模态计算机使用模型。Holotron-12B 基于开源的 NVIDIA Nemotron-Nano-2 VL 模型进行了后训练,使用了 H Company 专有的数据混合集,是我们研究实验室之间密切协作的成果,旨在设计一种新型模型,主要针对生产环境中的规模和性能进行优化。
H Company 是 NVIDIA 孵化计划的一部分。
该模型现已在 Hugging Face 上提供。
当今大多数多模态模型主要针对静态视觉或指令跟随进行优化。但 Holotron-12B,就像我们的 Holo2 模型一样,有不同的目标:充当计算机使用 Agent 的策略模型,这些 Agent 必须在交互式环境中高效地感知、决策和行动。
使用 Holotron-12B,我们希望创建一个能够在生产环境中高效扩展的模型,同时能处理包含多张图像的长上下文,并在 Agent 基准测试中表现出色。NVIDIA Nemotron 模型在推理方面提供了坚实的基础,通过开发 Holotron-12B,我们展示了通过进一步训练该模型能够实现多少成就。
Holotron-12B 推理效率的显著提升得益于其基础的 Nemotron 架构,该架构采用了混合状态空间模型(SSM)和注意力机制。与纯粹基于 Transformer 的模型不同,这种设计针对高吞吐量服务进行了优化。状态空间模型通过避免完整注意力机制相关的二次方计算成本,为长上下文推理提供了优越的可扩展性,特别有利于涉及多张图像和冗长交互历史的 Agent 工作负载。在推理方面,SSM 的主要贡献是显著降低的内存占用:虽然标准注意力机制为每个令牌和层存储 K 和 V 激活(臭名昭著的 KV 缓存),但 SSM 是线性递归模型,每层每个生成序列仅存储一个恒定状态,与序列长度无关。
在 WebVoyager 基准测试中评估时,该模型在真实世界的多模态 Agent 工作负载中表现卓越,该工作负载具有长上下文、多张高分辨率图像以及 100 个基准工作线程的高请求并发。在单个 H100 GPU 上运行,使用 vLLM 和最新的 SSM 优化(v0.14.1),Holotron-12B 相比 Holo2-8B 实现了超过 2 倍的吞吐量提升。这使 Holotron-12B 成为吞吐量受限工作负载(如数据生成、标注和在线强化学习)的理想选择。
在受控的实验设置中(见图 2),Holotron-12B 随着并发增加而继续高效扩展,总令牌吞吐量在最大并发 100 时稳定上升至 8.9k tokens/s。相比之下,Holo2-8B 的总令牌吞吐量上升得更快,在 5.1k tokens/s 时迅速达到平台期。这种行为突出了 Nemotron 架构的一个关键优势,即更有效和高效的 VRAM 利用,以及更小的整体内存占用,这使得在相同硬件上能实现更大的有效批次大小。即使在大批次大小下,Holotron-12B 仍保持强劲的吞吐量。
Holotron-12B 经过两个阶段的训练。我们从 NVIDIA 发布的多模态基础模型 Nemotron-Nano-12B-v2-VL-BF16 开始。随后我们在 H Company 专有的本地化和导航数据混合集上进行了监督微调,重点关注屏幕理解、定位和 UI 级交互。
最终检查点经过约 140 亿个令牌的训练。
在计算机使用和导航基准测试中,Holotron-12B 相比 Nemotron 基础模型显示出强劲的改进,与已建立的 Agent 模型相比性能强劲。其 WebVoyager 性能从 35.1% 提升至 80.5%,超过了 Holo2-8B 在该基准测试上的性能,说明该模型在 Agent 设置中能够有效执行。
Holotron-12B 在定位和定位基准(如 OS-World-G、GroundUI 和 WebClick)上也相比基础 Nemotron 模型有了实质性改进。
Holotron-12B 证明,当与正确的训练设置和基础设施工作相结合时,NVIDIA Nemotron VL 模型为真实世界的多模态 Agent 提供了坚实的基础。
该模型提供了强劲的 Agent 性能、显著改进的推理吞吐量,以及清晰的未来改进路径,特别是在更高分辨率视觉训练方面。
我们期待看到他人用 Holotron-12B 构建的项目。该模型和检查点现已在 Hugging Face 上提供,采用 NVIDIA 开放模型许可证。
NVIDIA 今日宣布发布 Nemotron 3 Omni。基于 Holotron-12B 的成功,我们正在准备对这一新代多模态模型进行后训练。通过利用 Nemotron 3 系列增强的混合 SSM-注意力和 MoE 架构基础,我们致力于通过新发布的 Nemotron 3 Omni 在推理能力和多模态精度上实现更大的飞跃。随着这一发展将 Holotron 从研究推向商业应用,它将为企业提供大规模自主"计算机使用"部署所需的高吞吐量、低延迟性能。
更多来自本作者的内容
Holo3.1:快速和本地计算机使用 Agent
认识 HCompany 的 HoloTab。您的 AI 浏览器伴侣。
· 登录或注册以发表评论