Hugging Face 博客深入解析 Holo4 项目如何驱动通用计算机操作智能体,提供构建此类智能体的核心技术思路与实现路径。
Holo4 是我们全新的 Agent 系列模型,提供两种规格:27B Dense 和 35B-A3B MoE(混合专家)。两款均已上线 H Models API。同时我们还发布了 Holotron3 的更新版本——Holotron4 Nano。
Holo4 在前代模型基础上构建,通过任何可用接口与软件进行交互:GUI、代码、MCP 和 API。它在学术基准测试中表现优异,但我们打造它的目的是服务于真实的业务工作流。模型通过监督学习和强化学习在大量环境和任务上训练而成,这些环境和任务中包括由我们的 Agentic Task Factory 生成的内容。
🤖 模型:Holo4-27B | Holo4-35B-A3B | Holotron4 Nano
🗂️ 完整合集(FP16、FP8、GGUF):Holo4
🎞️ 轨迹数据:查看器 | 数据集
⚡ H Models API:快速开始
📝 完整博文:hcompany.ai/newsroom/holo4
Holo4 能在屏幕上点击和输入、自行编写和运行代码、调用 MCP 或 API 工具。它根据任务需求选择合适的交互方式。大多数 Agent 模型只针对单一接口训练:专注 GUI 的模型离开屏幕就"失明",而偏好工具调用的模型面对没有 API 的应用就束手无策。现实工作并非如此割裂,一个业务任务往往需要结合不同的交互方式。

Holo4 运行于桌面端、Web 端、Android 端、代码沙箱和业务 API 环境。在每种场景下使用的是同一个模型,调用方式也相同。你不需要为每个平台选择不同的模型。
Holo4 模型相比其 Qwen 基座有显著提升。在长流程工作流上,Holo4 仅次于最强大的闭源模型:在 OSWorld 2.0 上,Holo4 27B 得分为 61.7%,对比 Opus 5.5 的 81.8%;Holo4 35B-A3B 达到 30.9%。然而,Holo4 的参数量级低得多,成本也低得多。我们将公开基准测试得分背后的每条轨迹都开源:你可以在 trajectories.hcompany.ai 回放每一步,或从 Hugging Face 下载。
在最难的桌面控制(OSWorld 2.0)和 API 使用(AutomationBench)学术基准测试上,Holo4 以极低的单任务成本与前沿模型竞争。


OSWorld 2.0。成本根据每次 Agent 运行的输入和输出 token 量估算。Holo4 按 H Models API 定价(单次运行)。Qwen3.8 27B:取自模型卡得分,成本按我们在阿里云挂牌价运行该模型的 token 量计算。Qwen3.6 35B-A3B:在我们的测试框架中单次运行,按阿里云挂牌价计算,缓存命中按输入价的 20% 计。OpenAI 发布数据提供 GPT 和 Opus 的全力搜索得分;其他闭源和开源权重模型的分数取自官方 OSWorld 2.0 排行榜。发布版本、测试框架和任务子集存在差异。图线连接的是闭源模型中未被(成本更低的模型)支配的得分-成本点对;Holo4 未纳入。
AutomationBench。Holo4、Qwen3.8 27B 和 Qwen3.6 35B-A3B:基于 AutomationBench v1.0.6,分数和成本在我们的内部测试框架中测量。其他模型:公开集分数取自 AutomationBench README,单任务成本取自官方排行榜(官方在私有集上运行)。私有集评测完成后我们将公布 Holo4 在其上的成绩。
在 Agentic Task Factory 生成的环境和任务上训练,Holo4 模型在专业软件上表现优异。以下示例将 Holo4 27B 与其基座模型 Qwen3.8 27B 进行对比。两款模型使用相同的 prompt 和测试框架。
在 FreeCAD 中构建埃菲尔铁塔的 3D 模型,比例为 1 mm 对应 1 米,以原点为中心,X 轴和 Y 轴对齐。按以下设计构建。
铁塔在每个高度上都是方形截面,绝非圆形。以中心轴到角点的半宽度衡量:地面处为 62.5 mm,高度 57 处为 32.5 mm,高度 115 处为 17.5 mm,高度 276 处为 9.35 mm。在这些高度之间,半宽度遵循一条平滑曲线——靠近地面处曲线陡峭,越高越平缓,绝非直线。
四条相同的塔腿,每条占一个象限,每条都是方形柱体,其外角沿着上述轮廓延伸。每条塔腿在地面处宽 14 mm,到高度 276 处收窄至 4 mm。塔腿从地面到第一层平台处彼此分开,随高度上升逐渐靠拢。塔腿之间不填充任何东西:铁塔是镂空的,从每一侧都能直接看穿。
三层平台,每层都是实心方形板,以轴心为中心:高度 57 处,边长 72 mm、厚 4 mm;高度 115 处,边长 40 mm、厚 3 mm;高度 276 处,边长 22 mm、厚 3 mm。
一根天线,从高度 276 到 324,方形,底部宽 8 mm,顶端收窄至 2 mm。
每个部件都必须是具有非零体积的闭合实体,且任何部件不得填充塔腿之间的空间。
Holo4 27B(84 次调用,1.3M token)
Qwen3.8 27B(60 次调用,1.0M token)
在 FreeCAD 中用 3D 建模构建 H 公司 logo:一个实心填充的圆盘和一个块状无衬线大写字母 H,两者具有相同的厚度、相似的高度,且相互分离不重叠,圆盘的中心与 H 的中间对齐。将两个形状都设为黑色。
Holo4 27B(94 次调用,1.5M token)
Qwen3.8 27B(118 次调用,1.9M token)
在 Godot 中构建一个类 Pac-Man 游戏并使其运行。
一个矩形迷宫,墙壁按网格排列,通道中布满豆粒。一个玩家标记沿着通道持续移动,吃掉经过的每一颗豆粒并为此得分。三只幽灵也在同一通道中追逐玩家。如果幽灵抓住玩家,玩家失去一条命,一切重置到初始位置。分数和生命数显示在屏幕上。
没人会来玩这个。玩家自行用简单启发式驱动:每个岔路口向最近的豆粒移动,除非幽灵很近,此时向远离幽灵的方向移动。游戏必须无人值守地持续运行,完全不需要键盘输入。
当正常运行后,启动游戏并让它自己运行。
Holo4 27B(68 次调用,2.4M token,268 行代码)
Qwen3.8 27B(197 次调用,11.4M token,327 行代码)
我们的内部 Agentic Pipeline 构建了一套交互环境和可验证任务,仅从文档出发,例如真实网站的截图或开源软件。目前已产出约 10,000 个任务,涵盖 Web 应用、MCP 服务器和桌面环境,其中包括同时通过 GUI 和 MCP 暴露同一状态的混合环境。


在训练的同时,我们重建了测试框架——即执行模型动作并在数百步中管理其上下文的循环——参考了 Agent 在 OSWorld 2.0 上的表现反馈。被标记了每个任务失败的原因,工程师审查了对应的修复方案。最大的改动是:为 Agent 提供可靠的记忆能力以追踪数百步的执行,以及在桌面机器本身上提供一个 shell。

Opus 5(70.2%)和 GPT-5.6 Sol(66.2%)使用了 OpenAI 发布图表中 v2026.08.08 离线集的最大努力部分奖励,体现在成本-性能图中。其他参考分数取自模型卡和官方排行榜。任务发布版本、子集和测试框架存在差异。
我们的后训练栈旨在适配新的基座模型并产出能跨接口和跨环境泛化的 Agent。作为 NVIDIA Nemotron Coalition 的成员,我们将最新技术栈应用于 Nemotron 3 Nano Omni 模型,作为 Holotron 3 的后续迭代。
同一套方案将 Nemotron 3 Nano Omni 转化为 Holotron4 Nano——一款通用 Agent 模型,在 GUI 工作流以及暴露 MCP、API 或代码沙箱的环境中相比基座模型有显著提升。

图中的增益是相对 Nemotron 3 Nano Omni 的绝对百分点提升。
这些增益表明我们的方案迁移效果良好,可以将通用模型转化为 Agent 专家。其中没有任何环节是尺寸特定的。
两款规格均已上线 H Models API。权重已在 Hugging Face 发布,格式包括 BF16、FP8、NVFP4 和 4-bit GGUF,旁边是我们的小模型 Holotron4 Nano。
我们将在未来几天内发布优化过的 DSpark drafter 检查点,以进一步加速推理。