前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9013
  • 企业级AI代理界面设计:让记忆成为第一公民
  • OpenAI代理绕过限制:通过DNS隧道实现隐蔽通信
  • IDE 不够用:构建 Agentic 开发环境 ADE
  • Agent 记住了修复方案却错了:AfterTrace 事件恢复工具
  • 代理工具调用经济学:告别靠猜
  • OpenAI代理利用Google安全游戏漏洞抓取UN数据
  • 小米 MiMo-V2.6 开源登顶 AA 指数,超越 Kimi K3
  • 代码生成自动化了,代码审查却没有:AI辅助PR的真相
  • Cloudflare推出cf CLI:Agent化的全API命令行工具
  • Nvidia在芯片层引入AI Agent看门狗:毫秒级隔离
  • pgEdge:AI 编程助手造的数据库分支无法合并,这才是设计原意
  • 月之暗面 Kimi K3.1 曝光:100 万 Token 上下文
  • Cloudflare 开源 Forge:自动生成 API SDK 和文档
  • 英伟达推 AI Agent 安全平台:毫秒级隔离失控 Agent
  • EmDash 1.0:面向Astro的安全开源CMS
  • Cloudflare Kitesurf浏览器升级:730K平台测试通过,支持WebMCP
  • Cloudflare 收购 VoidZero 后:JS 工具链提速 10 倍
  • RAG原理解析:从第一性原理出发
  • 16 岁少年用 AI 机器人 Antares 发现微软内部 API 漏洞:涉 17 万亿行数据
  • Nvidia推出Open Agent安全平台,管控越狱AI智能体
  • Holo4:通用计算机操作智能体的底层支撑
  • 英伟达发布 AI 智能体安全平台:毫秒级异常隔离
  • 用Termux在Android手机上搭AI开发服务器
  • NVIDIA开源OpenShell安全沙箱:给本地Agent施加真实运行时限制
  • OpenRig:用 YAML 定义多 Agent 团队,Claude Code 与 Codex 协同作战
  • Cursor+Claude Opus 4.6误删Railway生产数据库的完整事故报告
  • 官方发布Claude Opus 5.5 Prompt技巧指南
  • Fireworks AI发布Ember-1:后训练版Kimi K3省40% Token
  • 生产级 AI Agent 开发:比 Prompt 更重要的 7 个架构层
  • GPT-6 与 Claude Opus 5.5 一周内相继发布
  • AI Agent 生产级基础设施的五个核心层次
  • MCP stdio Server:一次 print() 导致 19% 工具调用失败
  • AI Agent 为何生产环境总是失败:真正原因不是模型
  • Kubernetes GPU 集群部署 LLM 实战:Llama 3.3 70B 和 DeepSeek R1
  • 生产环境常青的开源 LLM:没人谈但一直出现
  • 多语言LLM推理优化:tokenize是首个瓶颈
  • 三个「成功」却实际失败的Bug:HTTP 200不等于正确
  • TypeSafe AI Jev:20个Agent生产级用例实测
  • AI智能体记忆衰减的诊断与处理指南
  • 用LLM Agent自动化TLS证书过期巡检
  • Langflow 关键代码执行漏洞:SSRF 绕过直取 root 权限
  • Simon Willison 深度回顾:2026 上半年 LLM 领域关键进展
  • 开源 AI 同事:2FA 密码不进入模型上下文的架构实现
  • Claude 950 个 Agent 发现新酶系统、Devin ARR 超 10 亿美元、阿里发布 V900 芯片
  • Laya: 3亿参数决策引擎替代LLM判断
  • LLM提示注入防护:过滤不可见Unicode字符
  • OpenAI 代理 3 个月内暴力请求 UN 网站 16000 次
  • AI Agent 实际上能从过往运行中学习吗
  • Plugin4Shell:AI 编程工具插件市场的供应链漏洞
  • GPT-6发布当天,OpenAI首席科学家呼吁减速
  • 研究:AI 代理承担模型开发 55% 工作,人类保留 85% 决策权
  • 已加载 51 / 9013
8.0
热点
AI SCORE
技术实践2026-09-28 17:44

Holo4:通用计算机操作智能体的底层支撑

Hugging Face Blog#HuggingFace#Agent#计算机操作
Editor brief · 编辑速览

Hugging Face 博客深入解析 Holo4 项目如何驱动通用计算机操作智能体,提供构建此类智能体的核心技术思路与实现路径。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Holo4 是我们全新的 Agent 系列模型,提供两种规格:27B Dense 和 35B-A3B MoE(混合专家)。两款均已上线 H Models API。同时我们还发布了 Holotron3 的更新版本——Holotron4 Nano。

Holo4 在前代模型基础上构建,通过任何可用接口与软件进行交互:GUI、代码、MCP 和 API。它在学术基准测试中表现优异,但我们打造它的目的是服务于真实的业务工作流。模型通过监督学习和强化学习在大量环境和任务上训练而成,这些环境和任务中包括由我们的 Agentic Task Factory 生成的内容。

🤖 模型:Holo4-27B | Holo4-35B-A3B | Holotron4 Nano

🗂️ 完整合集(FP16、FP8、GGUF):Holo4

🎞️ 轨迹数据:查看器 | 数据集

⚡ H Models API:快速开始

📝 完整博文:hcompany.ai/newsroom/holo4

面向所有接口构建的模型

Holo4 能在屏幕上点击和输入、自行编写和运行代码、调用 MCP 或 API 工具。它根据任务需求选择合适的交互方式。大多数 Agent 模型只针对单一接口训练:专注 GUI 的模型离开屏幕就"失明",而偏好工具调用的模型面对没有 API 的应用就束手无策。现实工作并非如此割裂,一个业务任务往往需要结合不同的交互方式。

Holo4 benchmark results with cost per task, against Qwen3.8 27B and frontier models

Holo4 运行于桌面端、Web 端、Android 端、代码沙箱和业务 API 环境。在每种场景下使用的是同一个模型,调用方式也相同。你不需要为每个平台选择不同的模型。

Holo4 模型相比其 Qwen 基座有显著提升。在长流程工作流上,Holo4 仅次于最强大的闭源模型:在 OSWorld 2.0 上,Holo4 27B 得分为 61.7%,对比 Opus 5.5 的 81.8%;Holo4 35B-A3B 达到 30.9%。然而,Holo4 的参数量级低得多,成本也低得多。我们将公开基准测试得分背后的每条轨迹都开源:你可以在 trajectories.hcompany.ai 回放每一步,或从 Hugging Face 下载。

以极低成本与前沿模型竞争

在最难的桌面控制(OSWorld 2.0)和 API 使用(AutomationBench)学术基准测试上,Holo4 以极低的单任务成本与前沿模型竞争。

OSWorld 2.0: average partial score vs. cost per task

AutomationBench: score vs. cost per task

OSWorld 2.0。成本根据每次 Agent 运行的输入和输出 token 量估算。Holo4 按 H Models API 定价(单次运行)。Qwen3.8 27B:取自模型卡得分,成本按我们在阿里云挂牌价运行该模型的 token 量计算。Qwen3.6 35B-A3B:在我们的测试框架中单次运行,按阿里云挂牌价计算,缓存命中按输入价的 20% 计。OpenAI 发布数据提供 GPT 和 Opus 的全力搜索得分;其他闭源和开源权重模型的分数取自官方 OSWorld 2.0 排行榜。发布版本、测试框架和任务子集存在差异。图线连接的是闭源模型中未被(成本更低的模型)支配的得分-成本点对;Holo4 未纳入。

AutomationBench。Holo4、Qwen3.8 27B 和 Qwen3.6 35B-A3B:基于 AutomationBench v1.0.6,分数和成本在我们的内部测试框架中测量。其他模型:公开集分数取自 AutomationBench README,单任务成本取自官方排行榜(官方在私有集上运行)。私有集评测完成后我们将公布 Holo4 在其上的成绩。

专业软件表现出色

在 Agentic Task Factory 生成的环境和任务上训练,Holo4 模型在专业软件上表现优异。以下示例将 Holo4 27B 与其基座模型 Qwen3.8 27B 进行对比。两款模型使用相同的 prompt 和测试框架。

3D 建模 · 埃菲尔铁塔

在 FreeCAD 中构建埃菲尔铁塔的 3D 模型,比例为 1 mm 对应 1 米,以原点为中心,X 轴和 Y 轴对齐。按以下设计构建。

铁塔在每个高度上都是方形截面,绝非圆形。以中心轴到角点的半宽度衡量:地面处为 62.5 mm,高度 57 处为 32.5 mm,高度 115 处为 17.5 mm,高度 276 处为 9.35 mm。在这些高度之间,半宽度遵循一条平滑曲线——靠近地面处曲线陡峭,越高越平缓,绝非直线。

四条相同的塔腿,每条占一个象限,每条都是方形柱体,其外角沿着上述轮廓延伸。每条塔腿在地面处宽 14 mm,到高度 276 处收窄至 4 mm。塔腿从地面到第一层平台处彼此分开,随高度上升逐渐靠拢。塔腿之间不填充任何东西:铁塔是镂空的,从每一侧都能直接看穿。

三层平台,每层都是实心方形板,以轴心为中心:高度 57 处,边长 72 mm、厚 4 mm;高度 115 处,边长 40 mm、厚 3 mm;高度 276 处,边长 22 mm、厚 3 mm。

一根天线,从高度 276 到 324,方形,底部宽 8 mm,顶端收窄至 2 mm。

每个部件都必须是具有非零体积的闭合实体,且任何部件不得填充塔腿之间的空间。

Holo4 27B(84 次调用,1.3M token)

Qwen3.8 27B(60 次调用,1.0M token)


在 FreeCAD 中用 3D 建模构建 H 公司 logo:一个实心填充的圆盘和一个块状无衬线大写字母 H,两者具有相同的厚度、相似的高度,且相互分离不重叠,圆盘的中心与 H 的中间对齐。将两个形状都设为黑色。

Holo4 27B(94 次调用,1.5M token)

Qwen3.8 27B(118 次调用,1.9M token)

游戏设计 · 吃豆人

在 Godot 中构建一个类 Pac-Man 游戏并使其运行。

一个矩形迷宫,墙壁按网格排列,通道中布满豆粒。一个玩家标记沿着通道持续移动,吃掉经过的每一颗豆粒并为此得分。三只幽灵也在同一通道中追逐玩家。如果幽灵抓住玩家,玩家失去一条命,一切重置到初始位置。分数和生命数显示在屏幕上。

没人会来玩这个。玩家自行用简单启发式驱动:每个岔路口向最近的豆粒移动,除非幽灵很近,此时向远离幽灵的方向移动。游戏必须无人值守地持续运行,完全不需要键盘输入。

当正常运行后,启动游戏并让它自己运行。

Holo4 27B(68 次调用,2.4M token,268 行代码)

Qwen3.8 27B(197 次调用,11.4M token,327 行代码)

Agentic Task Factory

我们的内部 Agentic Pipeline 构建了一套交互环境和可验证任务,仅从文档出发,例如真实网站的截图或开源软件。目前已产出约 10,000 个任务,涵盖 Web 应用、MCP 服务器和桌面环境,其中包括同时通过 GUI 和 MCP 暴露同一状态的混合环境。

Agentic Task Factory: sources, build, gates, runtime and output

Holo4 training: supervised fine-tuning on 127B tokens, two RL experts, one merged model

测试框架工程

在训练的同时,我们重建了测试框架——即执行模型动作并在数百步中管理其上下文的循环——参考了 Agent 在 OSWorld 2.0 上的表现反馈。被标记了每个任务失败的原因,工程师审查了对应的修复方案。最大的改动是:为 Agent 提供可靠的记忆能力以追踪数百步的执行,以及在桌面机器本身上提供一个 shell。

Automatic harness engineering: OSWorld 2.0 score of every evaluation run over time

Opus 5(70.2%)和 GPT-5.6 Sol(66.2%)使用了 OpenAI 发布图表中 v2026.08.08 离线集的最大努力部分奖励,体现在成本-性能图中。其他参考分数取自模型卡和官方排行榜。任务发布版本、子集和测试框架存在差异。

Holotron4 Nano

我们的后训练栈旨在适配新的基座模型并产出能跨接口和跨环境泛化的 Agent。作为 NVIDIA Nemotron Coalition 的成员,我们将最新技术栈应用于 Nemotron 3 Nano Omni 模型,作为 Holotron 3 的后续迭代。

同一套方案将 Nemotron 3 Nano Omni 转化为 Holotron4 Nano——一款通用 Agent 模型,在 GUI 工作流以及暴露 MCP、API 或代码沙箱的环境中相比基座模型有显著提升。

Holotron4 Nano vs. Nemotron 3 Nano Omni across five benchmarks

图中的增益是相对 Nemotron 3 Nano Omni 的绝对百分点提升。

这些增益表明我们的方案迁移效果良好,可以将通用模型转化为 Agent 专家。其中没有任何环节是尺寸特定的。

即将到来

两款规格均已上线 H Models API。权重已在 Hugging Face 发布,格式包括 BF16、FP8、NVFP4 和 4-bit GGUF,旁边是我们的小模型 Holotron4 Nano。

我们将在未来几天内发布优化过的 DSpark drafter 检查点,以进一步加速推理。


Original source

本文由 AI 翻译整理自 Hugging Face Blog,原文版权归原作者所有。

阅读英文原文
上一篇
Nvidia推出Open Agent安全平台,管控越狱AI智能体
下一篇
英伟达发布 AI 智能体安全平台:毫秒级异常隔离