前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8629
  • 用四象限图判断 AI 技术价值
  • 企业级 MCP 应用案例分析
  • AI 术语速成手册
  • Meta AI 失控事件警示录
  • Google AI Studio 快速编程秘诀
  • 轻量级TTS模型库:25MB以内可直接嵌入
  • 用Markdown声明式构建生成式UI交互
  • OpenAI收购Astral:Python工具栈并购
  • OpenAI官宣收购Astral团队
  • Cook:编排Claude Code的轻量级CLI工具
  • Cursor Composer 2:前沿级AI编码能力升级
  • 无需训练!复制LLM参数层突破推理瓶颈
  • Claude Code 在工程领域的实战应用
  • AI 生成代码的保修和法律困境
  • Google Sashiko:Agent 式 AI 审查 Linux 内核
  • AI 生成代码引入的新型技术债
  • Colab MCP Server:AI Agent 的新连接方式
  • 自主运行的 Claude Code Agent:从工具到自主系统
  • Hugging Face 2026 春季开源生态报告
  • Antfly:用 Go 构建分布式多模态搜索系统
  • Holotron-12B:高吞吐量计算机自动化 Agent
  • 用 AI 自动生成技术规范文档
  • 用 MCP 为 AI 知识库接入 Notion
  • Claude Code Skills 官方实战指南:9 大类型与分发策略
  • Mistral 开源形式验证 Agent:提升代码可信性
  • 用 Claude Code Skills 完整开发 Godot 游戏
  • Apideck CLI:低消耗的 AI Agent 接口方案
  • 智能体工程进阶:从 Tab 补全到 Agent 团队的 8 个等级
  • LLM 架构可视化库:全景理解模型设计
  • Claude合作伙伴网络启动
  • Claude使用优惠活动
  • GitAgent:仓库变身AI代理的开放标准
  • Claude在3D创意工作中的实战技巧
  • Spine Swarm:可视化画布上的AI Agent编排
  • 大规模识别LLM的神经元交互机制
  • Claude Code与其他LLM的网关集成指南
  • VS Code官方:AI在自身开发流程中的应用
  • Understudy:演示一次即可教会的桌面Agent
  • OneCLI:生产级的AI Agent密钥管理库
  • Claude 新增交互式图表和可视化功能
  • AI 行业现状与未来走向分析
  • Axe:12MB 轻量级二进制替代重型 AI 框架
  • Rudel:Claude Code 会话分析工具
  • RAG 系统的文档投毒攻击与防御方案
  • AI Agent 不需要复杂框架,简化优于重构
  • LLM 模型合并效率是否真的在改进
  • LLM 时代如何构建可靠的软件系统
  • Claude Code 权限守卫:精细化控制 AI 执行权限
  • 用 MCP 和 Keycard 构建日程规划 Agent 的实践指南
  • 网页变化监测工具:将动态内容转换为 RSS 订阅
  • Klaus:虚拟机一键部署的 AI 编程工作环境
  • 已加载 51 / 8629
8.0
热点
AI SCORE
模型发布2026-03-17 20:33

Holotron-12B:高吞吐量计算机自动化 Agent

Hugging Face Blog#Agent#计算机自动化#模型
Editor brief · 编辑速览

Holotron-12B 模型专门优化 GUI 自动化任务,支持高并发 Agent 应用,推进 Computer Use 能力落地

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

我们很高兴发布 Holotron-12B,这是来自 H Company 的多模态计算机使用模型。Holotron-12B 基于开源的 NVIDIA Nemotron-Nano-2 VL 模型进行了后训练,使用了 H Company 专有的数据混合集,是我们研究实验室之间密切协作的成果,旨在设计一种新型模型,主要针对生产环境中的规模和性能进行优化。

H Company 是 NVIDIA 孵化计划的一部分。

该模型现已在 Hugging Face 上提供。

当今大多数多模态模型主要针对静态视觉或指令跟随进行优化。但 Holotron-12B,就像我们的 Holo2 模型一样,有不同的目标:充当计算机使用 Agent 的策略模型,这些 Agent 必须在交互式环境中高效地感知、决策和行动。

使用 Holotron-12B,我们希望创建一个能够在生产环境中高效扩展的模型,同时能处理包含多张图像的长上下文,并在 Agent 基准测试中表现出色。NVIDIA Nemotron 模型在推理方面提供了坚实的基础,通过开发 Holotron-12B,我们展示了通过进一步训练该模型能够实现多少成就。

混合 SSM 架构的高吞吐量推理

Holotron-12B 推理效率的显著提升得益于其基础的 Nemotron 架构,该架构采用了混合状态空间模型(SSM)和注意力机制。与纯粹基于 Transformer 的模型不同,这种设计针对高吞吐量服务进行了优化。状态空间模型通过避免完整注意力机制相关的二次方计算成本,为长上下文推理提供了优越的可扩展性,特别有利于涉及多张图像和冗长交互历史的 Agent 工作负载。在推理方面,SSM 的主要贡献是显著降低的内存占用:虽然标准注意力机制为每个令牌和层存储 K 和 V 激活(臭名昭著的 KV 缓存),但 SSM 是线性递归模型,每层每个生成序列仅存储一个恒定状态,与序列长度无关。

在 WebVoyager 基准测试中评估时,该模型在真实世界的多模态 Agent 工作负载中表现卓越,该工作负载具有长上下文、多张高分辨率图像以及 100 个基准工作线程的高请求并发。在单个 H100 GPU 上运行,使用 vLLM 和最新的 SSM 优化(v0.14.1),Holotron-12B 相比 Holo2-8B 实现了超过 2 倍的吞吐量提升。这使 Holotron-12B 成为吞吐量受限工作负载(如数据生成、标注和在线强化学习)的理想选择。

在受控的实验设置中(见图 2),Holotron-12B 随着并发增加而继续高效扩展,总令牌吞吐量在最大并发 100 时稳定上升至 8.9k tokens/s。相比之下,Holo2-8B 的总令牌吞吐量上升得更快,在 5.1k tokens/s 时迅速达到平台期。这种行为突出了 Nemotron 架构的一个关键优势,即更有效和高效的 VRAM 利用,以及更小的整体内存占用,这使得在相同硬件上能实现更大的有效批次大小。即使在大批次大小下,Holotron-12B 仍保持强劲的吞吐量。

训练和评估 Holotron-12B

Holotron-12B 经过两个阶段的训练。我们从 NVIDIA 发布的多模态基础模型 Nemotron-Nano-12B-v2-VL-BF16 开始。随后我们在 H Company 专有的本地化和导航数据混合集上进行了监督微调,重点关注屏幕理解、定位和 UI 级交互。

最终检查点经过约 140 亿个令牌的训练。

在计算机使用和导航基准测试中,Holotron-12B 相比 Nemotron 基础模型显示出强劲的改进,与已建立的 Agent 模型相比性能强劲。其 WebVoyager 性能从 35.1% 提升至 80.5%,超过了 Holo2-8B 在该基准测试上的性能,说明该模型在 Agent 设置中能够有效执行。

定位基准

Holotron-12B 在定位和定位基准(如 OS-World-G、GroundUI 和 WebClick)上也相比基础 Nemotron 模型有了实质性改进。

Holotron-12B 证明,当与正确的训练设置和基础设施工作相结合时,NVIDIA Nemotron VL 模型为真实世界的多模态 Agent 提供了坚实的基础。

该模型提供了强劲的 Agent 性能、显著改进的推理吞吐量,以及清晰的未来改进路径,特别是在更高分辨率视觉训练方面。

我们期待看到他人用 Holotron-12B 构建的项目。该模型和检查点现已在 Hugging Face 上提供,采用 NVIDIA 开放模型许可证。

NVIDIA 今日宣布发布 Nemotron 3 Omni。基于 Holotron-12B 的成功,我们正在准备对这一新代多模态模型进行后训练。通过利用 Nemotron 3 系列增强的混合 SSM-注意力和 MoE 架构基础,我们致力于通过新发布的 Nemotron 3 Omni 在推理能力和多模态精度上实现更大的飞跃。随着这一发展将 Holotron 从研究推向商业应用,它将为企业提供大规模自主"计算机使用"部署所需的高吞吐量、低延迟性能。

更多来自本作者的内容

Holo3.1:快速和本地计算机使用 Agent

认识 HCompany 的 HoloTab。您的 AI 浏览器伴侣。

· 登录或注册以发表评论

Original source

本文由 AI 翻译整理自 Hugging Face Blog,原文版权归原作者所有。

阅读英文原文
上一篇
Antfly:用 Go 构建分布式多模态搜索系统
下一篇
用 AI 自动生成技术规范文档