H Company发布可操控电脑、编写代码、调用MCP/API的开源大模型Holo4,含27B稠密与35B MoE版本,256K上下文,直接操作桌面/Web/Android/API,是计算机控制开源模型的重大突破。
H Company 发布了 Holo4,这是一个面向 AI Agent 的通用计算机操作模型系列。其中一组权重可以在屏幕上点击和输入,还能编写代码、调用 MCP 或 API 工具。Holo4 提供两种规格:Holo4 27B(稠密模型)和 Holo4 35B-A3B(混合专家模型,活跃参数 3B)。两者均支持 H Models API 上的 256K 上下文窗口。
能部署吗?可以。Holo4 35B-A3B 以 Apache 2.0 许可证发布权重,支持商业自托管。Holo4 27B 权重采用 CC BY-NC 4.0 许可证,因此 27B 的商业使用需通过 H Models API。
Holo4 是一个用于计算机操作的视觉-语言模型。Holo4 27B 基于 Qwen3.8-27B 微调而来。Holo4 35B-A3B 构建于 Qwen3.6-35B-A3B。两者均与 H 的开源 hai-agents harness 配合使用。Harness 向模型发送截图和工具执行结果,由模型完成请求的点击、输入、代码编写和工具调用操作。
H Company 瞄准的是一个已知缺口。纯 GUI Agent 没有屏幕就无法工作。当应用程序没有 API 时,工具调用型 Agent 会陷入停滞。Holo4 可运行在桌面端、Web 端、Android 端、代码沙箱和商业 API 上。无论哪个平台,调用的方式和模型都是同一个。
根据 H Company 的基准测试表,Holo4 27B 在 OSWorld 上得分 85.2%,每个任务成本 0.08 美元。其基座模型 Qwen3.8 27B 得分 84.3%,每个任务成本 0.22 美元。在 AndroidWorld 上,Holo4 27B 达到 85.1%。
长流程任务显示了剩余的差距。在 OSWorld 2.0 上,Holo4 27B 得分 61.7%,每个任务成本 1.22 美元。根据 H Company 的数据,Claude Opus 5.5 得分 81.8%,每个任务成本 8.48 美元。在 AutomationBench 上,Holo4 27B 得分 45.4%,每个任务成本 0.05 美元。
需要注意的是,前沿分数来自不同的 harness 和不同的投入程度。此外,AutomationBench 的 600 道公开题目中,有 480 道落在 H Company 收集训练数据的划分中。在这 120 道留出题目上,Holo4 27B 得分 49.3%。H Company 在 trajectories.hcompany.ai 和 Hugging Face 上发布了所有轨迹数据。
Agent 任务工厂:H 的内部管线从文档、截图和真实软件中构建环境和可验证任务。该工厂已生成约 10,000 个任务:4k 个 Web 应用、3k 个 MCP 服务器、3k 个桌面和操作系统任务。一个任务只有在其验证器拒绝接近正确的答案时才能存活。Agent 还必须通过真实界面完成它。
监督微调:SFT 数据集包含 127B tokens。其中约四分之三是成功的 Agent 轨迹:桌面端 45%、Web 端 14%、MCP 和 API 12%、移动端 3%。
2 个 RL expert,1 次合并:异步在线 RL 训练 2 个 LoRA expert。一个负责桌面端和 Web 端。另一个负责终端、MCP 和 API。两者以相等权重合并,不再进行进一步训练。
Harness:H Company 利用 OSWorld 2.0 失败分析重建了 Agent 循环。最大的改动是在数百步操作中实现可靠记忆,以及在桌面机器上运行一个 shell。
H Company 还发布了 Holotron4 Nano,基于 NVIDIA 的 Nemotron 3 Nano Omni,通过 Nemotron Coalition 实现。同样的组合将 OSWorld 从基线模型的 21.0% 提升到 76.3%。
Holo4 27B 价格为每百万 tokens 输入 0.40 美元、输出 3.00 美元。Holo4 35B-A3B 价格为每百万 tokens 输入 0.30 美元、输出 2.00 美元。API 兼容 OpenAI,地址为 https://api.hcompany.ai/v1,参见快速入门。Hugging Face 集合中的权重格式包括 BF16、FP8、NVFP4 和 4-bit GGUF。H Company 提供了使用 vLLM 和 llama.cpp 进行本地推理的文档。H 表示 DSpark drafter 检查点将在未来几天内推出以加速推理。
| 特性 | Holo4 27B | Holo4 35B-A3B | Qwen3.8-27B(基座) | Claude Opus 5.5 | GPT-6 Astra |
|---|---|---|---|---|---|
| 架构 | 27B 稠密 | 35B MoE,活跃 3B | 27B 稠密 | 专有 | 专有 |
| 权重和许可证 | 开源,CC BY-NC 4.0 | 开源,Apache 2.0 | 开源,Apache 2.0 | 闭源 | 闭源 |
| 上下文窗口 | 256K | 256K | 262K 原生,最高 1M | 1M | 1.05M |
| API 价格(每百万 tokens 输入/输出) | $0.40 / $3.00 | $0.30 / $2.00 | 因供应商而异 | $4 / $20 | $10 / $50 |
| 接口 | GUI、代码、MCP、API | GUI、代码、MCP、API | GUI、工具、代码 | 计算机操作、工具 | 计算机和浏览器操作、工具 |
| OSWorld 2.0 得分* | 61.7% | 30.9% | 48.0% | 81.8% | 73.5% |
| OSWorld 2.0 单任务成本* | $1.22 | $0.61 | $3.49 | $8.48 | $9.07 |
| 可自托管 | 仅限非商业 | 是 | 是 | 否 | 否 |
| 来源 | Model card | Model card | Model card | Anthropic 文档 | OpenAI、OpenRouter |
*OSWorld 2.0 数据来自 H Company 新闻室表格。Opus 5.5 在 Anthropic 的 harness 中以最大投入运行。GPT-6 Astra 在 82 道题的离线子集上以最大投入运行。Harness 不同,因此跨厂商行数据仅供方向性参考。
查看技术细节、H Company 的 HuggingFace 集合和 Model API。该项目所有荣誉归研究者所有。还欢迎在 Twitter 上关注我们,别忘了加入我们的 15 万+ ML SubReddit 并订阅我们的通讯。等一下!你用 telegram 吗?现在也可以加入我们了。
想与我们合作推广你的 GitHub 仓库或 Hugging Face 页面或产品发布或网络研讨会等?请联系我们。
Michal Sutter 是数据科学专业人士,拥有帕多瓦大学数据科学理学硕士学位。凭借统计学分析、机器学习和数据工程的坚实基础,Michal 擅长将复杂数据集转化为可操作的洞察。