InAgent在OSWorld基准达90.2%创新高,系统级任务100%成功率超OpenAI/Google/Anthropic。核心驱动是工程设计而非原始模型能力。
InAgent 在 OSWorld 上取得了 90.2% 的成绩,首次突破 90%,其中系统级任务成功率达到 100%,超过了 OpenAI、Google 和 Anthropic 的纪录。推动这一成绩的并非模型的原始能力,而是 Harness 工程。
2026 年 7 月,InAgent 在 OSWorld 上取得 90.2% 的成绩,成为首个突破 90% 的计算机操作 Agent。这款中国 Agent 在同一基准测试上的表现超过了 OpenAI、Google 和 Anthropic 已公开的纪录。
据 Pandaily 报道,2026 年 7 月,InAgent 在 OSWorld 上取得了 90.2% 的任务成功率,成为首个突破 90% 的计算机操作 Agent。该 Agent 在系统级任务中实现了 100% 的成功率,而这一类别历来会显著拉低前沿模型的整体表现。OSWorld 通过屏幕截图以及键盘、鼠标操作,衡量 Agent 完成文件操作、网页浏览、应用程序控制等真实计算机任务的能力。
InAgent 在 OSWorld 上取得了 90.2% 的成绩,首次突破 90%,系统级任务成功率达到 100%,超过了 OpenAI、Google 和 Anthropic 的纪录。
推动这一成绩的并非模型的原始能力,而是 Harness 工程。
这个亮眼的数字掩盖了背后更具结构性意义的变化:前沿模型之间的差距已经缩小到一定程度,如今决定基准测试排名的,是围绕模型搭建的 Scaffold。Harness 工程——也就是负责规划、验证以及从错误中恢复的代码——已经成为 AI 竞争的新前沿。InAgent 的 90.2% 并不主要是模型本身的胜利,而是系统工程的胜利。
这与 Supabase 的 evals 基准测试在 2026 年 8 月展示的结果如出一辙:真实场景中的 Agent 表现,与工具和编排能力的相关性,要高于模型的原始能力。Claude Code 在该测试中的出色表现,来自它的 Scaffolding,而不只是 Claude 的模型权重。InAgent 在一个难度更高、标准化程度也更高的基准测试上,再次印证了这一规律。

90.2% 这个数字来自单次运行。消息来源并未披露不同随机种子下的结果波动情况。对于随机采样可能导致成绩上下浮动数个百分点的基准测试而言,这是一个不容忽视的信息缺失。OSWorld 的系统级任务要求 Agent 完成安装软件、配置设置等多步骤操作,也是大多数 Agent 最容易失败的部分;相比之下,InAgent 在该类别中取得 100% 的成功率,才是更令人印象深刻的数字。
此前 OSWorld 上公开的最高纪录均低于 90%。OpenAI、Google 和 Anthropic 都发布过计算机操作 Agent,但没有一家突破这一门槛。就这项特定指标而言,InAgent 的成绩让这家中国实验室处于领先位置。不过,该基准测试的覆盖范围较窄:OSWorld 衡量的是桌面端任务,并未涵盖这些公司所竞争的全部企业工作流场景。
接下来可以关注 InAgent 是否会公布不同随机种子下的结果波动数据,或发布后续论文,详细介绍其 Harness 架构。同时,也值得观察 OpenAI、Google 或 Anthropic 是否会在未来两个季度内交出超过 90% 的 OSWorld 成绩——如果它们作出回应,将进一步证明 Harness 工程已经成为新一轮军备竞赛的焦点。
最初发布于 gentic.news。
如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。