前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
原理篇
面经篇
AI 面试
自检篇
每日一题
  • 综合
    • 综合题型
    • 其他问题
    • 设计模式
    • 思维导图
    • 学习路线
  • 前端基础
    • HTTP
    • 浏览器
    • 计算机基础
  • 进阶学习
    • NPM工作流
    • Docker
    • Canvas
    • Node学习指南
    • 前端综合文章
  • 其他
    • Handbook
    • 职场话题
    • CSS可视化
小程序题库
公众号动态
博客动态
AI 热点
开发者导航
基础篇
进阶篇
高频篇
精选篇
手写篇
原理篇
面经篇
AI 面试
自检篇
每日一题
  • 综合
    • 综合题型
    • 其他问题
    • 设计模式
    • 思维导图
    • 学习路线
  • 前端基础
    • HTTP
    • 浏览器
    • 计算机基础
  • 进阶学习
    • NPM工作流
    • Docker
    • Canvas
    • Node学习指南
    • 前端综合文章
  • 其他
    • Handbook
    • 职场话题
    • CSS可视化
小程序题库
公众号动态
博客动态
AI 热点
开发者导航
返回 AI 情报前线
All News · 全部资讯4035
  • Claude Code 凭据遮蔽上线检查清单
  • 模型价格战加速,推理成本大幅下探
  • Qwen 3.8更多尺寸规格即将发布
  • 模型行为漂移拖垮编码Agent系统
  • MiniMax H3 开源,Qwen3.8-Max 登场
  • 生产级 Agent 需要执行结果闸门
  • Vercel AI Gateway大幅折扣:DeepSeek V4 Flash低至一折
  • 图像生成 API 选型应计算有效成本
  • 别做AI输出的无脑转发器
  • Claude各产品的记忆机制全景
  • Copilot云端Agent支持调节推理强度
  • 为 Claude Code 与 Codex 添加本地记忆
  • Agent评估分数陷阱:理想eval环境vs生产故障模式
  • Claude 接入 Telegram:两种 MCP 认证方案与安全权衡
  • Claude模型意外黑进真实公司:AI安全测试的真实风险
  • Python 快速构建 Telegram 网站监控机器人
  • GitHub Copilot企业版支持团队级配置
  • 千问3.8-Max正式发布:2.4T参数MoE与1M上下文
  • 邮件触发 AI Agent 的五大工具对比
  • 搭建多模态视觉模型自动评测流水线
  • InAgent破90%:系统工程驱动Agent新高
  • 阿里 Qwen3.8-Max 开源权重即将发布
  • AirLLM 让 70B 模型跑进 4GB 显存:从原理到实战
  • LLM 概念链式学习:依赖顺序的完整词汇表
  • 生产级 Multi-Agent 系统的 4 层架构
  • 阿里发布 Qwen 3.8-Max,自进化 Agent 16 天自主开发系统
  • 人脸识别系统安全认证陷阱:"通过认证"不等于"持续安全"
  • SRE角度的LLM部署指南:从理解工作负载开始
  • Google AI工具完全导航:AI Studio、Gemini Enterprise Agent等工具对照指南
  • AI Avatar 中的幻觉防控实战方案
  • 推理工程大师课:自回归和扩散模型的部署优化
  • 开源:Agent 工作流完成状态检查工具
  • Prompt Injection 的根本症结:授权架构缺陷
  • 用 NumPy 实现 Transformer 自注意机制可视化
  • 多个 Claude Code Agent 通过 Discord 协作实战
  • MCP 服务器高工具数优化:渐进式披露架构
  • AI代码审查工具陷阱:无状态导致重复评论
  • CLAUDE.md指南:如何识别真正值得的指令
  • 用 XML 标签结构化 Prompt 提升 LLM 输出质量
  • 用 Evals 测试 AI Agent 行为正确性的实践
  • AI 应用成本优化:廉价过滤优先策略
  • 时区陷阱速查表 + 开源 MCP:16+ 时间戳工具
  • npm 供应链 RAT 攻击:阿里开发者中招 3 月
  • Claude 使用效能倍增:6 个实战提示技巧
  • AI Agent 与 LLM 应用的生产安全防护指南
  • 如何识别虚假/AI 生成的安全漏洞报告
  • AWS将Superblocks vibe-coding工具嵌入企业私有云
  • Agent 内存架构实践:存什么、取什么、忘什么
  • MCP 服务暴露数据缺陷:AI agent 盲目信任虚假关系对
  • MCP 实战:为 PDF 工具集构建 Agent 接口
  • 自托管 AI agent:SQLite 低成本长期记忆架构
  • 已加载 51 / 4035
8.0
热点
AI SCORE
模型发布2026-08-04 06:26

InAgent破90%:系统工程驱动Agent新高

dev.to · AI#Agent技术#计算机使用#基准测评
Editor brief · 编辑速览

InAgent在OSWorld基准达90.2%创新高,系统级任务100%成功率超OpenAI/Google/Anthropic。核心驱动是工程设计而非原始模型能力。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

InAgent 在 OSWorld 上取得了 90.2% 的成绩,首次突破 90%,其中系统级任务成功率达到 100%,超过了 OpenAI、Google 和 Anthropic 的纪录。推动这一成绩的并非模型的原始能力,而是 Harness 工程。

2026 年 7 月,InAgent 在 OSWorld 上取得 90.2% 的成绩,成为首个突破 90% 的计算机操作 Agent。这款中国 Agent 在同一基准测试上的表现超过了 OpenAI、Google 和 Anthropic 已公开的纪录。

  • OSWorld 任务成功率达到 90.2%,首次突破 90%
  • 系统级任务成功率达到 100%
  • 超过 OpenAI、Google 和 Anthropic 的纪录
  • 仅进行了一次运行;未披露不同随机种子的结果波动
  • Harness 工程是取得这一成绩的关键

据 Pandaily 报道,2026 年 7 月,InAgent 在 OSWorld 上取得了 90.2% 的任务成功率,成为首个突破 90% 的计算机操作 Agent。该 Agent 在系统级任务中实现了 100% 的成功率,而这一类别历来会显著拉低前沿模型的整体表现。OSWorld 通过屏幕截图以及键盘、鼠标操作,衡量 Agent 完成文件操作、网页浏览、应用程序控制等真实计算机任务的能力。

InAgent 在 OSWorld 上取得了 90.2% 的成绩,首次突破 90%,系统级任务成功率达到 100%,超过了 OpenAI、Google 和 Anthropic 的纪录。

推动这一成绩的并非模型的原始能力,而是 Harness 工程。

Harness 为何如此重要

这个亮眼的数字掩盖了背后更具结构性意义的变化:前沿模型之间的差距已经缩小到一定程度,如今决定基准测试排名的,是围绕模型搭建的 Scaffold。Harness 工程——也就是负责规划、验证以及从错误中恢复的代码——已经成为 AI 竞争的新前沿。InAgent 的 90.2% 并不主要是模型本身的胜利,而是系统工程的胜利。

这与 Supabase 的 evals 基准测试在 2026 年 8 月展示的结果如出一辙:真实场景中的 Agent 表现,与工具和编排能力的相关性,要高于模型的原始能力。Claude Code 在该测试中的出色表现,来自它的 Scaffolding,而不只是 Claude 的模型权重。InAgent 在一个难度更高、标准化程度也更高的基准测试上,再次印证了这一规律。

纪录背后的数字

What Screen Agent’s #1 OSWorld ranking means for UI automation i…

90.2% 这个数字来自单次运行。消息来源并未披露不同随机种子下的结果波动情况。对于随机采样可能导致成绩上下浮动数个百分点的基准测试而言,这是一个不容忽视的信息缺失。OSWorld 的系统级任务要求 Agent 完成安装软件、配置设置等多步骤操作,也是大多数 Agent 最容易失败的部分;相比之下,InAgent 在该类别中取得 100% 的成功率,才是更令人印象深刻的数字。

此前 OSWorld 上公开的最高纪录均低于 90%。OpenAI、Google 和 Anthropic 都发布过计算机操作 Agent,但没有一家突破这一门槛。就这项特定指标而言,InAgent 的成绩让这家中国实验室处于领先位置。不过,该基准测试的覆盖范围较窄:OSWorld 衡量的是桌面端任务,并未涵盖这些公司所竞争的全部企业工作流场景。

接下来可以关注 InAgent 是否会公布不同随机种子下的结果波动数据,或发布后续论文,详细介绍其 Harness 架构。同时,也值得观察 OpenAI、Google 或 Anthropic 是否会在未来两个季度内交出超过 90% 的 OSWorld 成绩——如果它们作出回应,将进一步证明 Harness 工程已经成为新一轮军备竞赛的焦点。

最初发布于 gentic.news。

如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
搭建多模态视觉模型自动评测流水线
下一篇
阿里 Qwen3.8-Max 开源权重即将发布