Nvidia的AVO通用编程智能体系统可显著提升Claude Opus 5在ARC-AGI-3基准上的表现,框架选型对AI模型实际效果影响巨大。
Nvidia 于 2026 年 3 月下旬首次推出了名为 Agentic Variation Operators(AVO)的通用编程 Agent 系统。目前该公司已披露了其架构以及使 AVO 能够维持长时间自主运行的一系列系统级机制,并将该系统应用于开放平台高级 AI 推理基准测试 ARC-AGI-3。
在上周五发布的一篇团队博客中,五位 Nvidia 软件工程师、机器学习专家和 AI 研究实习生描述了 AVO 如何将 Claude Opus 5 在 ARC-AGI-3 上的报告基准分数从 30.2% 提升到 100%——前提是将其作为完整 AVO Agent 系统的一部分运行。
"这一结果表明,系统设计——而非单纯的模型能力——可以解锁前沿级别的长时域性能,"团队在博客中写道。
AVO 从 Agent 架构的核心 DNA 演进而来,处理与代码检查与编辑、命令执行、文档查阅以及通过执行验证工作相关的 Agent 架构任务。AVO 的突出特点据称是跨扩展性、多步骤任务实现"持续上下文内自主运行"。
非营利性 AI 研究与基准测试机构 ARC Prize 在今年 7 月的一篇分析文章中报告了 Claude Opus 5 在高推理努力下于 ARC-AGI-3 公共环境与任务集上取得的 30.2% 分数。根据 ARC Prize 的说法,这"展示了强大的逻辑推理能力";当 Claude Opus 5 以 Max 推理努力运行时,在 ARC-AGI-1 上得分为 97.5%,在 ARC-AGI-2 半私有集上得分为 90.4%。
ARC-AGI-3 基准测试使用 Relative Human Action Efficiency(RHAE)指标,该指标将任务完成情况与相对于首次人类基准的每级动作效率相结合,跨不同级别和环境聚合性能。
"AVO 在 ARC-AGI-3 公共集全部 25 个环境中取得了 100.00 RHAE 分数,完成了全部 183 个级别。这一结果说明了一个更广泛的观点:评估一个模型不同于评估一个 Agent。模型能力至关重要,但围绕模型构建的系统决定了该能力能否有效地转化为持续的自主进展,"由首席工程师 Terry Chen 领导的 Nvidia 博客团队表示。
"模型能力至关重要,但围绕模型构建的系统决定了该能力能否有效地转化为持续的自主进展。"
AVO 首次亮相是在困难的软件工程和 GPU 内核优化任务上。在这项工作中,AVO 用一个自主 Agent 取代了 Chen 和团队所描述的"传统进化搜索系统的预定义变异步骤",由该 Agent 决定如何生成下一个候选——即检查什么、修改什么、测试什么、提交什么。
团队以此作为基础研究基石,随后将其推进到 ARC-AGI-3 基准测试。
"Nvidia 团队指出:"GPU 内核优化和 ARC-AGI-3 基准测试表面上看非常不同。一个涉及源代码、编译器、性能分析器和吞吐量。另一个则涉及不熟悉的交互式环境,Agent 必须在其中推断可用动作的效果、发现目标,并以足够高效的行动来实现进展。但底层的计算模式是相似的。"
在这两种场景中,Agent 都必须:
保留状态和进展、修正过往的错误假设、以及在超出单个模型上下文窗口的长时域任务上工作——面对系统前方的"不完整图景"——需要 AVO 中存在两个特定机制:持久记忆和监督。
"保留状态和进展,[以及] 在超出单个模型上下文窗口的长时域任务上工作,面对系统前方的'不完整图景',需要两个特定机制的存在:持久记忆和监督。"
持久记忆用于向前传递先前的实现、评估结果、编译器和性能分析器输出,以及积累的推理。它允许 Agent 从当前状态恢复,而不必反复重建搜索——这正是 Chen 和团队将其奉为圣杯的那种"持续自主进展"。
监督同样关键;一个监督者(AVO 系统内的一个程序化软件模块,而非人类)监控更广泛的搜索轨迹,并能在进展停滞时进行干预。
AVO 还设计为可跨前沿模型运行。虽然团队完整的公共集结果使用了 Claude Opus 5,但此外他们还将 AVO 与 GPT-5.6 Sol 配对,在被归类为"具有挑战性的游戏子集"上进行了进一步实验。在这些测试中,Sol 在若干情况下以墙钟时间更快地达到了匹配级别,而 Opus 在匹配级别比较中使用了更少的环境动作。
听起来可能有些古怪的术语——墙钟时间(顾名思义)指的是人类所体验到的真实世界时间。它不同于 CPU/GPU 时间,后者可以除以多个核心(例如 8 核),使得 80 秒的计算时间变成 10 秒的墙钟时间。
"Chen 和团队指出:"这些初步结果表明跨模型具有互补的操作特性,我们将更广泛的系统性比较留待未来工作。"这些结果覆盖了使用官方评分表和 RHAE 指标的 25 环境 ARC-AGI-3 公共集。它们不是半私有或完全私有竞赛集上的结果。"
这些工程师表示,最重要的结果不仅仅是 100.00 分数,而是同一 Agent 架构从高度专业化的 GPU 内核优化迁移到截然不同的交互式推理任务这一事实。
团队提醒我们,在 GPU 优化中,反馈来自编译器、测试、性能分析器和性能基准。在 ARC-AGI-3 中,反馈来自环境转换和动作结果。这意味着本质上接口不同,但循环是相同的——即循环致力于形成假设、行动、观察证据、更新状态并继续。
"Nvidia AI 团队总结道:"这表明通用性不仅可能来自领域知识,还来自允许推理和反馈随时间复合的机制。更广泛地说,长时域能力是整个系统的属性。记忆决定什么得以存活,工具决定什么动作成为可能,反馈使进展有根基,而恢复机制使工作能够在单次模型调用之外继续。"
Nvidia 博客团队成员包括:上述的 Terry Chen、Nvidia 竞争性机器学习总监兼杰出工程师 Jean-Francois Puget、高性能 AI 副总裁 Humphrey Shi,以及 AI 研究实习生 Yeyin(Eva)Zhu 和 Zhifan Ye。
团队的最后结论重中了本次研究的核心:模型很重要,但模型不是整个 Agent。