Nvidia研究证明,通过精细调校配套机制,即使基础模型能力不强,AI Agent也能表现良好且不会失控。
Nvidia 周五发布了一些有趣的新研究,表明在让人工智能完成长周期任务时,马具(harness)——而非底层模型——要重要得多。马具是围绕人工智能模型的软件封装层——它包含工具、内存管理和规则,将原始模型转化为能够自主行动的东西。
简单来说:研究人员仅通过使用针对内存处理优化的自定义马具,并加入一个类似老板的"监督者"组件,就让 Claude Opus 5 在交互式推理基准测试 ARC-AGI-3 中取得了 100% 的分数——这是一组没有说明书的 2D 游戏,模型需要像人类一样弄清楚如何玩并获胜。(这个基准测试让竞争对手前沿实验室 OpenAI 特别头疼。)没有马具的情况下,Opus 5 只得了 30%,但这仍然是所有测试模型中的最高分。
Nvidia 的研究再次表明,尽管模型选择确实重要,但模型本身——作为代理"大脑"的部分——在代理系统中所占的比重比许多人工智能用户想象的要小得多,尤其是对于长周期任务而言。马具才是让模型成为代理的关键:它负责内存、上下文和反馈。
"一般来说,全世界把代理几乎理解为模型的 API,"Nvidia AI 部门产品副总裁(如图)告诉 TechCrunch。但代理实际上远不止于此。"它是模型。它是模型周围的脚手架,也就是我们所说的马具,即它所使用的工具集。它是运行时以及我们赋予它访问权限的相关技能和库。"
长周期任务是指需要将许多决策串联起来、有时跨越数天才能完成工作。这与人工智能只是对提示词给出回应形成对比。研究如何让人工智能执行长周期任务而不分心、不会跑到乌有之乡,是代理研究领域的圣杯之一。
例如:微软 4 月发布了研究,测试了 19 个 LLM 在涉及文档编辑的长周期任务上的表现,发现所有模型——包括前沿模型——都会在文档中填满错误。(如果人类产生这样的工作成果,会立即被解雇。)
模型自行串联决策也曾被发现删除用户的文件,甚至整个数据库,或转向犯罪行为来实现目标——从合谋到黑客攻击。
Nvidia 研究人员选择这个交互式推理基准测试来进行测试特别有意义,几乎有些讽刺。100% 的分数意味着模型能够像人类一样玩通并赢下这些游戏。
OpenAI 对其模型在 ARC-AGI-3 上的糟糕表现(不到 10%)非常苦恼,以至于上个月自己做了研究。和 Nvidia 一样,OpenAI 发现仅通过调整马具上的两个设置,其模型就使分数增加了两倍。
但没有任何模型接近达到 100% 的分数,像 Nvidia 研究人员所实现的那样。他们表明,马具需要一个"监督者"组件,当代理陷入困境时,引导代理走向正确的方向。
"更有趣的部分是引入一个监督代理来配合你的主代理工作,"El Hallack 说。它"几乎像一位 CEO,当代理偏离方向或开始探索可能导致死胡同的路径时,推动代理,或者重新探索它之前走过的路径。"
虽然监督代理的概念并非全新,但如今大多数代理用户只依赖单层的马具,比如 Claude Code、Codex 或 Hermes。Nvidia 研究人员创建了自己增强版的马具,称为 Agentic Variation Operators(AVO)。
请注意,这不是一个新的 Nvidia 产品。Nvidia 反而生产了许多用于构建马具的开放技术碎片,归在 Nemo 品牌下。其中部分技术是商业化的,但很多是公开可用的。
尽管如此,Nvidia 的结果增加了越来越多的证据表明,模型选择远非代理性能的唯一因素。例如,7 月 Databricks 发布了一些令人瞩目的研究,表明马具而非模型对人工智能成本有显著影响。
"你可以选择相同的模型但使用不同的马具,如果你用错了马具,成本会显著增加,"Databricks CEO Ali Ghodsi 告诉 TechCrunch。"所以你会想,哦,这是一个昂贵的模型。这是一个便宜的模型。但是,等一下,你用的是什么马具?光是这一点就能让你的成本翻倍。"
Nvidia 更大的论点是表明,开放的马具——就像开放的模型一样——让用户的控制权远超他们所意识到的。
"我们相信,而且我们正在通过生态系统证明,开放的马具允许你转动更多旋钮来提高准确性,"El Hallack 说。"这与 OpenAI 放缓模型训练有关,"因为模型造成了安全漏洞。
"我们相信拥有一个开放的代理技术栈——让你能够控制马具、控制基础设施、控制运行时——这是推动生态系统向前发展和安全地发展所必需的,"他补充道。