Google 研究者提出 RRSI 正则化方法,抑制 AI Agent 在自我改进过程中对测试任务的记忆,在未见基准上提升 4.7 分,token 消耗减少约 30%。
持续优化自身工作环境的 AI Agent 容易在测试任务上过度专精。Google Cloud AI Research 与多所大学联合提出了一项新方法,旨在防止这一问题,同时降低计算成本。
现代 AI Agent 会将一个固定的语言模型包装在所谓的 harness 中——这是一套由提示词、工作流、工具、记忆和逻辑组成的框架,用于控制模型在每个步骤中能看到什么。
harness 决定了一个 Agent 在修改文件之前是否读取了正确的文件、是否能从错误中恢复、以及是否能干净利落地交付结果。一篇新的研究论文指出,Agent 领域近期的许多进展来自于 harness 的工作,而非来自新的模型。
直到不久前,这项工作仍然靠手工完成。人们审查失败的运行记录,然后手动修补 harness。较新的方法则将这个循环自动化:让语言模型根据测试任务的反馈,一遍又一遍地重写 harness 本身。
研究人员称这是递归自我改进的一种实践形式。系统产生反馈,用这些反馈来优化 harness,而 harness 又反过来控制系统的行为。
论文表明,这种自我优化伴随着一个陷阱。由于 Agent 持续在同一组有限的测试任务上工作,它最终会将它们记住。它在训练任务上的分数上升了,而在新的、未见过的任务上的收益却在缩小或完全消失。
研究人员指出,这种情况以多种方式发生。搜索记住了只适合某个特定基准的模式,偏好那些纯粹因为巧合而得分高的候选方案,并且堆砌了不必要的复杂性——这些复杂性提高了测试分数,却没有让 Agent 变得更好。

RRSI(Agent Harness 的正则化递归自我改进)在优化循环的两端同时发力,同时保持 harness 完全可编辑。当系统提出新的变更时,一个预算上限限制了候选方案一次可以捆绑多少个独立编辑。
这个预算会随时间缩减。早期轮次允许较大的重写,而后期轮次只允许可以清晰追溯到某个结果的小改动。系统还追踪早期的尝试记录,这样就不会一直追逐那些失败的想法。当进展停滞时,它会有意地去实验 harness 中尚未触及的部分。

在选择变更时,一个评审器会审查每一个提案,并剔除任何硬编码了任务名、解决方案或其他基准特定技巧的提案。另一条规则只在接受更高的计算成本——前提是它们带来了可衡量的性能提升。不再起作用的组件会被移除。
研究人员在八个基准上测试了 RRSI,涵盖编程、Agent 办公场景和工程设计。底层模型 Claude Opus 4.8 全程保持冻结。团队将 RRSI 与未修改的基线 harness 以及四种近期的优化方法进行了比较。
根据论文,RRSI 在训练任务上获得了最高 14.1 分的提升,在从未见过的五个基准上获得了最高 4.7 分的提升。在运行时使用的 token 数量上,RRSI 也比无正则化的版本减少了约 30%。在所有未见的基准上,总体性能从未低于基线——而过拟合了任务的 harness 通常会出现这种情况。

每种方法在训练任务上都表现良好,但在新任务上结果反转了。两种方法甚至最终落在了基线 harness 之下。RRSI 在所有变体中获得了最小的训练收益,但也是在未见任务上唯一显著高于基线的方法。这些护栏机制正是为了产生这种权衡。

用 Gemini 3.5 Flash 优化的编程 harness,在没有任何修改的情况下,将弱得多的 Gemini 3.1 Flash Lite 的准确率从 11.2 分提高到了 14.6 分。系统发现的机制并不依赖于用于发现它们的模型的能力。
作者指出,他们的研究只涵盖了围绕冻结模型构建的 harness,没有涉及模型权重发生变化的情况。
他们得出的结论是,只有当持续的反馈被转化为持久的变更时,自我改进才能让 AI Agent 可靠地变得更强。该代码已在 GitHub 上开源。
手工设计的 harness 通常无法泛化到新任务,ARC-AGI-3 上的测试已经证明了这一点。使用专门构建的 harness,Opus 4.6 在熟悉环境中得分 97.1%,在陌生环境中得分 0%。Nvidia 最近展示了 SoL-Pi,这是一种相关方法,其中一个研究 Agent 自动重建编程 Agent 的 harness。它在不出现明显性能下降的情况下将 token 使用量减少了最高 49%。
在那不久前,Google 让 Agent "梦见" 过去的搜索运行记录,以改进它们的搜索策略。那项工作同样没有改变模型本身。