RRSI框架允许大模型Agent在权重冻结状态下自行重写提示词、工具和记忆,通过泄漏批评器、噪声底限、成本规则和剪枝防止过拟合。在Claude Opus 4.8上Terminal-Bench提升6个百分点,且泛化到6个保留测试集。
Google Cloud AI Research 联合 UNC-Chapel Hill、Stanford 和圣路易斯华盛顿大学发布了 RRSI(Regularized Recursive Self-Improvement,规则化递归自我改进)。它让 LLM Agent 重写自己的 Harness:prompt、工具、记忆、控制流和子 Agent。模型权重永不改变。RRSI 对改进循环本身施加约束,从而使收益在 Agent 从未针对优化过的基准测试上也成立。
可部署吗?可以,作为研究框架使用。代码采用 Apache 2.0 协议,需要 Python 3.10+,接受任意 LiteLLM 模型字符串。默认配置假设在 Vertex AI 上运行 Claude Opus 4.8。
Harness 演化循环提出修改建议,在固定的演化集上评分,并保留胜者。相同的任务在每一轮中被重复使用,所以循环可能记住它们。RRSI 研究指出了 3 种失败模式:基准特定拟合、噪声追逐和复杂度累积。每一种都会拉大演化集分数与真实迁移之间的差距。
RRSI 保持每个 Harness 组件可编辑。它对搜索的移动方式进行规则化。
退火编辑预算(Annealed edit budget):余弦退火策略让早期轮次可以批量执行多项编辑,后期轮次只允许一项可归因的变更。
证据感知归因(Evidence-aware credit):每个候选项都附带其组件、假设、差异、分数变化和成本变化记录。提议者阅读这份账本,因此被证伪的想法不会被重试。
结构化探索(Structured exploration):当进展在噪声带内停滞时,预算转移到该轮从未触及的组件上。
泄露批评者(Leakage critic):在任何评分之前,拒绝任务名称、实体、答案或基准特定逻辑。
噪声调整底线(Noise-adjusted floor):收益必须超过在未改变的基线 Harness 上测得的方差。
成本规则(Cost rule):额外的推理 token 必须以可衡量的收益来偿付。
剪枝(Pruning):不再产生收益的组件成为删除目标。
研究团队将这些比作经典正则化器的类比。编辑预算对应 L0,剪枝对应 Lasso(L1),成本规则对应 Ridge(L2)。
Terminal-Bench 2.1(演化划分):74.2% → 80.2%
SWE-bench Verified(从未用于选择):82.0% → 83.8%
分布外:JobBench +4.7、GDPval +3.5、APEX-Agents +3.7 分
EngDesign(演化)+4.9;Frontier-Eng +4.3 Medal 分
Harvey LAB:演化划分上 +1.1,保留划分上 +2.3
所有 6 个保留划分都有提升。以 Gemini 3.5 Flash 作为策略时,Terminal-Bench 2.1 从 64.6 升至 78.7。SWE-bench Verified 从 76.8 升至 79.0。
Harness 也更轻量了。在 agentic workspace 实例上,RRSI 每次试验使用 2.42M 个策略 token。无正则化的演化使用 3.80M。摘要报告称减少了 30%;项目页面说是 36%。
分数来自 RRSI 论文的表 1。所有方法共享相同的起始 Harness、策略、演化划分和候选预算。
| Feature | RRSI | Meta-Harness | AHET | THEHarness | X |
|---|---|---|---|---|---|
| 核心思路 | 规则化提议与选择 | 通过代码、分数和所有先前候选的轨迹驱动 Agent 提议者 | 可观测性驱动的循环;编辑与经验证的预测配对 | 测试时演化 Harness,无金标准标签 | 模块化类型化原语,轨迹驱动适配 |
| 模型权重 | 冻结 | 冻结 | 冻结 | 冻结 | 冻结 |
| 成本规则和剪枝 | 是 | 否* | 否 | 否 | 否 |
| Harvey LAB 演化分数 | 90.5 | 93.0 | 90.7 | 91.1 | 91.8 |
| OOD 平均值(H0 = 39.7) | 43.6 | 40.6 | 39.2 | 38.0 | 39.7 |
*来自 RRSI 研究团队。OOD 平均值是 JobBench、GDPval 和 APEX-Agents 的均值,根据表 1 计算。
Meta-Harness 在 Harvey LAB 演化划分上领先。RRSI 的演化收益最小,但唯一在 OOD 平均值上超过 H0 超过 1 分。
RRSI 如何规则化 Agent 自我改进
git clone https://github.com/google-research/rrsi.git && cd rrsi
pip install -e ".[dev]"
python3 rrsi.py --domain coding baseline
python3 rrsi.py --domain coding run
每轮在独立的 git worktree 中起草 2 个候选,筛选它们,评估两者,然后将分支快进到胜者。coding 实例还需要 Docker 和 harbor。新领域通过单个适配器模块插入。
RRSI 演化 prompt、工具、记忆和工作流,同时保持模型权重冻结。
泄露批评者、噪声底线、成本规则和剪枝共同决定哪些修改被采纳。
Terminal-Bench 2.1 使用 Claude Opus 4.8 从 74.2% 升至 80.2%。
SWE-bench Verified 从未用于选择,从 82.0% 升至 83.8%。
GitHub 上的 Apache 2.0 代码;研究级别,非 Google 官方产品。