Google联合高校发布EnvHarness框架,能将静态Agent评测环境自动适配为动态训练场景,实验显示任务完成率提升9点、执行步骤减少9.8%。
环境不再教东西
LLM 智能体现在更多地是从交互式环境中学习,而不是从精挑细选的文本中学习。但这些环境是人工构建的、静态的:无论哪个智能体在行动,也无论它改进到了什么程度,环境的行为都完全一致,因此它们无法针对策略的弱点进行训练,一旦任务被解决就没有什么可教的了。
常规的解决方案是生成更多环境。EnvHarness 论文指出了两个代价:生成流水线是领域特定的,无法迁移;而且 LLM 编写的验证器必须过度生成并大量过滤,却始终无法完全可信。
包装,而非编写
研究团队提出了相反的做法。智能体 harness 通过插件工具、记忆和技能让冻结的 LLM 变得能干。EnvHarness 将这一思路应用到循环的另一侧,用插件组件包装冻结的环境,这些组件严格通过标准的 reset() / step() 接口操作。
从形式上讲,一个组件是一个变换 E' = w(E),它重写了状态(state)、动作(action)、观察(observation)和转移(transition)项。奖励(reward)项被故意排除。由于没有任何干预触及模拟器后端,每个重塑后的任务都保留了其原始的人工构建验证器,而且因为没有东西接触基准测试的特定代码,一套实现就能覆盖所有领域。
提供三个组件,它们可以自由组合:
Stage 在 reset() 之后重放一个固定的动作列表,使 episode 从别的地方开始。把目标马克杯藏在关闭的抽屉里,迫使智能体必须搜索而非直接伸手够到。
Contract 在动作、转移和观察轴上安装每步钩子:阻止某个动作、改写某个响应、截断某个观察。
Chain 将第二个环境合成到同一个 episode 中,共享步数预算,复合裁决为两个验证器的合取。
EnvRigger:设计器循环
组件是策略无关的,但选择组件不是。EnvRigger 将策略视为黑盒,运行四个阶段:观察五个基线 rollout、诊断系统性缺陷、将组件写成真实 Python 代码、在五个新的 rollout 上验证。可解决的和 trivial 可解决的候选都会被拒绝,每个任务最多进行五轮修订。生成的钩子在隔离子进程中编译,因此一个糟糕的变异会成为一条记录的轨迹,而不是一次死循环。
在 ALFWorld、WebArena、SWE-bench Verified、OfficeQA 和 SpreadsheetBench 五个基准上,使用 ReasoningBank 风格的归纳挖掘出的技能,在未接触过的保留任务上均超越了两个对照。
ALFWorld 平均得分从 62.4 升至 68.3(相比原始环境技能),在分布外分割上提升 +9.0 分。SWE-bench Verified 解决率从 49.88 移动至 52.58,同时平均步数从 55.01 降至 49.61,这就是论文中 9.8% 效率 claim。在 SpreadsheetBench 和 WebArena 上,未修改环境挖掘出的技能低于无技能基线;重塑才是使挖掘有价值的原因。在领域特定的生成器对比中,EnvHarness 以 2.46 分和 5.11 步的优势击败了 SWE-smith。
在 Qwen3-8B-base 上使用 GRPO,在重塑环境中的 RL 在四个指标中的三个上超越了原始环境中的 RL(ALFWorld 分布内 81.4 → 87.9),在 OOD 分割上有小幅退步(89.6 → 88.8)。环境扩展在 300 个环境时达到 54.79,而原始环境为 52.13,生成环境为 50.37,因为设计器与当前策略协同演化。而在将每个任务的成功率引导至 [0.4, 0.6] 时,带内覆盖率从 6% 升至 80%。

EnvHarness 仅通过 reset() / step() 包装冻结的环境,因此验证器保持人工构建。
三个组件——Stage、Contract、Chain——分别覆盖起始状态、交互规则和 episode 组合。
EnvRigger 从 rollout 中诊断策略缺陷并编写针对性包装器,在新的 rollout 上验证。
收益在五个基准上均成立:ALFWorld OOD 上 +9.0 分,SWE-bench Verified 上步数减少 9.8%。
Apache-2.0 代码已上线;代价是设计器的 token 消耗以及对可重置环境的硬性要求。
查看论文、GitHub 仓库和项目主页。也欢迎关注我们的 Twitter,别忘了加入我们的 15 万+ ML SubReddit 并订阅我们的通讯。等一下!你用电报吗?现在也可以加入我们了。
需要与我们合作推广你的 GitHub 仓库或 Hugging Face 页面或产品发布或网络研讨会等?请与我们联系。
Asif Razzaq 是 Marktechpost Media Inc. 的首席执行官。作为一位有远见的企业家和工程师,Asif 致力于将人工智能的潜力用于社会公益。他最近的举措是推出了一个人工智能媒体平台 Marktechpost,该平台以其对机器学习和深度学习新闻的深入报道而著称,内容既有技术深度又易于被广泛读者理解。该平台每月浏览量超过 200 万次,彰显了其在大受众中的受欢迎程度。