编程 Agent 强化学习效果差的根因不在模型,在于训练环境缺乏真正的梯度信号;27B 模型通过改进训练环境使 Terminal-Bench 得分从 1.4% 升至 5.4%。
当团队在使用编码 Agent 的强化学习时遇到瓶颈,他们通常会归咎于模型架构或优化器。实际上,瓶颈几乎总是在数据管道。具体来说,就是缺乏真正的 RL 训练信号——那些表面上看似严格、但实际上无法为梯度更新提供任何可操作信号的任务。
这是我们在深入探讨前沿编码任务为何经常在强化学习中失败时反复验证的观点,而近期 Agent 研究社区的实证结果进一步强化了这一论点。核心发现:一个 27B 参数的模型在大约 100 个长周期任务上训练后,其 Terminal-Bench 3.0 分数从 1.4% 提升到 5.4%——不是因为模型变大了,而是因为训练环境被设计成了能产生真实梯度信号。
在 NerdHeadz,我们在为生产系统构建 AI 开发服务时直接面对这些约束。能够读取规格说明的模型与能够对抗性测试自身假设的模型之间存在巨大鸿沟——而这道鸿沟只有结构良好的 RL 环境才能弥合。
标准的思维模型将监督微调(SFT)视为 RL 开始前的热身圈。这种框架会造成浪费。如果一个任务在当前策略下返回全零奖励,它不一定是个坏任务——只是可能在没有针对性 SFT 更新之前根本无法企及。
更清晰的做法是将 SFT 视为救援行动。如果一个参考演示的得分显著高于当前策略产生的得分,就在该任务上运行一次针对性的 SFT 更新,然后重新运行 rollout 阶梯。如果奖励开始在整个群体中扩散,这个任务就赢得了它在 RL 语料库中的位置。如果不能,就干净地丢弃它。
这完全改变了你对数据集设计的看法。数据集不是固定不变的产物——它的价值是相对于策略当前所处的位置而言的。今天没有价值的任务,在对相邻问题进行若干 SFT 干预之后,明天可能会变成高信号任务。
正在做类似的事情?想了解你的项目?联系我们的团队。
产生 Terminal-Bench 收益的训练设置使用了三个相互锁定的组件:通过 GSPO 实现的序列级重要性加权、组相对的去一优势,以及 QLoRA 以保持适配器的占用空间可控。但优化器的选择虽然合理,却不是决定性因素。
决定性因素是信号在到达 GPU 之前是如何被制造的。动态 rollout 阶梯逐步扩展 episode 长度,这意味着密集的中间奖励在训练早期就可以获得。在这次运行中,近三分之二的 RL 任务在仅仅两次 rollout 后就产生了分离——即在整个群体中产生了奖励方差。没有一个任务需要超过八次。传统的二元奖励设置会抹掉整个语料库中的大部分方差,迫使昂贵的重复采样来寻找一个罕见的通过。
与二元奖励基线相比,估计的成本优势在这次运行中是 5 倍到 7 倍。这不是一个通用常数,但机制是一致的:将不确定性从 GPU 集群中移出、转移到数据管道中——在那里杀死它更便宜——始终是正确的方向。当我们思考构建由 AI Agent 驱动的有效应用开发服务时,同样的逻辑也适用:前置验证优于后置验证。
aggregate 分数的提升不如轨迹层面的行为变化重要。三个任务只有训练后的模型才能解决,而这三个任务的模式完全相同。
WAL 恢复排序。基础模型反复重新读取规格说明,在 flusher 设计上进行迭代,但从未为确认排序构建测试。训练后的模型编写了一个多写者压力测试工具,创建了调试脚本,monkeypatch 了交错跟踪,并识别出了真正的不变量——任何提交在被确认之前,所有更低的日志序列号必须已经持久化。然后它在提交流程中添加了所需的等待,并通过全部 97 个子测试。
React 线索表单与业务日历逻辑。两个模型都认识到日历规则是模糊的。基础模型选择了更简单的解释,并编写了本地测试来编码同样的错误假设——表面上一切都是绿的,而隐藏的时间戳检查却失败了。训练后的模型承诺了明确的 clamp-and-rollover 语义,枚举了每个边界情况(周末、假日、截止时间后的提交),并独立测试了每一个。
Embedding 漂移监控器。两个轨迹使用的步数相同。训练后的模型在静态检查期间捕获了一个有偏差的 MMD 估计器,因为实现错误地包含了主对角线。它在任何运行时症状出现之前就修复了这个估计器。基础模型发现了其他五个缺陷,但完全错过了这个偏差,并且仍然有一个子测试失败就发布了。
共同的主线:训练后的模型将模糊性和代码味道转化为可执行的检查,而不是信任自己对规格说明的第一次阅读。它编写了对抗性测试。它调试了自己的测试工具。它将领域不变量视为 bug,即使没有任何东西明显崩溃。这种行为正是长周期训练环境所奖励的——也是这种行为将可以在生产环境中信任的 Agent 与在演示中看起来不错的 Agent 区分开来。
理解模型设计如何影响推理质量是我们跨学科看到的一种模式——这就是为什么像设计师一样思考在高度技术性的 AI 工作中仍然不可或缺的的原因。
这是跨 74 个任务的一次配对扫描,总共四次通过——一个很小的分子。它没有建立扩展定律,也没有声称一个新的通用前沿模型。它所建立的是在相同架构、服务配置、工具和基准参数下的受控能力移动。
基础适配器:74 个任务中解决了 1 个。训练后的适配器:74 个中解决了 4 个,其中三个 RL 独有的胜利有轨迹中具体的行为证据支撑。金丝雀任务在整个训练过程中保持稳定。一组固定的边界任务在中途检查点从 0/9 移动到 4/9。困难尾部在简单集没有崩溃的情况下得到了改善。
所有这些中稀缺的不是提示词或仓库,而是一个经过验证可解决性的长周期环境、连贯的奖励解析、可测量的策略位置,以及在训练开始前经过验证的学习阶梯。这种组合才是产生值得行动的 RL 训练信号的关键。
准备好构建了吗?NerdHeadz 在数周内交付生产级 AI,而非数月。获取免费估算。
编码 Agent 在 RL 下停滞不前与持续改进之间的差异几乎总是可以追溯到训练信号的质量,而不是优化器的复杂程度。具有密集、可证明可解决的奖励的长周期环境是稀缺资源——而严谨地构建这些环境,才是受控能力提升与昂贵噪音之间的分水岭。如果你在设计需要在模糊性下推理并自我验证的 AI 系统,那这种管道纪律是不可妥协的。