英伟达推出PivotOPD方法,通过on-policy蒸馏训练多轮LLM Agent避免早期关键错误并在发生后恢复,在3个基准上击败13个基线。
关键性失误(pivotal mistake)指的是这样一种动作:它使得完成任务的剩余最短路径变长,或者直接导致任务无法解决。ALFWorld 的符号预言机(oracle)会在每轮对话时对此进行测量。
在 Qwen3-8B、Qwen3-30B-A3B 和 Qwen3-235B-A22B 中,59% 的失败轨迹(262 条中的 155 条)包含一次关键性失误。第一次关键性失误出现得很早,中位数在第 8 到第 12 轮(总共 30 轮)。此后 Agent 会在接下来的 18 到 21 轮中持续浪费操作,且无法恢复。
在 Qwen3-8B 失败的重放中,纠正关键性失误使成功率从 8% 提升到 59%。如果保留失误但强制执行后续 2 轮的正确动作,成功率仍能达到 58%。
标准 OPD 将留出失败率从 79% 降低到 56%。但关键性失误之后的失败率仅从 51% 降到 49%。在每个关键性失误轮次,正确动作的概率始终低于 1%,因此 8 次采样中很少能抽到它。
基于结果的强化学习同样存在这一盲点:如果每条轨迹都失败,那么组相对优势(group-relative advantage)为 0。
PivotOPD 在基于组的强化学习基础上增加了 3 个组件,整合在一次 PPO 更新中。
关键性失误检测(Pivot detection):一个更大的教师模型读取每条轨迹及其回溯结果。它挑选候选轮次并为每一轮指定一个黄金动作(gold action)。当学生的动作与黄金动作不一致时,该轮次计为关键性失误。在 ALFWorld 上,检测到的关键性失误平均在 77.8% 的失败轨迹中落在预言机关键性失误的 1 轮范围之内。
预防性蒸馏(Preventive distillation,Reverse KL):一份学生模型的冻结副本在黄金动作的提示下重新对学生自身的响应进行评分。这将学生从已提交的错误中拉回来。
恢复性蒸馏(Recovery distillation,Forward KL):在每个关键性失误之后,教师为最多 K 轮指定一个恢复动作。被提示的自我教师撰写恢复响应,而未被提示的学生在这些响应上进行训练。Forward KL 是质量覆盖(mass-covering)的,因此它提升的是学生几乎从未采样过的动作。
教师只指定动作。Token 级别的目标来自学生自己的被提示分布。
使用 1.7B 学生模型,PivotOPD 在 ALFWorld 上平均达到 73.7%,比 SDAR 高 5.5 分。在 Search-based QA 上平均达到 44.5%,比 RLSD 高 5.9 分。在 WebShop 上比 RLSD 的得分高 1.2 分,但成功率高出 14.1(76.6%)。
使用 8B 学生模型,PivotOPD 在 ALFWorld 上达到 93.0%,Search-based QA 上达到 47.4%,WebShop 成功率达到 81.9%。领先幅度较小,但至少达到 1.8 分。
以 Qwen3-8B 作为自己的教师,PivotOPD 仍然在全部 3 个基准测试中获胜,至少领先 1.5 分,平均领先 3.9 分。
在 SWE-Bench Verified 上,由 Nemotron-3-Super 教导的 Nemotron-3.5-SFT 学生从 62.8% 提升到 66.0%。标准 OPD 达到 63.0%,而教师得分为 73.0%。
恢复能力是最大亮点。在 72 个重放的关键性失误中,PivotOPD 有 72.7% 的时间能够恢复,而基线模型只有 8.3%,标准 OPD 只有 20.3%,仅预防性方法只有 45.8%。PivotOPD 平均用 9.7 轮恢复,最优恢复仅需 6.2 轮。
| 指标 | PivotOPD | OPDS(标准 OPD) | OPIDS | SDAR | RLSD |
|---|---|---|---|---|---|
| 核心思想 | 在教师检测到的关键性失误轮次进行预防和恢复 | 每个响应上的特权自我教师 | 基于在线策略回溯的层级技能 | 以 sigmoid 门控辅助损失形式使用 OPDS | 自我蒸馏设定更新大小,RLVR 设定方向 |
| 在教师撰写的恢复响应上训练 | 是(Forward KL) | 否 | 否 | 否 | 否 |
| ALFWorld 平均,Qwen3-1.7B | 73.7 | 12.4 | 61.3 | 68.2 | 60.7 |
| Search QA 平均,Qwen3-1.7B | 44.5 | 36.8 | 37.5 | 37.1 | 38.6 |
| WebShop 成功率,Qwen3-1.7B | 76.6 | 10.1 | 68.0 | 57.0 | 62.5 |
| ALFWorld 平均,Qwen3-8B | 93.0 | 46.7 | 83.7 | 83.8 | 90.8 |
数据来源:PivotOPD Table 1。
PivotOPD 只改变训练过程,因此推理没有任何额外成本。在 1.7B 学生模型的 ALFWorld 上,使用 4 张 H100 GPU,相比 GRPO 的额外开销在 K=1 时为 12.4%。当 K=2 时跳升至 94.2%,因为后续恢复轮次需要环境重放。选定配置为 ALFWorld 上 K=2,WebShop 和 Search-based QA 上 K=1。
超过一半的失败 Agent 轨迹取决于 1 次早期的、可恢复的关键性失误。
标准 OPD 几乎无法触及这些失败:从 51% 到 49%。
PivotOPD 在重放的失误中恢复了 72.7%,而标准 OPD 仅为 20.3%。
在 ALFWorld、WebShop 和 Search QA 上以最佳平均成绩击败 13 个基线。
零推理开销,但代码尚未发布。
请参阅论文和项目页面。所有功劳归该项目的研究人员。此外,欢迎关注我们的 Twitter,记得加入我们的 15 万+ ML SubReddit 并订阅我们的通讯。等一下!你用电报吗?现在你也可以加入我们了。
[Sponsored] 网页是大多数 Agent 缺失的最重要的 API。数据库、日历和代码仓库都有 API,但开放网页大多没有。TinyFish MCP 服务器为任何 MCP 客户端提供四个工具:TinySearch、TinyFetch(将完整页面转为 markdown,包含 JavaScript)、TinyBrowser(用于登录和表单)以及 TinyAgent(用于多步骤任务)。Search 和 Fetch 是免费的。
Michal Sutter 是数据科学专业人士,拥有帕多瓦大学数据科学硕士学位。凭借统计分析、机器学习和数据工程的坚实基础,Michal 擅长将复杂数据集转化为可操作的洞察。