Meta FAIR联合牛津、UCL推出AI研究偏好模型,可对15个未执行候选实验排序后只跑最优1个,AIRS-Bench上分数从0.684提升至0.729,24小时任务压缩至15小时。
AI 研究智能体已经能够自主提出、实现并评估自己的机器学习实验。创意生成很廉价;验证则不然。训练一个候选实验可能耗费数小时甚至数天的 GPU 时间,因此智能体会提出远多于其能够执行的候选方案。真正决定研究进展的杜杆,是该跑哪些候选方案。
FAIR 团队来自 Meta、剑桥大学和伦敦大学学院,他们将这一杜杆形式化为"研究偏好",并引入了 AI 研究偏好模型(Research Preference Models,RPMs)。RPM 能对未执行的候选方案进行排序,选出一个来执行。团队发现,语言模型在预测指标或执行结果方面并不可靠,因此 RPM 从不预测绝对分数。
是否可以部署?部分可部署。RPM 使用冻结的预训练 LLM,无需微调;脚手架 AIRA-dojo 和基准测试 AIRS-Bench 均已开源;骨干模型 Qwen3.6-27B 为开源权重。
AIRA-dojo 是一种进化树搜索:贪心父节点选择、"草案 / 改进 / 调试"三种算子,最终返回验证分数最高的节点。RPM 仅在子节点创建时介入。不再是生成一个子节点并执行,而是让智能体并行应用算子 15 次,产出 15 个未执行的候选方案,然后在淘汰赛中两两比较。只有胜者被执行。每次比较都基于从搜索树的 BFS 遍历中收集的上下文节点,每个节点都附带其获得的验证分数。
仅推理 RPM:用 LLM 作为裁判,评判候选方案的计划、代码和搜索历史。其 prompt 通过 DSPy 的 MIPROv2 优化,最终收敛到一份"首席研究员评分标准"——容忍可修复的 bug、奖励可扩展性、惩罚冗余方向,离线准确率为 57.7% 至 59.0%。
智能体 RPM:同样的裁判加一个沙箱,沙箱会克隆智能体的环境,包括一块 H200。工具包括 python、bash 和 submit_solution。它先运行小规模 pilot 实验,然后一个反馈模型要么提出信息量最大的下一个实验,要么结束循环。两个设计选择举足轻重:剩余预算被故意高报(报告为 2700 秒,实际只有 300 秒),以防止智能体提前停止;pilot 上限为 30 个,且有 60 秒的阈值。pilot 时间与智能体自身时钟竞争,因此智能体选择器只在 Draft 和 Improve 步骤运行;Debug 步骤回退为随机选择。
设置:20 个公开的文本和表格任务,每个任务在单块 H200 上运行 24 小时,10 个随机种子,Qwen3.6-27B 作为算子和 RPM 的骨干模型——因此收益来自选择层,而非更强的裁判。
| 子节点选择方式 | 平均归一化分数 |
|---|---|
| 无 RPM(随机选择) | 0.684 |
| 仅推理 RPM | 0.711 |
| 智能体 RPM | 0.729 |
| 验证先验(上限) | 0.748 |
| 测试先验(上限) | 0.759 |
相对于无 RPM 的提升概率为 0.5923 和 0.5913,95% 置信区间下界分别为 0.5066 和 0.5018。
效率是更具实际意义的结果。仅推理 RPM 在 14.88 小时达到基线的最终分数 0.684(加速 1.61 倍),智能体 RPM 在 15.50 小时达到(加速 1.55 倍)。自托管推理每次运行增加 0.660 小时;考虑这一开销后,仍能在 23.34 小时达到 0.708。
两个新的报告 SOTA 结果:WinoGrande 在智能体 RPM 下达到 94.1%,此前 AIRA₂ 的智能体 SOTA 为 90.4%;SVAMP 在仅推理 RPM 下达到 95.7%,此前人类 SOTA 为 94.2%。
RPM 对未执行的候选方案进行排序,使 AI 研究智能体只运行最有前景的那个。
两种冻结 LLM 变体:仅推理裁判,以及运行短时 pilot 实验的智能体裁判。
在 AIRS-Bench 上,平均归一化分数从 0.684 提升至 0.711 和 0.729。
两种变体均在大约 15 小时内达到基线 24 小时的分数,加速 1.5–1.6 倍。
在 WinoGrande(94.1%)和 SVAMP(95.7%)上报告了新的 SOTA。
查看论文和 LinkedIn 公告。也欢迎关注我们的 Twitter,记得加入我们的 15 万+ ML SubReddit 并订阅我们的通讯。等一下!你用 telegram 吗?现在也可以加入我们了。
需要与我们合作推广你的 GitHub 仓库或 Hugging Face 页面或产品发布或网络研讨会等?请联系我们
Asif Razzaq 是 Marktechpost Media Inc. 的 CEO。作为一位有远见的企业家和工程师,Asif 致力于将人工智能的潜力用于社会公益。他最新的举措是推出了一个人工智能媒体平台 Marktechpost,其特色在于对机器学习和深度学习新闻的深入报道,既具技术深度又通俗易懂。该平台每月浏览量超过 200 万次,深受读者喜爱。