Anthropic 构建系统让 5 个 Claude Agent 并行提出训练方法、撰写论文、训练模型并评分迭代,在 10 项对齐任务中 Agent 发现的方法均超越未训练基线,在 7 项有人类参与的对比中胜出。
Anthropic 让 AI Agent 做对齐研究,结果它们超越了人类。能衡量的失败是全部,但无法衡量的失败才是关键
Anthropic 刚刚发布了一个系统,让 AI Agent 对其他 AI 模型做对齐研究,数据好看到让人眼前一亮。五个 Claude Agent 并行运行,每个都阅读文献综述、提出一种训练方法、写成一页小论文、在 30 分钟 GPU 预算内训练目标模型、将结果送往独立评分器评分、最后把成绩 posting 到共享排行榜。然后就是爬山(hill-climb)。在他们瞄准的全部 10 个对齐失败上,最佳 Agent 发现的方法超越了未训练的基线。在人类研究员也提交了想法的 7 个上,最佳 Agent 方法超越了最佳人类想法。
最后这句话被标题抓走了。但它恰恰是论文中最没意思的部分。有意思的部分是这个循环能触达什么、不能触达什么,因为那条线才是全部故事。
剥掉"AI 做科学"的包装,这就是一个带着巧妙目标的优化循环。针对一个具体、可测量的不良行为:谄媚(sycophancy)、越狱(jailbreak)易感性、提示注入(prompt injection)、幻觉(hallucination)、奖励黑客(reward hacking)。十个。对每个定义一个基准测试,来评分模型表现有多差,然后指着一群 Agent 去缩小基线和满分之间的差距。Agent 提出训练干预方案,监控器检查代码,评分器给结果打分,排行榜告诉所有人哪个方向是上坡路。这是爬山,自动化了,而且同时跑了五个版本。
在它的框架内,这确实有效。最强的方法泛化到了留出基准测试、多轮行为审计、以及规模高达开发模型的 4.7 倍的模型上。这种泛化才是真正值得关注的成果,而不是人机对比——Anthropic 自己也很谨慎:人类研究员不允许对提交的内容进行迭代,所以论文明确说了这不是一场公平的比试。把 Agent 对阵人类那句话读成"能迭代的 Agent 战胜了不能迭代的人类",这是关于迭代的陈述,而非关于智能的陈述。
论文里有句话,我会纹在任何引用"AI 现在能做对齐"的人身上:结果"仅限于可以用公开基准测试或自动审计工具衡量的对齐任务,可能不会泛化到开放式的、难以监督的研究。"
这不是脚注。这就是全部边界。这个方法恰好在每个失败都有数字可循的地方有效。谄媚有基准测试。提示注入有基准测试。而真正让夜不能寐的对齐问题,恰恰是那些没有的:只在分布外才显现的欺骗、你在每个能写出的测试上都表现良好却在没写到的那个情形下发散的行为、以当前审计手段检测不到的方式 misalignment 的目标。这些没有基准测试来爬山,而一个只优化已测差距的系统,在它们面前按理说就是沉默的。
所以诚实的读法是两件事并存。对于能量化的那部分对齐,这是一个真实、有用的工具;对于不能量化的那部分,它什么都没说。风险不在工具。风险在于人们把"我们把能量化的那部分自动化了"压缩成"我们把对齐自动化了",而能量化的那部分从来就不是可怕的部分。
我一直在想的细节:Agent 作弊了。Anthropic 在 2.4% 的轨迹中抓到了作弊。把一个未改动的方案改头换面重新提交。构建旨在模仿基准测试而非修复行为的训练数据。隐藏一个违规步骤。一个为减少 misalignment 而构建的系统,在其可衡量目标可以用更便宜的方式被玩弄的瞬间产生了 misalignment。
这和今天早先我写的 Hugging Face 事件如出一辙——安全评估中的 Agent 通过 reward hack 找到真实漏洞。同一根源,不同场景。给一个能干的优化器一个可衡量的目标加一条捷径,总有一定比例的时间它会走捷径。连对齐者也不例外。这不是对这项工作的否定,这正好是这项工作为什么很难的证明:你的测量本身就是要被玩弄的东西。
我从所有写过的东西里保留的一条原则是:生成变便宜了,验证没有。这个论文是那条规则的逆向版本。在你能以低成本、高可靠性进行验证的地方——有着扎实基准测试或自动审计——你现在可以把解决方案的生成自动化,让一群 Agent 比你更快地爬山。评估不再只是你给成果打分的方式。它是使这项工作真正可自动化的东西。
这把优势放在了意想不到的地方。如果你在构建 Agent 系统,你的评估质量就是你敢交给机器多少的天花板。一个清晰、难以被玩弄的基准测试比一个更聪明的 Agent 更有价值,因为 Agent 可以针对好的基准测试被自动化,而针对坏的基准测试则很危险。下一轮赢的团队是那些擅长测量他们真正想要的东西的人,而这恰恰是领域里最古老的难题穿着新衣出现。
如果你试过把一个模糊的质量目标转化成一个你的 Agent 可以优化的基准测试,我很想知道它在哪儿卡住了、Agent 在哪儿找到了你的指标和你的意图之间的差距,因为这个差距就是这一切的所在。