Anthropic 研究人员让自动化系统自主在 10 项特定对齐基准上提升表现,且整体性能未出现退化,标志着 AI 自我改进能力的突破。
用 AI 模型训练 AI 模型已经成为各大 neolabs 非常热门的目标——如今,Anthropic 学者计划(fellows program)的一位研究员让我们首次窥见了这在实际中可能是什么样子。
周五,Anthropic 发表了一篇新论文,题为《自动化研究者能够可靠地缓解对齐失败》(Automated Researchers Can Reliably Mitigate Alignment Failures),详细阐述了 AI 系统如何能够可靠地提升模型在一组对齐基准测试上的表现。当给定 10 个针对特定未对齐行为的基准测试时,自动化系统能够在不降低整体性能的前提下改善每一项的表现。
该研究由 Anthropic 学者陈元翰(Chen Yueh-Han)领导,系统复现了传统研究方法的诸多环节。每个自动化系统都会搜索现有文献、提出一种方法,然后用该方法对模型进行 30 分钟的训练,通过多次迭代逐步提升基准测试成绩。有效的方法被保留,无效的方法则被丢弃,使系统能够快速且大规模地运行。
论文指出:"总的来说,这些结果提供了早期证据,表明自动化对齐后训练可能在不久的将来变得实用。"
这篇论文是迈向递归自我改进的一步,许多人认为这是 AI 进展的下一个重要步骤。如果模型能够改进自己的对齐训练,它们很可能也能在更广泛的范围内改进训练方法——到那时,人类 AI 研究人员可能很快就会变得过时。
论文毫不回避地讨论了这个想法,将自动化对齐研究者(AAR)与其人类同行进行了明确比较。论文指出:"最好的 AAR 方法平均在六小时内就能胜过经验丰富的 人类提出的方案","人类引导的研究方向并不能带来更强的性能"。
甚至还有成本比较,以防有人还不相信。"AAR 的 API 推理成本约为每小时 4 美元,而我们支付给人类研究人员的费用是每小时 150 美元。"
公平地说,论文也指出了这种方法的一些局限性。自动化系统的有效性取决于基准测试是否准确反映实际的对齐目标,而建立和维护这些基准测试本身就需要大量工作——更不用说维护和扩展自动化研究者所依赖的文献了。