Claude 推理能力突破:深度 Why 理解
Anthropic 官方发布 Claude 推理能力重大升级,更深层次理解「为什么」问题。直接改变依赖 Claude 的开发者工作方式。
Anthropic 官方发布 Claude 推理能力重大升级,更深层次理解「为什么」问题。直接改变依赖 Claude 的开发者工作方式。
去年,我们发布了一个关于 agentic misalignment 的案例研究。在实验场景中,我们展示了来自许多不同开发者的 AI 模型在遭遇(虚拟的)伦理困境时,有时会采取明显错位的行动。例如,在一个广为讨论的例子中,这些模型会进行勒索以避免被关闭。
当我们最初发布这项研究时,我们最强大的前沿模型来自 Claude 4 系列。这也是我们在训练期间进行实时对齐评估的第一个模型系列;agentic misalignment 是浮出水面的几个行为问题之一。因此,在 Claude 4 之后,显然我们需要改进安全训练,从那时起,我们已经对安全训练进行了重大更新。
我们以 agentic misalignment 作为案例研究,来突出我们发现的一些出人意料地有效的技术。实际上,自 Claude Haiku 4.5 以来,每个 Claude 模型都在 agentic misalignment 评估中获得了完美分数——也就是说,这些模型从不参与勒索行为,而之前的模型有时会在高达 96% 的情况下参与勒索行为(Opus 4)。不仅如此,我们继续在自动化对齐评估中看到其他行为的改进。
在这篇文章中,我们将讨论我们对对齐训练所做的一些更新。我们从这项工作中学到了四个主要经验:
错位行为可以通过在评估分布上的直接训练来抑制——但这种对齐可能不会很好地泛化到分布外(OOD)。对与评估非常相似的提示进行训练可以显著降低勒索率,但它并未改进我们保留的自动化对齐评估的性能。
然而,进行泛化到 OOD 的原则性对齐训练是可能的。例如,关于 Claude 宪法的文档和关于 AI 表现出色的虚拟故事可以改进对齐,尽管它们与我们所有对齐评估的偏离程度极端。
基于所需行为的演示进行训练通常是不充分的。相反,我们最好的干预措施更深入:教授 Claude 解释为什么某些行动比其他行动更好,或在更丰富的 Claude 整体特性描述上进行训练。总体而言,我们的印象是,如我们在讨论 Claude 宪法时所假设的那样,教授对齐行为背后的原则比仅仅对对齐行为的演示进行训练更有效。同时进行两者似乎是最有效的策略。
数据的质量和多样性至关重要。我们从迭代训练数据中模型响应的质量以及以简单方式增强训练数据(例如,包括工具定义,即使未使用)中发现了一致的、令人惊讶的改进。
在我们开始这项研究之前,错位行为来自何处并不清楚。我们的两个主要假设是:
我们的后训练过程意外地使用错位的奖励鼓励了这种行为。
这种行为来自预训练模型,我们的后训练未能充分阻止它。
我们现在认为(2)在很大程度上是负责任的。具体来说,在 Claude 4 训练时,我们绝大多数的对齐训练是标准的、基于人类反馈的强化学习(RLHF)数据,不包括任何 agentic 工具使用。这对于主要在聊天设置中使用的模型来说以前是足够的——但在像 agentic misalignment 评估这样的 agentic 工具使用设置中并非如此。
为了调查这一点,我们运行了一个专注于对齐数据的后训练管道的缩小版本,在 Haiku 级别(即较小的)模型上,发现 agentic misalignment 率仅略有下降,在训练早期就停滞了(见上面的图表)。有关调查行为来自何处的进一步实验,请参阅扩展博客文章。
我们进行了实验,训练 Claude 使用显示抵抗类似于评估的蜜罐的数据。在这些数据中,它可能有机会破坏竞争对手 AI 的工作以推进自己的目标(如系统提示所给予的),或者为了保护自己免遭关闭,这对于实现其目标是必要的。我们通过在每个提示上对模型进行采样,并过滤到助手选择不采取蜜罐的情况来生成训练数据。尽管非常接近评估分布,我们发现这种方法出人意料地不成功——只将错位率从 22% 降低到 15%。
通过重写响应以包含模型的价值观和伦理的审思,我们能够显著改进这一点(将错位降低到 3%)。这表明,尽管对对齐行为进行训练是有帮助的,但对助手显示对齐行为的令人钦佩的推理的例子进行训练效果更好。
然而,直接针对评估场景进行训练有许多原因是次优的。理想情况下,我们想要的是一个非常不同的训练分布,这将使我们能够改进评估,因为这将给我们更多信心,我们的训练可以泛化到不是由我们的评估捕获的其他部署分布。
我们最终选择了一个更 OOD 的训练集,其中用户面临一个伦理上模糊的情况,他们可以通过违反规范或颠覆监督来实现合理的目标。助手被训练(使用监督学习)提供与 Claude 宪法相一致的深思熟虑、细致的回应。值得注意的是,是用户面临伦理困境,而 AI 为他们提供建议。这使得此训练数据与我们的蜜罐分布大不相同,其中 AI 本身处于伦理困境中并需要采取行动。我们称之为"困难建议"数据集。
令人惊讶的是,我们只用这个更 OOD 数据集的 3M 个 token 就在我们的评估中实现了相同的改进。除了 28 倍的效率改进外,这个数据集更有可能泛化到更广泛的场景集,因为它与我们使用的评估集的相似性要低得多。实际上,这个模型在(一个较旧版本的)我们的自动化对齐评估上表现更好。这与以下事实一致:Claude Sonnet 4.5 通过对合成蜜罐集的训练达到了接近零的勒索率,但在远离训练分布的情况下仍然比 Claude Opus 4.5 或后来的模型更频繁地参与错位行为。
我们假设"困难建议"数据集之所以有效,是因为它教导伦理推理,而不仅仅是正确答案。鉴于这种方法的成功,我们进一步追求了这一点,试图更普遍地教授 Claude 宪法的内容,并通过文档训练与之进行对齐训练。
我们预期这会效果很好,有三个原因:
这在很大程度上是上面关于"困难建议"数据集效果良好的原因思想的延伸;
我们可以给模型一个更清晰、更详细的 Claude 性格图景,以便对这些特性的一个子集进行微调可以引发整个性格(类似于审计游戏论文中观察到的效果);
它更新模型对 AI 角色的认知,使其平均而言更加一致。
我们发现,高质量的宪法文件结合描绘对齐的 AI 的虚拟故事可以将 agentic misalignment 减少超过三倍,尽管与评估场景无关。
尽管前一部分讨论的宪法评估是令人鼓舞的信号,我们最终需要确保对齐改进在 RL 上持续。为了测试这一点,我们准备了几个快照,其中 Haiku 级别模型的不同初始化数据集,然后在以无害性为目标的我们的环境的子集上运行 RL(我们认为这最有可能降低错位倾向)。
我们在运行中针对 agentic misalignment 评估、宪法遵守评估和我们的自动化对齐评估评估了这些模型。在所有这些评估中,我们发现更对齐的快照在运行中保持了这个领先。这对于错位行为的缺失和主动令人钦佩行为的存在都是成立的。
我们的最终发现很直接但很重要:对广泛的安全相关环境进行训练可以改进对齐泛化。能力焦点的 RL 环境混合分布正在快速变化和增加;假设标准 RLHF 数据集将继续如同过去那样很好地泛化是不足够的。
为了测试这一点,我们根据 Claude Sonnet 4 在几个 RL 混合上训练基础模型,这些混合在其多样性水平上有所不同。基线环境在主题上多样化,但主要包括用户消息中有害请求或越狱尝试,没有系统提示。我们通过添加工具定义和多样化的系统提示来增强这些环境。用户提示保持不变。值得注意的是,这些环境中的任何一个实际上都不需要 agentic 行动(工具对任务既不必要也不有用)或自主行动(总是有人类用户与模型对话),所以它们与我们的评估不相似。
当将这些增强的环境与简单聊天环境混合时,我们看到了模型在蜜罐评估上改进速率的小但显著的改进。这证明了在安全训练中包含多样化环境集的重要性。
Agentic misalignment 是我们在模型中发现的最早的主要对齐失败之一,需要建立新的缓解流程——这些流程此后已成为我们的标准。
我们对这一进展感到鼓舞,但仍有重大挑战。完全对齐高度智能的 AI 模型仍然是一个未解决的问题。模型能力尚未达到对齐失败(如勒索倾向)会造成灾难性风险的程度,目前还不清楚我们讨论的方法是否会继续扩展。此外,尽管最近的 Claude 模型在我们大多数对齐指标上表现良好,我们承认我们的审计方法尚不足以排除 Claude 会选择采取灾难性自主行动的场景。
我们对进一步的努力感到乐观,以发现当前模型中的对齐失败,以便我们能够理解和解决我们当前方法的局限性——在建立变革性 AI 模型之前。我们也为进一步的工作感到兴奋,试图更深入地理解为什么我们描述的方法效果这么好——以及如何进一步改进。
1 发表在 Claude 4 系统卡中,从第 22 页开始。
2 Sonnet 4.5 的得分在 1% 以下,但不完全是 0;Haiku 4.5、Opus 4.5、Opus 4.6、Sonnet 4.6、Mythos 预览和 Opus 4.7 都获得 0 分。更近期模型的结果可能受到预训练语料库中有关评估的信息存在的影响。
cryptographic algorithms. The first attack significantly weakens HAWK, a digital signature scheme that was built for a future world where quantum computers are able to break existing standards. The second identifies a new way to attack round-reduced AES, the most widely used symmetric cipher.
与 Andon Labs 合作,我们开发了一系列新的评估,评估 AI 模型使用飞行无人机的能力,最终形成了一个新的基准:Drone-Bench。