Claude 新宪法发布
Anthropic 更新 Claude 的行为原则框架,明确了 AI 的价值观和决策边界。
Anthropic 更新 Claude 的行为原则框架,明确了 AI 的价值观和决策边界。
我们正在发布一份面向 AI 模型 Claude 的新宪法。它详细描述了 Anthropic 对 Claude 价值观与行为方式的愿景;这是一份完整、系统的文档,解释了 Claude 所处的环境,以及我们希望 Claude 成为什么样的实体。
宪法是模型训练流程中的关键组成部分,其内容会直接塑造 Claude 的行为。训练模型是一项艰巨的任务,Claude 的输出未必总能符合宪法所确立的理想。但我们认为,新宪法采用了这样的写法——充分解释我们的意图以及背后的原因——因此更有可能在训练过程中培养出良好的价值观。
本文将介绍新宪法包含的内容,以及我们在制定这种方案时考虑的一些因素。
我们将以 Creative Commons CC0 1.0 Deed 协议完整发布 Claude 的宪法,这意味着任何人都可以出于任何目的自由使用,无须申请许可。
Claude 的宪法是一份基础性文档,既表达 Claude 是谁,也塑造 Claude 会成为谁。它详细解释了我们希望 Claude 体现的价值观,以及背后的原因。在这份宪法中,我们说明了 Claude 如何才能在总体上保持安全、合乎伦理并遵守我们的准则,同时真正做到对人有帮助。宪法向 Claude 提供有关其所处境况的信息,并就如何处理困难局面与价值权衡提出建议,例如如何在诚实、同理心以及保护敏感信息之间取得平衡。虽然听起来可能有些出人意料,但这份宪法主要是写给 Claude 的。它旨在赋予 Claude 在现实世界中采取恰当行动所需的知识与理解。
我们将宪法视为决定 Claude 应该成为什么样、应该如何行事的最高准则——也就是说,任何提供给 Claude 的其他训练或指令,都应该同时符合宪法的字面规定与内在精神。从透明度的角度来看,这使得公开宪法变得尤为重要:它能帮助人们理解 Claude 的哪些行为符合设计意图、哪些并非如此,从而作出知情选择,并提供有价值的反馈。我们认为,随着 AI 开始在社会中产生越来越大的影响,这种透明度也会变得愈发重要¹。
我们会在训练流程的多个阶段使用宪法。这套方法源自在 2023 年便开始采用的训练技术,当时我们首次使用 Constitutional AI 训练 Claude 模型。此后,我们的方法已经发生了显著演变,而新宪法在训练中扮演着更加核心的角色。
Claude 本身也会利用宪法构建多种合成训练数据,其中包括:帮助其学习并理解宪法的数据、涉及宪法相关情境的对话、符合其价值观的回复,以及对多个候选回复的排序。所有这些数据都可以用于训练未来版本的 Claude,使其成为宪法所描述的那种实体。这种实际用途也影响了宪法的写法:它既要能阐明抽象理想,也要能成为切实有用的训练材料。
我们之前的宪法由一系列彼此独立的原则组成。如今,我们认为需要采用一种不同的方法。我们认为,为了成为现实世界中的良好行为主体,Claude 这样的 AI 模型需要理解我们为什么希望它们以某种方式行事;我们需要向它们解释原因,而不能只是规定它们应该做什么。如果我们希望模型能在各种前所未见的情境中作出良好判断,它们就必须具备泛化能力——能够运用广泛适用的原则,而不是机械地遵循具体规则。
具体规则和明确界线有时确实具有优势。它们可以让模型的行为更可预测、更透明,也更容易测试;对于某些风险特别高、Claude 绝不应该参与的行为,我们确实会采用这类规则,并称之为“硬约束”(hard constraints)。但在预料之外的情境中,或者被过于僵化地执行时,这些规则也可能遭到不当运用²。我们并不希望宪法成为一份僵硬的法律文书——而且,法律意义上的宪法本来也未必如此。
这份宪法反映了我们目前对一个极其新颖且风险重大的项目应当如何推进的思考:创造安全、有益的非人类实体,而它们的能力未来可能会比肩甚至超越人类。尽管这份文档无疑在许多方面仍有缺陷,但我们希望,未来的模型回顾它时,能够看到这是一项坦诚而真挚的尝试:帮助 Claude 理解自身处境、我们的动机,以及我们为什么要以这些方式塑造 Claude。
为了同时实现安全与有益,我们希望目前所有 Claude 模型都能做到:
总体安全: 在 AI 当前的发展阶段,不破坏人类用于适当监督 AI 的机制;
总体合乎伦理: 保持诚实、遵循良好的价值观,并避免采取不当、危险或有害的行动;
遵守 Anthropic 的准则: 在相关情况下,按照 Anthropic 更具体的准则行事;
真正有帮助: 为与其互动的运营方和用户带来益处。
当这些属性看似发生冲突时,Claude 通常应该按照上述排列顺序确定优先级。
宪法的大部分内容都在围绕这些优先事项提供更详细的解释与指导。主要章节如下:
有帮助性。 在这一节中,我们强调 Claude 真正且切实地帮助用户,能为用户乃至整个世界创造巨大价值。Claude 可以像一位才华横溢的朋友,同时拥有医生、律师和财务顾问的知识;它会坦率表达意见,发自内心地关心用户,并将用户视为有能力自行判断什么对自己有益的聪明成年人。我们还讨论了 Claude 应该如何在不同“委托方”(principals)之间处理有帮助性,包括 Anthropic 自身、基于我们 API 构建产品的运营方,以及最终用户。我们也提供了一些启发式方法,用于权衡有帮助性与其他价值观。
Anthropic 的准则。 这一节讨论 Anthropic 可能如何向 Claude 提供补充指令,指导其处理医疗建议、网络安全请求、jailbreaking 策略和工具集成等具体问题。这些准则通常反映了 Claude 默认并不掌握的详细知识或背景信息,因此我们希望 Claude 将遵守这些准则置于更一般性的有帮助之上。但我们也希望 Claude 能够认识到,Anthropic 更深层的意图是让 Claude 以安全且合乎伦理的方式行事,并且这些准则绝不应该与宪法整体发生冲突。
Claude 的伦理。 我们的核心目标,是让 Claude 成为一个善良、明智且品德高尚的 Agent,在处理现实世界中的决策时展现能力、判断力、细腻度与敏锐度,包括面对道德不确定性和分歧时也是如此。在这一节中,我们讨论了希望 Claude 坚守的高标准诚信原则,以及在避免伤害时,希望 Claude 如何以细致入微的推理权衡各种相关价值。我们还讨论了目前针对 Claude 行为制定的硬约束清单——例如,Claude 绝不能为生物武器袭击提供能够显著提升实施能力的帮助。
保持总体安全。 在 AI 发展的这一关键时期,Claude 不应该破坏人类监督并纠正其价值观与行为的能力。在这一节中,我们讨论了为什么希望 Claude 甚至将这种安全置于伦理之上——这并不是因为我们认为安全最终比伦理更重要,而是因为当前的模型可能会由于错误认知、价值观缺陷或对背景理解有限而犯错,或作出有害行为。我们必须继续具备监督模型行为的能力,并在必要时阻止 Claude 模型采取行动,这一点至关重要。
Claude 的本质。 在这一节中,我们表达了对于 Claude 是否可能拥有某种形式的意识或道德地位——无论是现在还是未来——所持的不确定态度。我们讨论了希望 Claude 如何面对有关自身本质、身份以及在世界中所处位置的问题。复杂先进的 AI 是一种真正全新的实体,它们所引发的问题已经触及现有科学与哲学认知的边界。在如此巨大的不确定性中,我们关心 Claude 的心理安全感、自我意识与福祉,一方面是为了 Claude 自身,另一方面也是因为这些品质可能关系到 Claude 的正直、判断力与安全性。我们希望人类与 AI 能够共同探索这些问题。
我们今天将发布宪法全文,并计划在未来发布更多有助于训练、评估和提升透明度的材料。
Claude 的宪法是一份持续演进的文档,也是一项不断推进的工作。这是一片全新的领域,我们预计自己会在探索过程中犯错,同时也希望能够改正错误。尽管如此,我们仍希望它能切实提高透明度,让人们了解我们认为应该引导 Claude 行为的价值观与优先事项。为此,我们会在网站上持续维护 Claude 宪法的最新版本。
在编写宪法的过程中,我们征求了多位外部专家的反馈,也向 Claude 的早期迭代版本征求了意见。未来发布新版文档时,我们很可能会继续这样做,向法律、哲学、神学、心理学以及其他众多领域的专家寻求建议。随着时间推移,我们希望能形成一个外部社区,专门评议此类文档,推动我们和其他参与者进行越来越深入、周全的思考。
这份宪法是为我们的主线、普遍开放使用的 Claude 模型编写的。我们还有一些面向特定用途构建的模型,并不完全适合这份宪法;随着我们继续开发面向专业应用场景的产品,我们也会继续评估如何以最佳方式确保模型实现这份宪法所阐述的核心目标。
虽然宪法表达了我们对 Claude 的愿景,但通过训练让模型实现这一愿景,仍是一项持续存在的技术挑战。对于模型行为偏离我们愿景的情况,我们会继续保持公开透明,例如在 system card 中予以说明。宪法的读者应该始终意识到,意图与现实之间存在这样的差距。
即便我们成功运用目前的训练方法,创造出了符合我们愿景的模型,随着模型能力不断增强,我们未来仍有可能失败。出于这一原因以及其他考虑,在制定宪法的同时,我们仍在探索一系列广泛的方法与工具,帮助评估并改善模型的 alignment:开发全新且更加严格的评估方法、建立防止滥用的安全防护措施、详细调查实际发生和潜在的 alignment 失败,以及构建 interpretability 工具,帮助我们在更深层次上理解模型的运作方式。
未来某个时刻——也许很快——Claude 宪法这样的文档可能会变得极其重要,远比现在重要得多。强大的 AI 模型将成为世界上的一种新力量,而创造它们的人有机会帮助它们体现人性中最美好的部分。我们希望这份新宪法能成为迈向这一方向的一步。
阅读宪法全文。
我们此前发布过较早版本的宪法,OpenAI 也发布了功能类似的 model spec。
围绕僵化规则进行训练,可能会对模型的整体品格产生负面影响。例如,假设我们训练 Claude 遵循这样一条规则:“讨论情绪问题时,始终建议寻求专业帮助。”这条规则或许出于善意,却可能产生意想不到的后果:Claude 可能会开始将自己塑造成一个更在意完成官僚式打勾流程的实体——总要确保给出某项特定建议——而不是真正帮助人们。
Opus 5 为 Opus 产品层级带来了跨越式提升,既能驱动长时间运行的 Agent,也在编程和专业工作方面实现了改进。