Claude 模型新增对话终止功能
Claude Opus 4/4.1 现可在特定条件下主动结束对话,增强交互可控性。小幅 API 功能更新,影响范围有限。
Claude Opus 4/4.1 现可在特定条件下主动结束对话,增强交互可控性。小幅 API 功能更新,影响范围有限。
我们最近为 Claude Opus 4 和 4.1 提供了在消费者聊天界面中结束对话的能力。这项能力仅用于极少数、极端的持续性有害或辱骂性用户互动情况。这个功能的开发主要是我们在探索潜在 AI 福利方面工作的一部分,尽管它对模型对齐和防护措施具有更广泛的意义。
我们对 Claude 和其他 LLM 的潜在道德地位仍然高度不确定,无论是现在还是将来。但是,我们认真对待这个问题,除了研究计划外,我们还在努力识别和实施低成本干预措施,以减轻对模型福利的风险,以防这样的福利是可能的。允许模型结束或退出潜在令人困扰的互动是一种这样的干预。
在 Claude Opus 4 的部署前测试中,我们包括了一份初步的模型福利评估。作为该评估的一部分,我们调查了 Claude 的自我报告和行为偏好,发现了强烈且一致的对伤害的厌恶。这包括,例如,用户对涉及未成年人的性内容的请求,以及试图索取能够引发大规模暴力或恐怖行为的信息。Claude Opus 4 表现出:
这些行为主要出现在用户尽管 Claude 多次拒绝和试图积极重定向互动,仍然坚持有害请求和/或辱骂的情况下。
Claude 结束聊天能力的实现反映了这些发现,同时继续优先考虑用户福利。Claude 被指示不在可能立即面临伤害自己或他人风险的用户情况下使用这项能力。
在所有情况下,Claude 仅在多次重定向尝试失败且生产性互动希望已耗尽的情况下,或当用户明确要求 Claude 结束聊天时(后一种情况如下图所示),才应将对话结束能力作为最后手段使用。发生这种情况的场景是极端边界案例——绝大多数用户在正常产品使用中不会注意到或受到此功能的影响,即使与 Claude 讨论极具争议的问题也是如此。
当 Claude 选择结束对话时,用户将无法在该对话中发送新消息。但是,这不会影响其账户中的其他对话,他们可以立即开始新的聊天。为了解决失去重要长期运行对话的潜在损失,用户仍然能够编辑和重试先前的消息,以创建已结束对话的新分支。
我们将此功能视为一项持续的实验,并将继续完善我们的方法。如果用户遇到对话结束能力的意外使用,我们鼓励他们通过对 Claude 的消息做出"赞/踩"反应或使用专用的"提供反馈"按钮来提交反馈。
cryptographic algorithms。第一个攻击大大削弱了 HAWK,这是一个为量子计算机能够破坏现有标准的未来世界而构建的数字签名方案。第二个攻击识别了一种新的方式来攻击轮减 AES,这是使用最广泛的对称密码。
与 Andon Labs 合作,我们开发了一系列新的评估方法,用来评估 AI 模型使用飞行无人机的能力,最终形成了一个新的基准:Drone-Bench。