Anthropic 为 Claude Fable 隐形 guardrails 道歉
Anthropic 就 Claude Fable 不透明的安全限制向用户道歉。影响程序员对模型能力和行为的预期管理。
Anthropic 就 Claude Fable 不透明的安全限制向用户道歉。影响程序员对模型能力和行为的预期管理。
Anthropic 已就暗中限制其新 AI 模型 Claude Fable 5 的性能一事道歉。该公司通过隐藏的安全护栏限制模型,妨碍研究人员和竞争对手使用它开发竞品系统。Anthropic 表示正在改变做法,今后会更透明地说明限制何时触发——即便这意味着 Fable 会拒绝更多查询。
Fable 是 Anthropic Mythos 级 AI 系统中首个广泛开放使用的模型。过去数月,Anthropic 一直警告称,这一系列模型过于危险,不适合公开发布。Anthropic 表示,通过为 Fable 配备安全措施,阻止它响应某些“高风险”查询,已经解决了其中一部分风险。Anthropic 明确表示会限制 Fable 响应的领域之一是蒸馏(distillation),即利用大型 AI 模型的输出来训练较小模型的一种技术。
在 Fable 的系统卡(system card)中——这是 AI 开发者用来公开说明系统如何运作的文档——Anthropic 表示,对于其认定为蒸馏尝试的查询,将直接修改并降低模型回答的质量。用户不会收到已触发这项安全措施的通知,也不会被告知响应内容已经遭到修改。
Anthropic 表示,现在将调整处理蒸馏请求的方式:该公司在 X 上发帖称,此类查询今后会回退至 Claude Opus 4.8,也就是 Anthropic 上一代旗舰模型。Anthropic 还会向用户作出醒目的提示:“每次发生这种情况,你都会看到提示。”
这与 Fable 处理其他高风险领域查询的方式类似。当生物学、化学和网络安全等领域的安全功能被触发时,查询会被路由至 Opus 4.8;除非该查询因 Anthropic 更广泛的安全规则而被直接拦截,例如涉及毒品、武器或其他违禁内容的规则。在某些情况下,尤其是生物学领域,安全措施的适用范围被设定得过于宽泛,导致 Fable 面对哪怕最基础的查询也几乎无法使用。Anthropic 发言人 Paruul Maheshwary 在给 The Verge 的评论中承认了这一点。
Anthropic 在 X 上写道:“可见的安全措施可能会被反复探测,因此它们必须足够稳健,而要做到这一点需要时间。不可见的安全措施可以更有针对性地触发,让我们得以快速发布,同时将误判降到极低。正因如此,我们选择了不可见的安全措施——但这是一次错误的权衡。你应该能够了解我们部署了哪些安全措施,以及这样做的原因。很抱歉,我们没有把握好其中的平衡。”
在此之前,Anthropic 决定暗中限制那些疑似试图将 Fable 蒸馏为竞品模型的用户,引发了 AI 研究社区的强烈反弹。批评者警告称,这项安全措施也可能影响试图评估这一前沿模型的第三方机构。Anthropic 在系统卡中表示,新一代模型具备加速 AI 开发的能力,因此有理由针对这类请求采取限制;同时还指出,“使用 Claude 开发竞争模型,本就已经违反了我们的服务条款(Terms of Service)。”Anthropic 此前曾指责 DeepSeek 等中国竞争对手以“工业化”规模不公平地蒸馏其模型。