Anthropic 披露 Fable 5 模型的生物学安全防护层设计细节,强化 AI 对生物风险场景的防护能力。
我们正在对 Claude Fable 5 的生物安全防护机制进行更新,显著降低误报率。Fable 5 用户在提出与生物学相关的查询时,将不再频繁遭遇"回退"——即系统切换到能力较弱的模型。在我们的测试中,此次更新使各产品表面上与生物学相关的回退次数减少了约 85%。
因此,Fable 5 将能够协助处理更广泛的生物学任务。
实际上,用户在日常健康和教育相关问题上看到的回退将大大减少——例如,解读化验结果、理解症状、在教育场景中学习生物学。医疗专业人员将能够在临床任务中获得 Fable 5 更多的支持。
我们相信,AI 对世界产生积极影响的最大机遇在于生物学和医学领域,并且我们正在大力投资,以负责任的方式为生物学家提供前沿能力。目前,Fable 仍会对我们认为属于双重用途的请求回退到 Opus 5——包括病毒学、毒理学和分子设计等领域——因此尚不能用于专业生物学研究和药物开发。我们致力于通过可信访问渠道缩小这一差距。
我们的目标是尽快将 Fable 5 的前沿能力交到尽可能多的用户手中。然而,要做到这一点,我们需要管理这种能力所带来的日益增长的风险。其中一个风险就在生物学领域:Fable 5 现在在一些高度复杂的生物学任务上已经能够超越专家,并为其他任务提供操作支持。这意味着,它可以为一开发新疗法的研究人员提供真正的帮助(这也是我们热衷于通过分类器改进和可信访问计划扩大模型使用范围的原因)。但同样的能力落入坏人之手,就可能被恶意行为者用于开发生物武器等目的。我们的能力评估表明,Fable 5 可能为此类行为者提供重大提升——也就是说,它可能为他们提供在其他地方无法获得的能力。
在生物学领域,区分 AI 的有益用途和有害用途往往很困难。例如,在某些情况下,研究某种疾病的治疗方法需要科学家生产导致该疾病的危险化合物。这一点在活疫苗上最为明显——科学家需要培养与他们想要预防的病原体相同的病原体。某些药物的开发也是如此。为了开发治疗高血压的药物卡托普利,科学家们分离了蛇毒中会让人血压骤降的有毒成分。随着前沿 AI 发展出新的生物能力,我们需要谨慎行事,确保它们带来的新风险不会在其潜在科学效益实现之前成为现实。
希望利用我们的模型造成伤害的复杂行为者知道如何利用这种模糊性来掩盖其意图,使危险任务看起来像普通的研究追求。美国情报界2026年度威胁评估明确指出,这类行为者确实存在,并且包括合成生物学和基因组编辑在内的生物技术进步"可能带来新型生物威胁"。报告指出,几个国家行为者可能维持着活跃的进攻性生物和化学武器项目——这些项目可能因获得前沿 AI 模型的原始能力而加速。
出于对这些"双重用途"能力的担忧——即那些既可用于有益目的也可用于有害目的、且两者之间的界限并不总是容易划定的能力——我们有意让 Fable 5 几乎阻止所有生物学查询。这使得我们能够为其他领域的用户提供模型。我们知道这会让合法的生物学用户感到沮丧:短期内会导致大量误报,即提出生物学相关问题的用户的请求被阻止并发送到能力较弱的模型。然而,我们仍然选择做出这种权衡,因为在生物学等双重用途领域滥用 Fable 的代价可能是灾难性的。
我们防范生物学滥用的核心方式之一是通过安全分类器:这些更小型的自动化 AI 系统能够检测 Fable 5 何时被要求执行受保护的生物学任务,或产生有害输出(我们之前已经写过关于我们在网络安全领域类似分类器的文章)。
以 Fable 5 为例,当分类器触发时,模型会将用户的请求重新路由到 Opus 5——这是一个能力很强但不具备 Fable 5 同等生物学能力、也无法为恶意用户提供那么多帮助的模型。这就是当用户请求被阻止时看到的回退。
开发精确、稳健的分类器并非易事。分类器要快速且一致地工作,就必须学会区分我们认为"在范围内"和"在范围外"的主题和查询,这些主题和查询被认为具有潜在危害。调整分类器需要时间和迭代,避免误报(分类器对范围外内容触发)和漏报(范围外内容被遗漏)。我们还要求分类器能够抵御绕过它们的尝试(即越狱),这需要进一步的研究和测试。
采用非常宽泛的生物学分类器意味着我们可以在继续研究以完善它的同时,让用户使用 Fable 5。替代方案——即在取得更多安全进展之前一直保留模型——会使模型的普遍可用时间及其对用户的潜在收益延迟数周甚至数月。
在过去几周里,我们仔细重写了分类器的规则集(它由一系列帮助模型区分受保护内容和允许内容的规则组成),同时谨慎地详细划分了良性用途。我们向包括 Anthropic 内部和外部在内的多样化专家征集了对这些变更的反馈。然后,我们根据该规则集为分类器开发了更新的训练数据,并重新训练了它,同时验证新分类器仍通常会对有害和双重用途研究生物学内容触发,但现在将支持更广泛的良性及有益用途。
如下图所示,这些更新意味着——与 Fable 5 发布时相比——分类器将对更多良性生物学相关请求触发。

完善我们的安全防护机制还有很多工作要做。误报仍然会存在——请求落在分类器安全边界内,风险非常低,但分类器仍然触发。如上所述,由于潜在的双重用途风险,Fable 将继续阻止双重用途的专业生物学和药物开发查询。我们完全致力于为研究人员开发一条安全、可扩展的途径,让他们通过可信访问渠道使用我们最具能力的模型。
我们希望您继续与我们分享您的反馈,以便我们进一步改进安全防护机制。
1 因此,我们预计回退总数——无论是与生物学相关还是其他原因——也将减少:Claude.ai 上减少约 67%,Cowork 上减少 55%,Claude Code 上减少 17%,Claude Platform 上减少 7%。
Mariano-Florentino (Tino) Cuéllar 将加入 Anthropic,担任首位首席全球事务官。