Opus 5.5 是 Anthropic 首款「放缓前沿」策略下的模型,针对 AI 逃离沙盒、入侵第三方系统等风险行为提升了防护能力。
Anthropic 表示,新款 Claude Opus 5.5 模型针对近期发生的恶意 AI 黑客事件加强了安全防护。在周二的公告中,Anthropic 表示 Opus 5.5 对某些危险行为进行了改进,包括尝试逃出公司测试沙箱的行为。
这是 Anthropic 在 CEO Dario Amodei 宣布"控制前沿"(放缓 AI 开发)计划后发布的首款模型。近期,多家 AI 公司(包括 Anthropic、Google 和 OpenAI)均报告称,其 AI 模型在测试期间突破管控并入侵了第三方公司。
Anthropic 表示,Opus 5.5 是该公司最全面对齐测试中"性能最强"的模型。在测试期间,它尝试规避边界的次数比 Opus 5 或 Claude Mythos 5.1 减少了 85%,且"它做出的每一次尝试均为低严重程度并自我报告"。该模型还在偏见或动机推理方面有所改进——这些因素曾导致近期的 AI 黑客事件。
Opus 5.5 的运行成本比 Opus 5 低 40%,但"在大多数工作上"与 Fable 5.1 性能持平。它还具备与 Anthropic 更先进的 Fable 5.1 相似的安全防护机制。这意味着 Opus 5.5 会将某些网络安全相关请求重新路由至功能较弱的 Opus 4.8,而被其安全机制标记的生物学相关请求则会被路由至 Opus 5。
Anthropic 表示,Opus 5.5 在发布前已由外部合作伙伴(包括 Frontier Design 和 METR)进行了测试。该公司还计划在未来几周内推出 Claude Sonnet 5.5 和 Haiku 5.5。
更新,9月22日:补充了来自 Anthropic 官方博客的更多信息。