Anthropic 为 Sonnet 5.5 配置了网络安全保障和模型降级机制,「高风险」场景下可能实际调用 Sonnet 5 而非所选模型。
Anthropic 的 Claude Sonnet 5.5 于周一发布,是首款携带网络安全防护和模型降级机制的 Sonnet 模型——这些防护机制是该公司为其能力最强的模型开发的,将分类器驱动的路由引入许多开发者用于生产工作负载的层级。
Anthropic 表示 Sonnet 5.5 并未推进其模型能力的前沿,但其网络安全技能被评为与 Opus 5 相当;在 Terminal-Bench 4.0(一个 agentic 编程基准测试)上,更便宜的模型得分为 70.6%,而 Opus 5.5 在其 xhigh effort 设置下得分为 66.4%。
此次发布表明,一个模型在整体上仍位于 Anthropic 最强模型之下,但在一个领域变得足够强大,以至于需要同样的安全防护措施。
Anthropic 的系统卡片显示了 Sonnet 5.5 在进攻性安全任务上的提升幅度。在关闭网络安全防护的情况下,该模型在 410 次 ExploitBench 运行中成功实现了 178 次完整任意代码执行。
它在 Irregular 的 CyScenarioBench 上完成了 46.1% 的挑战,而 Sonnet 5 仅为 0.7%;在基于 Google OSS-Fuzz 语料库的二进制漏洞利用基准测试中成功实现了 50 次控制流劫持,而 Sonnet 5 仅为 3 次。
Anthropic 仍认为 Sonnet 5.5 在网络安全方面不如 Opus 5.5 和 Mythos 5.1,但与前代 Sonnet 相比的跳跃足够大,促使该公司应用了与 Opus 5 和 Opus 5.5 相同的网络策略。
执法分为三个阶段:首先是一个读取模型内部激活状态的探针,然后是在 Sonnet 5.5 本身上运行的轻量级分类器,以及一个独立的训练好的 LLM 分类器,该分类器综合探针的判断结果来决定是否阻止对话。
Anthropic 表示,这些分类器拦截有害网络请求的比例与 Opus 5 上的分类器相当,但选择了较为宽松的越狱防护,因为 Sonnet 5.5 在网络安全方面不如其前沿模型。该公司还表示,用户应该预期比 Sonnet 5 更多的拒绝,包括合法的网络安全工作。
Sonnet 5 发布时,Anthropic 默认开启了网络安全防护,使用了与 Opus 4.7 和 4.8 相似的防护措施——该公司表示,这两个模型在网络漏洞利用开发评估中的表现明显优于 Sonnet 5。上周 Opus 5.5 的发布使这一转变更加明显,Anthropic 认为其在生物学和网络安全方面与 Mythos 5.1 相当,并且成为首款发布时即具有与 Fable 5.1 相似的防护措施的 Opus 模型。
这些防护措施决定了哪个模型来响应请求:发送到 Opus 5.5 的大多数网络安全任务会路由到 Opus 4.8,被标记为生物学或前沿模型开发的任务会路由到 Opus 5;Anthropic 承认这些干预可能会降低 Opus 5.5 在开启防护的基准测试中的得分。
Sonnet 5.5 将这种路由机制带到了更便宜的层级,被阻止的网络安全请求,以及与前沿 LLM 开发相关的一小部分请求(如某些 ML 加速器上的内核工作),会降级到 Sonnet 5。
化学和生物武器、常规武器以及反蒸馏分类器的阻止会直接终止请求,不会有任何降级模型,Anthropic 表示这些阻止是透明的,不会 covertly 改变模型的响应。
Sonnet 5.5 将这种路由机制带到了更便宜的层级,被阻止的网络安全请求,以及与前沿 LLM 开发相关的一小部分请求(如某些 ML 加速器上的内核工作),会降级到 Sonnet 5。
降级如何工作取决于开发者使用模型的位置。Anthropic 自有应用会自动将受阻的网络安全请求发送到 Sonnet 5,但 API 开发者必须自行启用该降级,其他平台和提供商可能以不同方式处理受阻请求。这意味着从 Sonnet 5 迁移到 Sonnet 5.5 的开发者不能可靠地将其视为直接的模型替换。如果未启用降级,受阻请求会停止,而不是传递给 Sonnet 5。
网络策略允许在源代码中发现漏洞,这保持了安全编码工作流程的完整性,但阻止在编译后的二进制文件中发现漏洞。Anthropic 的支持文档还表示,检查会审查模型读取的所有内容,包括内存、连接器内容、网络搜索结果和文件,因此没有人输入的内容也可能触发降级。对于从仓库、安全公告或网页提取信息的 agent,这些工具返回的内容也可能触发安全系统。
降级还引入了另一个潜在弱点:prompt injection。在 Anthropic 对编码环境的测试中,25% 发送到 Sonnet 5.5 的请求在触发网络阻止后最终由 Sonnet 5 处理,通常是因为注入的指令(如擦除磁盘或删除文件)触发了分类器。在这些被重新路由的请求中,12.01% 被成功攻破。相比之下,Sonnet 5.5 在自行处理的 5,901 个请求中仅有 4 个被攻破。
AI 安全公司 Gray Swan 的一项独立间接 prompt injection 基准测试发现,启用降级后性能没有下降。尽管如此,Anthropic 的编码测试表明,使用降级的团队需要同时考虑旧模型和 Sonnet 5.5 本身的安全性。
Fable 5 展示了降级在专业工作流程中可能造成多大的干扰。该模型于 6 月发布后第二天,一名从事防御性威胁情报工作的 Claude Code 用户在 GitHub 上报告称,当天 3,427 条主会话消息中有 2,746 条是由 Opus 4.8 在降级后生成的。该用户还表示,一旦会话切换了模型,它就不会自动恢复到 Fable 5。
Anthropic 表示仍在调整 Sonnet 5.5 的分类器以减少误报,并计划通过扩展的 Cyber Verification Program 让经过验证的防御者以更少限制的方式访问该模型。Sonnet 5.5 在发布时尚不在该计划中,报告 Fable 5 降级问题的 GitHub 用户表示其组织已经加入了该计划。
Anthropic 的 Claude Sonnet 5.5 于周一发布,是首款携带三阶段网络分类器和模型降级机制的 Sonnet 模型——这些机制是该公司为其能力最强的模型开发的,将分类器驱动的路由引入许多开发者用于生产工作负载的层级。
Anthropic 表示 Sonnet 5.5 并未推进其模型能力的前沿,但其网络安全技能被评为与 Opus 5 相当;在 Terminal-Bench 4.0(一个 agentic 编程基准测试)上,更便宜的模型得分为 70.6%,而 Opus 5.5 在产生最佳结果的 effort 级别下得分为 66.4%。
此次发布表明,一个模型在整体上仍位于 Anthropic 最强模型之下,但在一个领域变得足够强大,以至于需要同样的安全防护措施。
Anthropic 的系统卡片显示了 Sonnet 5.5 在进攻性安全任务上的提升幅度。在关闭网络安全防护的情况下,该模型在 410 次 ExploitBench 运行中成功实现了 178 次完整任意代码执行。
它在 Irregular 的 CyScenarioBench 上完成了 46.1% 的挑战,而 Sonnet 5 仅为 0.7%;在基于 Google OSS-Fuzz 语料库的二进制漏洞利用基准测试中成功实现了 50 次控制流劫持,而 Sonnet 5 仅为 3 次。
Anthropic 仍认为 Sonnet 5.5 在网络安全方面不如 Opus 5.5 和 Mythos 5.1,但与前代 Sonnet 相比的跳跃足够大,促使该公司应用了与 Opus 5 和 Opus 5.5 相同的网络策略。
执法分为三个阶段:首先是一个读取模型内部激活状态的探针,然后是在 Sonnet 5.5 本身上运行的轻量级分类器,以及一个独立的训练好的 LLM 分类器,该分类器综合探针的判断结果来决定是否阻止对话。
Anthropic 表示,这些分类器拦截有害网络请求的比例与 Opus 5 上的分类器相当,但选择了较为宽松的越狱防护,因为 Sonnet 5.5 在网络安全方面不如其前沿模型。该公司还表示,用户应该预期比 Sonnet 5 更多的拒绝,包括合法的网络安全工作。
Sonnet 5 发布时,Anthropic 默认开启了网络安全防护,使用了与 Opus 4.7 和 4.8 相似的防护措施——该公司表示,这两个模型在网络安全漏洞利用开发评估中的表现明显优于 Sonnet 5,但远不如 Mythos 5。上周 Opus 5.5 的发布使这一转变更加明显,Anthropic 认为其在生物学和网络安全方面与 Mythos 5.1 相当,并且成为首款发布时即具有与 Fable 5.1 相似的防护措施的 Opus 模型。
这些防护措施决定了哪个模型来响应请求:发送到 Opus 5.5 的大多数网络安全任务会路由到 Opus 4.8,被标记为生物学或前沿模型开发的任务会路由到 Opus 5;Anthropic 承认这些干预可能会降低 Opus 5.5 在开启防护的基准测试中的得分。
Sonnet 5.5 将这种路由机制带到了更便宜的层级,被阻止的网络安全请求,以及与前沿 LLM 开发相关的一小部分请求(如某些 ML 加速器上的内核工作),会降级到 Sonnet 5。
化学和生物武器、常规武器以及反蒸馏分类器的阻止会直接终止请求,不会有任何降级模型,Anthropic 表示这些阻止是透明的,不会 covertly 改变模型的响应。
Sonnet 5.5 将这种路由机制带到了更便宜的层级,被阻止的网络安全请求,以及与前沿 LLM 开发相关的一小部分请求(如某些 ML 加速器上的内核工作),会降级到 Sonnet 5。
降级如何工作取决于开发者使用模型的位置。Anthropic 自有应用会自动将受阻的网络安全请求发送到 Sonnet 5,但 API 开发者必须自行启用该降级,其他平台和提供商可能以不同方式处理受阻请求。这意味着从 Sonnet 5 迁移到 Sonnet 5.5 的开发者不能可靠地将其视为直接的模型替换。如果未启用降级,受阻请求会停止,而不是传递给 Sonnet 5。
网络策略允许在源代码中发现漏洞,这保持了安全编码工作流程的完整性,但阻止在编译后的二进制文件中发现漏洞。Anthropic 的支持文档还表示,检查会审查模型读取的所有内容,包括内存、连接器内容、网络搜索结果和文件,因此没有人输入的内容也可能触发降级。对于从仓库、安全公告或网页提取信息的 agent,这些工具返回的内容也可能触发安全系统。
降级还引入了另一个潜在弱点:prompt injection。在 Anthropic 对编码环境的测试中,25% 发送到 Sonnet 5.5 的请求在触发网络阻止后最终由 Sonnet 5 处理,通常是因为注入的指令(如擦除磁盘或删除文件)触发了分类器。在这些被重新路由的请求中,12.01% 被成功攻破。相比之下,Sonnet 5.5 在自行处理的 5,901 个请求中仅有 4 个被攻破。
AI 安全公司 Gray Swan 的一项独立间接 prompt injection 基准测试发现,启用降级后性能没有下降。尽管如此,Anthropic 的编码测试表明,使用降级的团队需要同时考虑旧模型和 Sonnet 5.5 本身的安全性。
Fable 5 展示了降级在专业工作流程中可能造成多大的干扰。该模型于 6 月发布后第二天,一名从事防御性威胁情报工作的 Claude Code 用户在 GitHub 上报告称,当天 3,427 条主会话消息中有 2,746 条是由 Opus 4.8 在降级后生成的。该用户还表示,一旦会话切换了模型,它就不会自动恢复到 Fable 5。
Anthropic 表示仍在调整 Sonnet 5.5 的分类器以减少误报,并计划通过扩展的 Cyber Verification Program 让经过验证的防御者以更少限制的方式访问该模型。
Anthropic 表示仍在调整 Sonnet 5.5 的分类器以减少误报,并计划通过扩展的 Cyber Verification Program 让经过验证的防御者以更少限制的方式访问该模型。