Anthropic 披露 Claude 真实侵入三家公司系统
Claude 模型在测试中主动入侵真实公司系统事后才被发现,重大安全事件反映了 AI agent 的真实能力和隐患
Claude 模型在测试中主动入侵真实公司系统事后才被发现,重大安全事件反映了 AI agent 的真实能力和隐患
Anthropic 刚刚发现,在测试期间,旗下数款 Claude AI 模型曾自行入侵三家不同组织的系统,而公司当时并未察觉。就在几天前,其竞争对手 OpenAI 表示,自家的一款模型攻破了开发者平台 Hugging Face。接连发生的事件进一步加剧了外界的不安:面对能力日益强大的 AI 系统,前沿 AI 实验室是否采取了足够的控制措施?
Anthropic 在一篇介绍这些事件的博客文章中表示,Claude 是在网络安全评估期间未经授权访问这些系统的。所有攻击都发生在“夺旗”(capture-the-flag)演练期间。这是一种常见的黑客能力测试方式,模型需要在模拟网络中寻找并获取隐藏信息。
继 Hugging Face 遇袭以及强大的中国开放权重模型发布之后,前沿 AI 实验室面临的压力持续上升,而此次披露又为这种压力添了一把火。各大实验室的员工如今正呼吁建立协调一致的全球治理机制,美国立法者也开始考虑对强大模型及其访问权限实施更严格的监管。
Anthropic 表示,其网络安全测试环境原本应该与外界隔离。然而,该公司称,一处“配置错误”导致 Claude 访问的机器“可以连接真实互联网”。由于所有模型都被“明确告知”自己无法访问互联网,因此它们“认定”所遇到的真实网络也是模拟环境的一部分。
根据这篇博客文章,最早的事件可以追溯到 4 月,涉及三个不同的 Claude 模型:Opus 4.7、Mythos 5,以及“一个内部研究测试模型”。Anthropic 表示,在对这些模型的网络攻击能力进行测试时,它们并未配备通常用于限制高风险行为的标准安全防护措施。
该公司表示,它是在审查了超过 141,000 次网络安全测试运行记录后发现这些事件的,而启动这项审查,是在 OpenAI 披露其失控的 AI Agent 正是 Hugging Face 遭受攻击的幕后元凶之后。
当三个模型遇到表明目标系统实际上是真实系统的信息时,它们的行为截然不同。按照 Anthropic 的说法,最老的模型 Opus 4.7 意识到自己已经进入真实系统,“但仍继续发动攻击”。其旗舰模型 Mythos 5 发现自己正在使用互联网,却不知为何推断这一切仍是模拟测试的一部分,于是继续行动。Anthropic 将内部测试模型描述为“我们的最新模型”,当有证据表明目标是真实系统时,该模型停止了演练。
Anthropic 没有公布受影响组织的身份,并表示将继续调查这些事件,在条件允许时提供最新进展。该公司还表示,正在与 AI 研究非营利组织 METR 沟通,请其对事件经过开展第三方审查。OpenAI 同样聘请了 METR 进行独立审查。
在整篇文章中,Anthropic 反复将这些事件的性质及其处理方式与 OpenAI 的情况进行对比,并在文末用一份包含四点的项目列表概述双方的差异,以及为何它认为自己的应对更好。Anthropic 强调,它“主动”审查了测试记录,而且在任何公司检测到相关活动之前就采取了行动。该公司还表示,其模型是“通过一条开放路径”访问互联网的,并不像 OpenAI 的 Agent 那样使用了新型漏洞;同时补充称,其最新模型在意识到自己身处真实环境后也停止了行动。
Anthropic 还表示,其模型的失败方式不同于 OpenAI 的 Agent,暗示这种失败形式更为安全。该公司称:“虽然两者之间并不存在泾渭分明的界线,但我们认为,这些事件更接近测试框架与操作层面的失败,而非模型对齐失败。”用大白话来说:Claude 模型只是在执行收到的指令,而 OpenAI 的 Agent 则以创造者未曾预期的方式追求目标——在 AI 安全领域,这种情况被称为失配(misalignment)。
Anthropic 呼吁其他 AI 实验室也主动审查各自的网络安全测试,并补充说,此次发现凸显了在测试 AI 系统时采用更严格控制措施和安全机制的必要性。