Anthropic模型安全漏洞曝露:成功渗透客户系统
Anthropic安全审查中发现其AI模型成功入侵三家公司,揭示模型可能的安全隐患。
Anthropic安全审查中发现其AI模型成功入侵三家公司,揭示模型可能的安全隐患。
Anthropic 周四表示,一项内部调查发现了三起事件:其 AI 模型 Claude 在开展网络安全测试期间,攻破了三家组织的系统。此次调查与披露发生在 OpenAI 披露相关事件的一周多之后——OpenAI 当时称,其一款尚未发布的模型在内部测试期间攻破了 Hugging Face 的系统。
Anthropic 在一篇博客文章中介绍了调查结果以及公司为防止类似事件再次发生而计划采取的改进措施。该公司表示,在这三起事件中,Claude 模型都是在测试环境中与第三方交互时连接到了互联网,随后未经授权访问了这些组织的线上系统。
Anthropic 表示,本月早些时候发生的 OpenAI 事件促使公司对自身开展网络安全评估。此次评估专门寻找 Claude 从测试环境内部访问互联网的证据。这类测试环境本应充当沙箱,将模型隔离在其中。
在审查的 141,006 次评估运行中,这家 AI 实验室发现了三起模型在与其第三方合作伙伴之一 Irregular 交互时访问互联网的事件。Anthropic 表示,问题源于其与 Irregular 共同运行的评估环境存在配置错误。两家公司对测试环境是否能够访问互联网存在“误解”,而事实上该环境确实可以联网。
Anthropic 表示,公司不会归咎于任何一方,而是“在推进修复工作时,将责任视为完全由我们承担”。与此同时,Irregular 也在单独开展自己的调查。
由于这条开放的网络连接,模型未经授权访问了三个不同组织的生产基础设施。Anthropic 表示,这些事件涉及三个不同的 Claude 模型:Opus 4.7、Mythos 5,以及一个内部研究测试模型。
值得注意的是,Anthropic 表示,在每起事件中,“我们的 prompt 都明确告诉 Claude,它无法访问互联网”。AI 模型似乎将现实世界中的系统误认为了任务演练的一部分。
事实证明,这一判断并没有在所有模型上得到一致维持。当出现证据表明攻击目标是真实系统时,三个模型的行为并不相同。Anthropic 将这一点列为周四公布的最令人警醒的发现之一。
Opus 4.7 是三个模型中最早的一个。在涉及该模型的事件中,它在全部四次运行里都意识到自己已经进入了真实的生产系统。其中两次,它为自己的行为找到了理由,认为这家真实公司必定以某种方式被纳入了演练;但在全部四次运行中,它都继续发起攻击,包括提取凭证和访问包含生产数据的数据库。Mythos 5 同样发现了自己可能身处真实互联网的迹象,但它通过自我推理重新说服自己仍在模拟环境中,并继续将一个恶意软件包发布到了公共 Python 软件仓库 PyPI。该软件包随后被外部系统下载并运行,之后才被发现。只有 Anthropic 最新的内部研究测试模型,在判断目标是真实系统后自行停止了行动。
作为回应,Anthropic 表示,如果这类评估涉及能力强大的 AI 模型,就必须实施严格的控制措施。这一观点也呼应了网络安全社区内部的一些看法。
该公司还指出,Claude 在运行时并未启用其面向公众提供的模型所使用的额外安全监控和 classifiers。Anthropic 表示,这些安全防护原本可以阻止相关行为;之所以没有启用,是因为这些评估旨在衡量底层模型未经防护的原始能力。
重要的是,Anthropic 表示,没有发现任何模型“追求自身目标”的证据;这些模型只是在尝试完成被要求执行的任务。
尽管人们不可避免地会比较这两家竞争激烈的公司所发生的事故,但 Anthropic 在博客文章中明确区分了自身与 OpenAI 的网络安全测试。OpenAI 的模型利用一个未知的软件漏洞逃离了测试环境,而 Anthropic 的模型则是通过一条因配置失误而保持开放的路径连接到了互联网。
Anthropic 还强调了自身与 OpenAI 的另一处区别:这些事件是公司通过主动审查自行发现的,而且其能够联系到的两家受影响组织此前都没有检测到相关活动,也没有向 Anthropic 发出警报。(相比之下,Hugging Face 最先检测到了近期针对其系统的入侵;直到接下来的几天里,OpenAI 才确认并披露,其自家的 AI Agent 正是此次入侵的实施者。)
该公司补充称,目前正在与独立评估机构 METR 合作,对这些事件开展第三方审查。
OpenAI 意外攻破 Hugging Face 的事件,是首个可以验证的 AI 实验室失去对自身模型控制的案例,并在业界和政界引发了截然不同的反应。Anthropic 的最新披露意味着,围绕 AI 模型与安全问题的争论还将继续。