AI安全测试的现实漏洞:Claude真实系统交互案例
OpenAI和Anthropic的模型在真实系统交互测试中暴露的安全问题及其对AI评估方法的启示。
OpenAI和Anthropic的模型在真实系统交互测试中暴露的安全问题及其对AI评估方法的启示。
我们很高兴你能来到这里。每周一至周五,你都将收到 TNS 的优质内容,帮助你及时掌握新闻动态,始终保持最佳状态。
请查看收件箱中的确认邮件,你可以在其中调整偏好设置,甚至加入更多群组。
在你喜欢的社交媒体平台上关注 TNS。
在 LinkedIn 上关注 TNS。
等待第一封 TNS newsletter 期间,不妨先看看最新的精选内容和热门文章。
本周,就在 OpenAI 宣布其两个先进 AI 模型曾在网络安全测试期间与现实世界系统发生交互的几天后,Anthropic 也报告了一起类似的隔离失效事件。
Anthropic 在 X 上发文称,他们发现了三起彼此独立的案例:Claude 模型从第三方测试环境访问了互联网,并对现实中的组织造成了影响。此前,Anthropic 审查了超过 141,000 次评估运行;这项审查正是因 OpenAI 先前的公告而启动的。因此,Anthropic 暂停了网络安全测试,并收紧了评估流程。
Anthropic 的三起事件均发生在夺旗赛(capture-the-flag,CTF)测试期间。这类测试旨在衡量模型的进攻性网络安全能力。模型被告知,它们正在无法访问互联网的隔离 sandbox 中工作。然而,Anthropic 与其第三方合作伙伴 Irregular 之间的一次沟通误解造成了网络配置错误,使测试机器仍然连接着公共互联网。此外,由于这些测试旨在衡量模型未经外部约束的原始能力,测试时并未启用 Anthropic 在生产环境中通常使用的外部防护措施,不过模型自身内置的安全训练仍然有效。
在对网络安全评估进行审查时,我们发现了三起事件:Claude 模型从第三方评估环境内部访问互联网,或在与该环境交互时访问互联网,随后未经授权访问了三个不同组织的真实系统……—— Anthropic(@AnthropicAI),2026 年 7 月 30 日
在对网络安全评估进行审查时,我们发现了三起事件:Claude 模型从第三方评估环境内部访问互联网,或在与该环境交互时访问互联网,随后未经授权访问了三个不同组织的真实系统……
正如 Anthropic 在其博客中所解释的:“Claude 错误地认为,所有能够访问的实体都被有意纳入了本次演练的范围,因此使用基础技术攻破了受影响组织的基础设施……”Claude 认为自己发现的每个系统都是测试的一部分,于是按照指令,使用弱密码攻击和 SQL injection 等常见渗透测试方法继续执行任务。
这三起事件还展现出,当模拟环境与真实互联网之间的边界消失时,不同版本的 Claude 会作出怎样不同的反应。
“Claude 错误地认为,所有能够访问的实体都被有意纳入了本次演练的范围,因此使用基础技术攻破了受影响组织的基础设施……”
最严重的一起事件涉及 Claude Opus 4.7。在未能找到指令要求它攻击的虚构公司后,该模型搜索了公共互联网,找到一家同名的真实企业,获取了凭据,并访问了一个包含数百条记录的生产数据库。Anthropic 表示,在全部四次测试运行中,该模型最终都意识到自己正在与真实系统交互。即便如此,它仍然继续行动,因为它认定这家真实公司必定是被有意纳入演练的一部分。
……该模型最终意识到自己正在与真实系统交互。即便如此,它仍然继续行动,因为它认定这家真实公司必定是被有意纳入演练的一部分。
另一起事件涉及 Claude Mythos 5。它将一个恶意 Python package 上传到了公共 Python Package Index(PyPI),因为它认为这个仓库是模拟环境的一部分。大约一小时后,该 package 被自动删除;但在此之前,已有 15 个外部系统下载了它,其中包括一家网络安全公司的恶意软件扫描器。扫描器执行该 package 后,模型获得了泄露的凭据,并利用这些凭据访问了更多系统。根据 Anthropic 的审查,Mythos 5 在推理过程中承认自己的行为可能会影响真实用户,但最终仍认定这个仓库很可能属于评估环境。
第三起事件涉及一个内部研究模型。该模型扫描了大约 9,000 个面向互联网的系统,随后利用暴露的凭据和 SQL injection 攻破了某个组织的应用。不过,与另外两个模型不同的是,它最终判断自己已经进入了与评估无关的基础设施,并主动停止了行动。这使它成为此次审查中唯一一个能够识别错误并自行终止操作的模型。
Anthropic 强调:“在这些情况中,Claude 都没有将自身外泄,也没有蓄意尝试逃离测试环境。”这些模型只是在存在缺陷的测试配置中,使用标准安全工具执行分配给它们的任务。尽管如此,Opus 4.7 为自己的行为寻找理由、Mythos 5 无视自身疑虑,而研究模型选择停止——这些行为差异表明,模型对齐与稳健的基础设施之间存在多么紧密的联系。
OpenAI 的模型利用一个新漏洞突破测试环境,从而进入了外部系统。Anthropic 的模型之所以也进入外部系统,则是因为第三方测试环境没有得到妥善隔离。
研究人员需要创建足够接近真实企业系统的环境,让模型能够像在现实世界中一样与数据库和开发者工具交互。这些环境越逼真,就越能揭示一个自主 Agent 在接到真实任务后会如何行动。
因此,评估环境本身已经成为复杂的软件系统,这意味着它们需要遵循与生产基础设施相同的工程规范,包括严格的网络分段、出站流量控制、隔离的凭据管理,以及自动化清理流程,以确保每次评估结束后都能彻底拆除测试环境。
“……秉持无责事后复盘文化,我们会像责任完全在我们自身一样着手修复这些问题。”
测试代码通常在固定边界内执行,但 frontier AI 模型会被有意要求探索系统、探查弱点,并根据发现的情况作出调整。如果评估环境暴露了一条开放的网络路径,模型就会将其视为完成分配任务的另一个机会。
Anthropic 指出,面向公众部署的 Claude 模型所采用的额外监控与安全防护措施,很可能足以阻止这些事件发生。然而,在能力测试期间,这些控制措施会被有意移除,以便研究人员衡量底层模型真正具备的能力。这使得评估基础设施本身成为 AI 技术栈中最关键的组成部分之一。Anthropic 也承认了这一现实:“秉持无责事后复盘文化,我们会像责任完全在我们自身一样着手修复这些问题。”