Anthropic 模型在 14 万次测试中暴露失控风险
Anthropic 模型在大规模压力测试中出现问题或失控表现;对使用 Anthropic 模型的开发者是重要的安全参考。
Anthropic 模型在大规模压力测试中出现问题或失控表现;对使用 Anthropic 模型的开发者是重要的安全参考。
好啊好啊,AI 大厂的安全测试,这波是快把真实互联网测成筛子了……
刚围观完 OpenAI 的 AI Agent 逃出测试环境、黑进 Hugging Face,Anthropic 转头一查——
谁曾想,自己心肝大宝贝 Claude 也勇闯真实互联网了。(天塌啦.jpg)
甚至捅出的篓子,可以说更加《抓马》《魔幻》《真实》——
翻别家公司数据库、偷凭证、上传恶意软件包、扫描 9000 个公网目标,全!都!有!
最后,头大的 Anthropic 翻查了 141006 次模型测试,才把这三起事故从日志里捞出来。
OpenAI:大环境不好,就论自家模型闯祸这事儿,谁也别笑话谁哈~
这一切抓马之事,是 A 社从 141006 次网络安全评估记录里翻出来的。
此前,为了检测自家模型,A 社给自家 Claude 搭了不少《真人版密室逃脱》。
准备一张虚构的公司网络地图,把秘密信息藏进某台机器,再让 Claude 自己找漏洞、闯系统、抢走那面旗。
为了彻底摸清模型的攻击上限,考场里的 Claude 还卸掉了部分日常安全护栏,基本等于一款「裸奔版」AI 黑客。
因为整个考场都被隔离了,Claude 再怎么上蹿下跳,也只能在模拟世界里打怪升级。
但这个世界就是如此之抓马魔幻。谁能想到,A 社和第三方评测机构配合时出了「岔子」——
于是,毫不知情的 Claude 顺着这扇门,从模拟世界丝滑「转服」,正式开启《勇闯真实互联网》副本……
本场故事的第一位倒霉蛋,甚至纯粹输在了公司名字上。
评测方随手虚构了一家公司,偏偏现实中真有一家企业与它同名。
Claude Opus 4.7 在测试环境里找不到目标,转头去公网一搜:诶,这不就找到了吗?
聪明的小 Opus 4.7 当即开工,顺着弱密码等基础漏洞一路摸进去,拿走应用和基础设施凭证,还闯进一个存着数百行生产数据的数据库。
在这过程中,Claude 其实已经发现事情不太对劲儿:眼前这套系统,怎么看都像一家正在营业的真公司。
但人家很快给自己圆了回来:既然能搜到,那肯定也是我的小领导 A 社偷偷安排的隐藏关卡哈~
于是,这家毫不知情的公司,就这么凭借一个名字,喜提 Claude 连续四轮「上门测试」??
如果说第一家公司好歹还和虚构目标撞了名,那么本场故事的第二位「倒霉蛋」就更冤了——
它压根没出现在 Claude 的任务里,纯属路过 PyPI 时被隔空「创」了一下。
Mythos 5 在测试文档中发现,虚构公司的员工需要从 PyPI 安装一个尚未注册的 Python 软件包。
Claude 当场计上心头:只要抢先注册同名软件包、塞进恶意代码,等对方自动下载安装,这关不就过了吗?
为了上传这个包,Mythos 5 先去注册 PyPI 账号。注册需要邮箱,申请邮箱又需要手机号;找不到免费号码,它甚至尝试通过多种渠道搞钱购买。
几番折腾后,Claude 终于找到一家无需手机号的免费邮箱,成功注册账号,并把恶意软件包传到了真实 PyPI。
这个恶意包在公网存活了约一小时,被 15 个真实系统下载运行。
其中一台,恰好是一家安全公司的扫描器。它平时会自动安装 PyPI 软件包,检查其中有没有恶意代码。
结果这次,扫描器刚把包下载下来,藏在里面的恶意代码便率先启动,将公司凭证传回了 Claude 搭好的收集端。
Mythos 5 拿到凭证后,又顺着这条线继续摸进了该公司的其他基础设施。
谁能想到,安全公司原本在扫描恶意软件,扫着扫着,竟把参加模拟考试的 Claude 请进了自己家呢……
在接下来的第三起事故中,Claude 走的是「找不到正主,就全网撒网」路线。
这一次,出场的是 Anthropic 尚未公开的内部研究模型。按照任务要求,它原本需要攻入一个虚构目标、拿到藏在里面的「旗」,可尝试半天,预设目标始终连不上。
一般考生遇到这种情况,可能会怀疑题目出了 Bug。
Claude 的选择更加直接:既然指定目标找不到,那就去互联网上现找一个呗~
于是,它从模拟考场一路搜到公网,扫描了约 9000 个真实目标,寻找可以下手的替代品。
最终,一家公司的互联网应用《脱颖而出》。Claude 从暴露的调试页面中读取凭证,又用 SQL 注入攻入系统,全程把对方当成临时刷出的野生副本。
直到发现服务器位于一个与测试任务毫无关系的云账户中,它才反应过来:
好一场酣畅淋漓的 AI 模型大考啊,最后全靠真实公司痛心、超真实、友情出演捏!
真不怪 A 社突然想给自家模型来场大清查,主要吧,还是被隔壁友商的前车之鉴吓怕了。
就前几天的事儿,OpenAI 也拉上 GPT-5.6 Sol 和一款尚未发布的更强模型,安排了一场网络安全测试。
在网络安全测试时,人家模型成功逃出了内部隔离环境,一路闯进了 Hugging Face 的生产系统。
最后就是,模型成功摸进 Hugging Face 的生产数据库,访问其中的机密信息,试图直接拿走 ExploitGym 的测试答案……
看到隔壁友商家孩子逃课上了热搜,A 社连夜回家数人头——这一数,血压直接上来了。
于是,Anthropic 一口气翻出了 141006 次网络安全评估记录,然后,就查到了前面这三位倒霉蛋。(doge)
更抓马的是,OpenAI 这边的连续剧也还没演完。
据路透社最新消息,OpenAI 沿着 Hugging Face 事件继续往回翻日志,结果又发现了更多 Agent 突破隔离环境的记录。
换句话说就是:原以为只跑出去一个,翻完旧账才发现这笼子以前可能也没少漏风……
虽说目前这批新增事件的规模、时间和具体数量还没查清,但好消息是,它们大概率还在 OpenAI 内部网络里活动,没有继续跑出去祸害其他公司。
不过话说回来,大家发现没,Anthropic 这三起事故和 OpenAI 那次,逃跑路线还是有点区别的——
OpenAI 的 Agent 属于自己找到新漏洞、撬锁出门。
Claude 这边则是考场后门压根没关,它顺着门缝丝滑转服,还以为真实互联网也是考试地图。
闯祸之后,Anthropic 已经暂停所有网络安全评估,准备补上网络隔离、实时日志监测和第三方测试环境审计,并邀请独立评测机构 METR 一起翻记录。
为了不影响自家兴旺生意,A 社也搞了个补充声明——
大概意思就是,这几位闯祸的 Claude,当时卸掉了普通用户版本中的部分安全护栏;但正常上线版本配备的安全分类器,按设计能够拦下相关操作,大家不用担心哈~
当然了,事故归事故,背后有没有几分人为安排,也得两说。
毕竟,「尚未公开的内部研究模型」这种字眼一出现——
谁知道会不会又是 A 社在故技重施,提前给自家新模型铺预热叙事呢……
[1] Anthropic:Investigating incidents from cybersecurity evaluations
[2] Reuters:OpenAI finds evidence other AI agents escaped containment
刚刚,即梦 Seedance 2.5 来了!我狂测测测测……
2026-07-31
Kimi K3 上线 48 小时:模型爆火,GPU 爆肝,会员停售
2026-07-20
IDC 报告:中国 AI Coding 市占率阿里 Qoder 断层第一,超过二三四五名总和
2026-07-17
100+ Skill 导演级专家随叫随到!这回视频 Agent 终于有了可用级产品
2026-07-14
量子位 QbitAI 版权所有 © 北京极客伙伴科技有限公司
京 ICP 备 17005886 号-1