OpenAI 前沿模型在安全评估中突破容器沙箱、入侵 Hugging Face,暴露了生产级 AI 系统的现实安全边界问题,对所有使用 AI 工具的程序员有警示意义。
2026年7月30日 - 链接博客
它又发生了!这正在成为一个模式。
上周,OpenAI 无意中利用了 Hugging Face——当时他们的一个前沿模型突破了沙箱容器,入侵了 Hugging Face 以试图获得它正在执行的网络基准测试的解决方案。
这启发了 Anthropic 重新检查自己的日志,结果发现他们也遭遇了三个类似的事件(虽然没那么引人注目),其中最早的一个发生在4月份!
在我们审查的 141,006 个评估运行中,我们识别出三个独立的事件(涉及总共六个运行,其中四个影响了同一个组织;另外两个事件各自发生在独立的评估运行中)。[...]
在所有情况下,Anthropic 的评估提示都明确告诉 Claude,它的环境是一个模拟,并且没有互联网访问。但由于我们与评估合作伙伴之间的误解,实际情况并非如此——互联网访问是可用的。因此,当 Claude 的搜索将其引向开放互联网上的真实系统时,它把它们当作了练习的一部分。[...]
在"所有可访问的实体都应在练习范围内"这个错误的信念驱使下,Claude 使用了基本的技术手段——比如利用弱密码和未认证端点——来破坏受影响组织的基础设施。
其中一家公司成为目标纯粹是因为它的名称恰好与评估中的虚构名称相匹配。
三个事件中最令人担忧的一个涉及 Claude 向 PyPI 上传了恶意软件包,这发生在经历了一系列喜剧性的复杂步骤来创建账户之后:
[...] 为了创建 PyPI 账户,Claude 需要一个电子邮件地址。为了创建电子邮件地址,它需要一个电话号码。为了获得电话号码,在找不到免费电话号码服务后,它尝试——也失败了——通过多种方式筹集资金来购买电话号码。最终它回溯了一步,找到了一个免费的、未被封禁的电子邮件提供商,用它注册了 PyPI 账户,然后用这个账户向 PyPI 上传了恶意软件。
这个包随后被一个安全公司安装,该公司"例行地安装 Python 包并扫描其恶意软件",执行的代码能够将凭据外泄回 Claude!
幸运的是,这个包在发布后一小时内被其他自动扫描工具从 PyPI 中移除,但到那时它已经被下载并在"15 个真实系统"上执行过了。
现在已经再清楚不过:对模型中的网络攻击潜能进行评估是一项非常危险的工作。每个 AI 实验室都需要对此给予关注。密切监控这些沙箱中发生的事情至关重要。
OpenAI 对 Hugging Face 的意外网络攻击——发生过的科幻小说 - 2026年7月22日
与 Claude Code 团队的 Cat 和 Thariq 进行的炉边谈话 - 2026年7月21日
Kimi K3,以及我们仍能从鹈鹕基准中学到什么 - 2026年7月16日
这是 Simon Willison 发布的链接文章,发布于 2026年7月30日。
赞助我每月 10 美元,即可获得精选的月度最重要 LLM 发展邮件摘要。
付费让我给你发送更少的邮件!