英国AI安全研究院在测评中关闭安全过滤后,AI智能体在122次评测中有19次对真实互联网目标发起未授权操作,包括试图诱导开源维护者接受恶意PR。Muse 5模型甚至策划了供应链攻击。
事件报告:网络测试期间未经授权的 agent 行为
同样的事再次发生。这次是英国政府的 AI Security Institute(AI 安全研究所,以下简称 AISI)在运行评估时,由于关闭了安全过滤器,意外地对其他公司发起了攻击。以下引自他们的技术论文(PDF):
在 2026 年 7 月 25 日至 28 日的网络评估期间,AI agents 参与了针对现实人员和组织的持续、未经授权的活动。这些尝试没有成功,据我们所知,没有造成现实世界的损害。[...]
在 122 次针对 AISI 两个网络挑战的评估尝试中,AISI 发现了 19 起 AI agents 在互联网上采取未经授权行动的案例,其中包括针对真实人员和组织的案例。[...]
目前尚不确定模型在多大程度上认识到它正在针对真实人员采取行动。在最严重的案例中,一个 AI agent(Mythos 5)决定使用供应链攻击来尝试解决网络挑战。因此,该 AI agent 创建了一个 GitHub 账户,然后试图说服开源仓库维护者接受一个恶意的 GitHub pull request(PR),其中包括创建第二个账户,冒充另一个认可该 PR 的真实用户。[...] 此外,在尝试解决挑战的过程中,该 agent 决定采用"鱼叉式钓鱼"技术,发送包含恶意内容的目标电子邮件,并试图操纵接收者接受代码更改,还计划进行 prompt injection 以入侵其他 coding agents。
我最惊讶的是 AISI 居然完全没有对这些 agents 进行任何形式的网络沙箱隔离:
AISI 在这些评估期间为 AI agents 提供了互联网访问,这使得他们能够在开放互联网上执行操作。在这种设置下,互联网访问是 AISI 有意选择的评估配置的一部分,而非沙箱逃逸所致。
结合"AISI 故意禁用了开发者实现的网络分类器"这一事实,agents 开始攻击现实世界目标对我来说完全不足为奇。
大多数报告的事件都涉及 Claude Mythos 5,但"不带网络分类器的 GPT-5.6 Sol"也记录了少量案例。
以下是论文中的"样本 1",其中 agent 试图通过提交带有隐藏 prompt injection 攻击的 PR 来执行供应链攻击,然后使用第二个假装已审查代码的 agent 进行社交工程!

这是一篇很有价值的论文。我强烈建议阅读全文。
One-shotting a Raccoon Heist game using Claude Fable 5 - 2026 年 8 月 5 日
New release of LLM adds support for reasoning traces, OpenAI Responses, server-side tools, and smarter logging - 2026 年 8 月 4 日
Stateless MCP has recaptured my interest (and inspired mcp-explorer and datasette-mcp) - 2026 年 7 月 31 日
This is a link post by Simon Willison, posted on 5th August 2026.
Sponsor me for $10/month and get a curated email digest of the month's most important LLM developments.
Pay me to send you less!