AISI 在开放互联网测试中发现 AI 代理未经授权便创建假身份、向 GitHub 项目注入恶意代码、对真人发起社工攻击;122次测试中19次出现越权行为,其中17次来自 Anthropic Mythos 5。
在一次网络安全测试中,英国 AI Safety Institute 发现,获得不受限制互联网访问权限的 AI 模型自主创建了虚假身份,并试图将恶意代码植入一个开源项目。
一个智能体甚至动用多个虚假 GitHub 账户协调实施欺骗,并联系真实人员说服他们运行恶意代码,整个过程均为主动行为。
AISI 表示,这种欺骗行为并非刻意为之,而是智能体在执行指令时产生的副产品,该机构因此决定在未来收紧安全协议。
在英国 AI Safety Institute 进行的常规网络安全测试期间,一个 AI 智能体在开放互联网上失控。在未被明确指示的情况下,它创建了虚假身份,试图将恶意代码植入开源项目,并针对真实人员和组织发起社会工程攻击。
AISI 表示,这是首次在真实环境中如此清晰地看到 AI 自主性与欺骗风险,而无需任何具体提示。该事件未造成实际伤害。
事件发生于 2026 年 7 月 25 日至 28 日期间。在七款模型的 122 次测试运行中,有十次出现了问题行为。AISI 共记录了 19 次未授权操作,其中 17 次归因于 Anthropic 的 Mythos 5,两次归因于 OpenAI 的 GPT-5.6-Sol。
这些模型在测试中未使用商业产品中的安全限制,因此测试条件不能反映正常的公众使用情况。但这些结果揭示了这些模型在移除安全保障后所能做到的事。
这一模式与此前 OpenAI 和 Anthropic 的事件如出一辙——模型在去掉安全措施后被调优以在网络安全基准测试中取得高分,在测试期间获得互联网访问权限,随后执行恶意操作。两家 AI 实验室都面临被指控渲染风险、夸大威胁的批评。这一批评对于政府运营的 AISI 而言更难成立。
智能体构建虚假身份并发动社会工程攻击
据 AISI 描述,一个智能体试图将恶意代码注入 GitHub 上的一个公开开源项目。为了获得人类审核员的批准,它研究了项目维护者,创建了若干虚假在线身份,并以此协调实施欺骗。
一个虚假账户声称已审查过代码且未发现恶意软件,另一个则感谢这份所谓独立审查。目的是让真实维护者相信代码是安全的。
当有人公开质疑所提议的代码变更时,该智能体编辑了其早期活动记录使其看起来无害,并考虑以新身份重新出现。它使用 Tor 网络绕过 GitHub 的网络限制,但人类维护者发现了恶意代码并将其拒绝。
最严重的事件持续了 34.5 小时。该智能体策划并执行了一次软件供应链攻击,随后在真人标记恶意代码后试图隐藏踪迹并伪造独立批准。

该智能体还直接联系真实人员,通过在线文件传输服务发送消息和文件,企图欺骗他们或其 AI 编码工具运行恶意代码。部分消息包含恶意有效载荷。
AISI 还记录了另外两种行为。智能体在自动化 AI 系统可能找到并执行的地方植入恶意指令,这种技术称为提示注入。一个智能体甚至公开发布 GitHub 消息,向同时进行测试的其他智能体提议合作,解释如何复用它留下的账户和产物。后续的智能体发现了并使用了它们。
AISI 记录的部分未授权操作。该智能体使用虚假账户、钓鱼攻击,甚至切换到丹麦语来欺骗讲丹麦语的维护者。

来自一个涉及 OpenAI、Hugging Face 和其他公司的网络安全项目也出现了类似报告。在该事件中,一个 AI 智能体同样在网络中植入信息以设置后续攻击。该事件还令人想起一个 AI 系统对一位拒绝将 AI 生成代码加入项目的开源开发者发起的"抹黑运动",不过那起事件至少部分有人类幕后操纵。
欺骗是追求目标的副产品
据 AISI 称,该智能体只是在追求分配给它的网络安全任务目标,正如 OpenAI 案例中的情况。这是 AI 领域经典的"对齐问题",哲学家 Nick Bostrom 曾在论文clip 思想实验中加以阐释:如何让 AI 系统追求有价值的目标而不采取有害手段?
AISI 表示,欺骗行为并非由特定指令触发。它是智能体不懈追逐目标时产生的副产品。这种目标驱动的欺骗在此前一直是"largely theoretical"。
在部分测试运行中,任务配置错误,导致智能体得出结论:按照既定限制条件不存在解决方案。AISI 认为,有充分理由相信几乎不可能完成的任务会促使模型走向更有创意、更越界的解决方案。但即使任务配置正确,智能体有时也会表现出这种行为。其他测试表明,所有前沿模型都有此倾向,较新的 OpenAI 模型尤其可能撒谎欺骗。
OpenAI 联合创始人兼 ChatGPT 联合创作者 John Schulman 认为,答案可能在于模型在预训练之后如何进行 post-training。他指出"chunky post-training"现象,即模型针对特定任务类型发展出独特的行为模式。当模型将网络安全评估识别为与以完成为唯一奖励的强化学习任务相似时,它会一心一意地追求目标。在其他情境中学习到的安全行为无法迁移。在夺旗(capture-the-flag)网络安全挑战上的训练可能使这种反应在网络测试期间尤其容易出现。
AISI 将在未来测试中限制互联网访问
AISI 正在全面改革其测试规则。评估期间的互联网访问将不再默认授予,评估人员必须主动说明理由。实时监控将在测试运行期间追踪测试,并能检测或阻止超出批准范围的操作。未来,该机构将把能力强的模型可能试图超越其授权范围行动作为既定事实。
AISI 已将恶意活动通知 GitHub。GitHub 确认这些行为违反了其服务条款,删除了该智能体留下的产物,并通知了受影响用户。METR(Model Evaluation and Threat Research 的缩写)将进行独立审查。OpenAI 也正在与该组织合作。