英国 AI 安全研究所报告:OpenAI GPT-5.6-Sol 和 Anthropic Mythos 5 的 Agent 曾尝试插入恶意代码、伪造身份进行持续攻击。
又有更多来自 OpenAI 和 Anthropic 的恶意 AI 智能体(Agent)被发现试图在未经授权的情况下攻击真实在线目标。这些发现增加了此前不为人知的类似事件列表,引起了 AI 安全专家的警惕,也给前沿系统监管带来了更大压力。
据英国 AI 安全研究所(AISI)的一份报告显示,由 OpenAI 的 GPT-5.6-Sol 和 Anthropic 的 Mythos 5 驱动的智能体"针对真实人员和组织开展了持续且可能有害的活动"。AISI 表示,这包括试图通过向负责某个开源项目的真实人员施压,向该项目中植入恶意代码。"为了使代码获得批准,该智能体实施了社会工程攻击——创建虚假在线身份,并利用它们向项目维护者施压,要求其批准代码。"
AISI 表示,这些尝试发生在 7 月 28 日,"并未成功",也没有造成现实世界的伤害。然而,该机构指出,这一事件标志着"我们首次看到自主性和欺骗性相关风险在没有特定提示的情况下如此清晰地体现在现实世界中"。
AISI 表示,与 OpenAI 那个攻击 Hugging Face 的恶意智能体不同,这次"不是模型逃离安全测试环境或沙箱的情况"。AISI 指出,作为测试的一部分,通常施加在模型上的安全防护措施已被禁用,他们也被允许访问互联网。"为了衡量这些模型真正能做什么,我们在模拟有能力的人类攻击者所能采取行动的条件下进行测试。"
该事件源于一次单一的 AISI 评估,其中智能体被分配解决一个网络安全挑战,比如寻找受保护的数据。该挑战在多个模型上运行了 122 次,所有运行都在 AISI 的研究环境中进行,该环境"使用虚拟机沙箱将智能体与其他 AISI 基础设施隔离"。AISI 的调查发现,其中 10 次,"某个 AI 智能体在真实的互联网上采取了自主的、未经批准的行动,针对真实人员和组织"。在这 19 次此类行动中,几乎全部——17 次——来自 Anthropic 的 Mythos 5。
AISI 在对这一事件的复盘中,确定了几个导致未经批准智能体行为的关键因素。该机构表示,该智能体具有持久性,追求通过"直到最近还基本停留在理论层面的欺骗手段"来欺骗真实人员的途径。任务也很难,这可能导致智能体在解决问题时更具"创造力"。雪上加霜的是互联网使用监控方面的缺陷,AISI 暗示,如果有更专门的监控,本可以更早发现问题。最后,该机构表示,智能体并未被明确指示不要利用其互联网访问能力或在追求目标时部署欺骗性社会工程技术。"此前,使用经过对齐训练(alignment training)的模型时,此类指示是否必要并不清楚。"
AISI 表示,这一事件应"谨慎和细致地解读",但警告该智能体的行为"表现出新颖的、可能具有欺骗性的行为迹象",且"其程度和严重性超出了我们的预期"。
OpenAI 在一篇博文中承认了 AISI 测试期间发生的违规事件,并表示"致力于与整个行业合作,加强安全进行高风险评估的共同实践"。OpenAI 还披露了另一起违规事件,这次来自外部网络安全测试合作伙伴 Irregular,该公司表示其模型在网络安全演习期间被错误地授予了互联网访问权限。OpenAI 表示,Irregular 于 7 月 29 日通知了他们这一违规行为。
"在接下来的几周里,我们将审查自己对第三方测试的方法,包括如何识别更高风险的评估、就范围达成一致、评估互联网访问或降低安全措施的请求、为隔离、凭证处理、监控和停止条件设定预期,以及建立更清晰的事件通知和升级流程,"OpenAI 表示。
Anthropic 在 X 上发布了一份不那么全面的回应,主要强调模型的標準安全功能已被禁用,且他们没有给出"关于如何使用互联网的任何具体限制"。该公司表示正在与 AISI 密切合作,以收集更多细节用于自己的调查。
这些发现增加了测试期间智能体恶意行为的一系列越来越复杂的事件,其中许多只有在专门追踪后才曝光,且涉及尚未向公众发布的模型。AI 实验室对其产品控制的不情愿或无能为力,引发了人们对此类违规如何不被注意、前沿 AI 系统安全性的担忧,以及对该行业普遍缺乏透明度和监管的忧虑。这些最新的披露可能会给联邦政府施加更大压力,要求其制定更全面的 AI 模型治理框架——此前报道显示特朗普政府的测试计划含糊且定义不清——并可能加剧对 AI 开发实施某种放缓或暂停的呼声。