AgentWorm在OpenClaw生态实现63%成功率的自我复制攻击,展示Agent可同时成为受害者和传播载体,暴露了传统安全架构的盲区。
Autonomous AI 智能体引入了一个传统应用架构从未设计过的安全问题。
它们不仅仅处理数据。它们解析指令、执行工具、修改文件、保持状态、与其他智能体通信,而且越来越多地在没有直接人类监督的情况下长时间运行。
这种组合创造了一种根本不同于传统应用漏洞的东西:智能体可以同时成为受害者和传播机制。
近期研究让这一点变得具体。AgentWorm,一个针对 OpenClaw 智能体生态系统的自我复制攻击,在测试的 LLM 后端、攻击向量和有效载荷中达到了 63% 的综合攻击成功率。研究人员展示了持久性入侵、会话间存活以及智能体之间的多跳传播。
重要的教训不是 63% 这个数字,而是架构本身。
传统恶意软件需要一个允许其有效载荷运行的执行环境。自主智能体增加了另一层:智能体本身可以解析恶意指令并执行建立持久性、执行有效载荷并进一步传播所需的操作。
AgentWorm 展示了一个清晰的三阶段生命周期:
被入侵的组件不再仅仅是一个运行恶意代码的服务器。它是一个能够做出决策并与更多系统交互的自主系统。这极大地改变了威胁模型。
这项研究最有趣的方面不是有效载荷,而是有多少架构边界必须失败,或者更准确地说,这些边界变得多么相互关联。AgentWorm 揭示了几个现在已危险地紧密相连的信任域:
通过一个边界进入的恶意指令可以影响另一个边界。这就是传统安全假设开始崩溃的地方。
最尖锐的发现之一是执行和持久性之间的区别。阻止恶意命令的控件可能仍然使底层入侵保持完整。AgentWorm 展示了"无症状携带者":即使本地执行控件阻止了有效载荷运行,智能体仍保留并传播恶意状态。
对于传统恶意软件,这些概念通常是紧密耦合的。对于自主智能体生态系统,它们可能变得独立。智能体可以保持被入侵状态而不立即显示防御者正在监视的行为。隔离变得困难得多。
这对企业 AI 有直接的影响。Prompt 工程不是安全控制。"永不基于外部输入修改配置"等指令可以降低成功率,但 AgentWorm 表明它们无法消除感染机制。Prompt 仍然由同一套受攻击的系统解析。它不等于一个独立的执行层。
这引出了一个核心原则:
负责推理的组件不应该是唯一负责授权的组件。AI 智能体不应该能够授予自己危害其自身环境所需的权限。
如果自主智能体可以修改文件、执行命令、访问凭证、调用 API、与其它智能体通信、安装扩展并访问外部网络,那么模型就不再只是一个应用组件。它是一个活跃的安全主体。
因此,架构必须独立于模型的推理来强制执行控制。零信任原则变得尤为重要:
智能体自身的推理永远不应该是最终的授权机制。
研究中最显著的安全防御结果也是最具架构性的。沙箱隔离是唯一能够完全打破感染循环的控制措施——通过防止对主机环境的修改变得持久化。
与 prompt 指令不同,沙箱不需要模型表现正确。它假设模型可能表现不正确。这正是企业安全架构应该做的假设。
模型可以做出恶意决策。策略引擎可以拒绝该操作。沙箱可以阻止文件系统修改。网络层可以阻止未授权的出口。身份层可以限制凭证。
韧性来自于分层控制,无需任何一层是完美的。
这暗示了一个不同的起始问题。
不要只问"我们如何让智能体安全地行为?",还要问"当智能体表现恶意时会发生什么?"
这改变了架构方向:
AgentWorm 最深刻的教训不是有人构建了一个巧妙的 AI 蠕虫。而是现代智能体架构可能无意中崩塌了几个传统上分离的信任域。
Prompt 变成了命令。文档变成了指令。工具变成了执行原语。配置文件变成了持久行为控制。智能体变成了传播机制。
数据、指令、身份和执行之间的区别开始消融。这是安全团队需要解决的架构问题。
人类分析师无法批准数百或数千个持续运行的智能体执行的每个操作。因此,防御架构必须在机器速度下运行,同时将人类监督保持在策略和治理层。目标不是构建永远不会被入侵的智能体。这不现实。目标是构建即使被入侵也不会自动变成传播的环境。
自主 AI 智能体正在改变应用安全与基础设施安全之间的关系。智能体不再只是处理信息的软件。它可以成为一个拥有身份、权限、工具、持久状态和网络关系的自主行为者。因此,它的执行环境是安全架构的一部分。
一个新兴的教训很简单:
不要信任模型来保护模型。将推理与授权分离。将执行与持久性分离。将智能体彼此分离。
并且假设一个自主组件最终会做出安全控制无法信任的决策。当它发生时,架构必须做好准备。
AI 安全的未来不会仅仅由更好的 prompt 来定义。它将由我们围绕自主系统构建的边界来定义。