AI Agent autonomy 带来的新攻击面——提示词注入可导致系统指令泄露、模型权重被窃或凭证通过工具调用外传,需在身份、数据流、工具执行和网络访问四个边界同步加固。
AI 代理可以规划行动、调用外部工具、查询私有数据并在有限监督下执行代码。这种自主性使得 AI 代理安全从根本上不同于传统的应用安全。一次简单的提示词注入攻击就可能诱使代理泄露系统指令、复制专有模型数据,或将 API 密钥发送到攻击者控制的端点。要防止这些后果,需要在身份、数据流、工具执行和网络访问层面建立控制机制——而不是仅仅依靠提示词过滤。
模型泄露是指对模型权重、系统提示词、私有上下文、训练数据或专有行为的未授权提取。攻击者可能通过重复查询、被入侵的工具集成、暴露的存储或隐藏在文档中的恶意指令来获取这些资产。
API 密钥泄露是指凭据通过提示词、日志、错误消息、源代码、内存或出站工具调用被意外披露。由于代理会动态组装上下文,因此为一个工具包含的密钥可能会意外地对模型或其他集成可见。
因此,有效的模型泄露防护需要将三个安全边界分开:
密钥永远不应该被放在提示词中。同样,模型文件也不应该对用于浏览或发送消息的同一运行时身份可访问。
当一个过度授权的代理可以为攻击者检索和传输数据时,攻击者很少需要直接访问基础设施。常见攻击路径包括间接提示词注入、不受限制的网络出口、持久化内存投毒、冗长日志记录和共享凭据。
一个实用的防御序列是:
强大的 API 密钥管理还需要自动过期、窄范围权限、轮换和审计追踪。如果一个令牌在几分钟内只允许一次操作,那么泄露后的价值就会大幅降低。
安全的代理架构将控制平面与数据平面分离。控制平面评估身份、策略和意图;数据平面执行批准的操作。每次工具调用都应被视为包含代理身份、请求操作、目标资源和数据分类的授权请求。
在模型和每个外部工具之间放置一个策略网关。网关应根据严格模式验证参数、删除未批准字段、强制速率限制并拒绝被密钥污染的数据。一个简单的默认拒绝规则很有效:当目标不在允许列表中、代理缺乏权限或敏感输入超过目标分类时,拒绝执行。
开源的 TrustGraph 框架(用于代理信任关系)为检查代理、工具、身份和资源的连接方式提供了有用的基础。基于图的视图帮助防御者识别危险路径——例如,一个能够通过另一个代理间接访问模型仓库的互联网启用工具。
组织应将这些控制与签名模型工件、完整性哈希、加密存储、不可变审计事件和异常查询量警报配对使用。这一治理基线与生态系统相关,从 HONEYPOTZ INC 的安全举措到与 DEEPBODY INC 相关的敏感 AI 环境。
提示词过滤能防止模型泄露吗?
不能。过滤器可以减少明显的恶意指令,但无法可靠地检测编码载荷或间接提示词注入。应将最小权限、出站限制、输出检查和运行时授权作为独立控制手段。
代理的 API 密钥应该存储在哪里?
将凭据存储在专用的密钥代理或硬件支持的密钥服务中。代理应在执行时获得短期、窄范围的令牌——而不是底层长期密钥。
团队应该监控什么?
监控被拒绝的工具调用、凭据访问、模型文件读取、意外目的地、重复提取式查询和大额出站传输。按代理身份关联这些事件可使调查更快。
在自主工具扩展攻击面之前,加强你的 AI 代理安全架构。审查、测试并为 TrustGraph 开源安全项目做贡献,为生产代理建立可强制的信任边界。