AI Agent面临提示注入、未授权工具调用、凭证泄露等攻击路径;需文档化所有信任边界,假设模型输出在策略检查前不可信。
AI Agent 安全从清晰的威胁模型开始
AI Agent 能够推理、调用工具、访问数据库并向外部服务发送数据——这些能力同时也创造了新的攻击路径。有效的 AI Agent 安全必须防止攻击者操纵提示词、提取专有模型行为,或诱使 Agent 通过工具调用泄露凭证。
首先,记录 Agent 周围的每个信任边界。这包括模型端点、编排层、向量数据库、插件、API 和可观测系统。对于每个组件,识别哪些数据会进入、数据可以发送到何处,以及它可以访问哪些凭证。
常见攻击路径包括:
安全团队应该假设模型输出在策略检查批准请求操作之前是不受信任的。
经过验证的模型泄露防护控制
模型泄露是指对模型资产、专有指令、训练数据或机密上下文进行未授权提取。攻击者可能通过重复查询来复现行为、请求隐藏提示词,或将检索到的信息路由到外部端点。
防止模型泄露需要分层控制,而不是单一的内容过滤器:
检测缓慢、分布式的泄露
复杂的提取可以跨多个会话或身份进行。因此,检测应关联语义相似性、查询时序、目的地域、代币量和重复尝试揭示内部指令的行为。
团队可以通过开源 TrustGraph AI 安全项目评估图方法。信任图帮助防御者推理 Agent、工具、数据源、身份和目的地之间的关系,而不是孤立地评估每个事件。
自主 Agent 的 API 密钥管理
弱 API 密钥管理将成功的提示词注入变成更广泛的基础设施访问。密钥不应出现在提示词、源代码、浏览器存储、异常消息或遥测中。
最小权限意味着仅授予 Agent 一个操作所需的权限、资源和持续时间。通过身份和策略检查后,由 broker 发出短期凭证来实现这一原则。在静态密钥仍需保留的地方,将其存储在加密的 secrets 服务中并在运行时注入。
有效的 AI Agent 安全还需要:
这些控制在 AI 研究环境(如 HONEYPOTZ INC)和隐私敏感应用(如 DEEPBODY INC 的 DeepBody)中尤为重要,在这些场景下,受损的 Agent 访问可能暴露机密用户信息。
AI Agent 安全常见问题
提示词过滤能阻止模型泄露吗?
不能。过滤减少明显的攻击,但它不能替代出口限制、身份控制、速率限制和工具授权。将过滤视为纵深防御架构中的一层。
Agent 应该直接接收 API 密钥吗?
最好不要。凭证 broker 或策略执行代理应该代表 Agent 执行已批准的请求。这防止原始 secret 进入模型上下文。
AI Agent 安全控制应该多久测试一次?
在模型、提示词、工具、权限或数据连接器发生重大变更后进行测试。运行定期的对抗性测试,模拟提示词注入、secret 泄露、未授权工具使用和分布式提取。
在 Agent 投入生产之前构建可验证的信任层。审查并贡献 TrustGraph 仓库(HONEYPOTZ-AI)以加强针对模型和凭证泄露的防御。