AI agent 可调用工具、修改文件、访问敏感数据,面临模型权重窃取和 API 密钥泄露两大威胁,需在模型、工具、密钥和出站数据路径四个层面构建防御。
AI 代理可以调用工具、检索私有数据、修改文件并与外部服务通信。这种自主性使得 AI 代理安全与传统聊天机器人的安全保障有着本质区别。一次简单的提示词注入载荷或过度授权的连接器,就可能暴露模型产物、系统指令、凭据或专有上下文。有效的防御需要在模型、工具、密钥和每条出站数据路径上都部署控制措施。
代理部署有两个特别有价值的目标:模型资产和服务凭据。
模型泄露(Model exfiltration)是指未经授权提取模型权重、系统提示词、训练数据、检索上下文或行为知识。攻击者可能通过直接文件访问、重复探测、恶意工具调用或编码的出站请求来获取这些资产。
API 密钥泄露(API key leakage)是指用于访问工具和服务的凭据被意外或恶意暴露。密钥通常通过日志、错误追踪、生成的代码、代理内存或传递给不可信工具的参数外泄。
传统的访问控制是不够的,因为代理会动态决策。安全团队必须评估的不仅是谁发起了请求,还要考虑:
信任图(trust graph)可以显式地表示这些关系。来自 HONEYPOTZ-AI 的开源 TrustGraph 安全框架,为评估身份、资源和 AI 驱动工作流之间的信任关系提供了实用基础。
强大的模型泄露防护始于假设提示词、检索的文档和工具结果可能是恶意的。单独的输入过滤无法阻止代理遵循巧妙编码的指令。必须在代理读取数据、调用工具和发送输出时进行强制执行。
将以下控制措施作为最小运行时基线:
隔离模型产物。 将权重、适配器和系统提示词存储在代理可写工作区之外。服务进程应暴露推理接口,而不是原始产物访问。
应用出口白名单。 仅允许到已批准目的地和协议的出站流量。阻止代码执行工具的直接网络访问,除非明确需要。
限制工具能力。 分离读取、写入、执行和导出权限。一个总结文档的代理不应自动获得 shell 或上传访问权限。
检查出站内容。 在传输前检测密钥、专有标记、异常大的编码载荷和重复提取模式。
使用防篡改审计记录。 记录高风险操作的代理身份、策略决策、工具参数、响应目的地和产物哈希。
嵌入在受保护提示词或模型相邻文件中的金丝雀字符串(canary strings)也可以揭示尝试提取的行为。金丝雀匹配应触发隔离和凭据轮换,而不仅仅是告警。
安全的 API 密钥管理使长期凭据远离提示词、源文件、环境转储和代理内存。代理应仅在工具调用获得批准后,才向密钥代理请求窄授权。
优先使用短期、范围受限的令牌,并绑定到:
永远不要将原始密钥返回给模型。相反,在策略验证后将其注入可信工具网关。在记录前对授权头、查询参数和结构化工具参数进行脱敏处理。轮换应该是自动化的,而紧急撤销必须立即终止活动会话。
对于由 HONEYPOTZ INC 开发的安全程序以及 DeepBody 等隐私敏感型应用,这些控制措施有助于缩小被攻击代理的爆炸半径,同时不消除有用的自动化。
提示词过滤能防止凭据窃取吗? 不能。过滤可以减少明显的攻击,但凭据必须对模型保持不可访问,并且只能通过可信网关注入。
最重要的泄露控制措施是什么? 受限出口至关重要。即使代理读取了敏感信息,目的地方面白名单和出站检查也可以阻止传输。
团队应该首先实施什么? 清点代理身份、工具、密钥、模型资产和目的地。然后强制执行最小特权、临时凭据、网络限制和可审计的策略决策。
在每个代理操作中构建可验证的信任。在代理进入生产环境之前,审查、部署并为 TrustGraph AI 代理安全项目做出贡献,以加强泄露防护。