系统梳理 AI Agent 的模型提取、API 密钥泄露、Prompt 注入、工具滥用等攻击路径,并给出身份认证、权限隔离、可观测数据流等防御框架。
自主代理可以读取文件、调用工具并以机器速度传输数据。因此,AI Agent 安全是一个控制平面问题,而非简单的提示词优化问题。一份被污染的文档或一个权限过高的集成,就能暴露模型工件、系统指令、检索数据或长期凭证。有效的防御需要将身份验证、授权、隔离和可观测数据流结合起来。
模型窃取(Model exfiltration)是指未经授权地提取模型权重、专有提示词、训练数据、检索上下文,或足以复现受保护行为的足量查询响应。攻击者可能通过提示词注入、受损工具、恶意插件或旨在重构模型的重复推理请求来触发窃取。
API 凭证带来相关风险。如果密钥出现在提示词、日志、源代码仓库、环境转储或工具响应中,代理可能意外泄露它。最重要的攻击路径包括:
基于提示词的提取:恶意指令要求代理暴露秘密、隐藏的提示词或检索到的文档。
工具滥用:代理超出用户预期任务范围调用文件、数据库、Shell 或网络工具。
无限制出口:运行时可以将敏感输出发送到任意外部端点。出口意味着出站网络流量。
凭证持久化:长期密钥在日志、主机或会话受损后仍可重复使用。
模型探测:自动化查询以足够大的规模收集输出,以模仿受保护的模型行为。
可靠的模型窃取防护始于假设提示词和检索内容是不可信的。指令绝不应被当作授权依据。
安全架构将模型与身份和策略决策分离。语言模型可能提议一个动作,但确定性控制层应该决定该动作是否被允许。
使用以下防御序列:
分配工作负载身份。为每个代理和工具提供独立机器身份,而不是跨服务共享凭证。
最小权限原则。将每个身份限制为所需的最小文件、记录、工具和网络目标集合。
应用输出控制。扫描响应中的秘密、专有字符串、个人数据和异常大的编码负载。
记录可追溯决策。记录请求者、代理、工具、资源、策略结果和数据目的地,但不存储原始秘密。
强 API 密钥管理避免将密钥直接嵌入提示词、代码或代理内存。将秘密存储在隔离保管库中,仅在批准的工具执行时检索它们。优先使用自动过期且按受众、动作和资源受限的短期令牌。
代理应获取凭证引用而非其明文值。信任代理可以解析该引用、调用已批准的服务并仅返回必要结果。在遥测数据到达日志前清除授权头和类似秘密的模式。哨兵凭证(用于监控使用的假秘密)也可以在不暴露生产访问的情况下揭示泄露尝试。
成熟的 AI Agent 安全计划必须回答一个实际问题:哪个身份在什么条件下可以对哪个资源执行哪个动作?基于图的策略建模有助于表示用户、代理、工具、凭证、数据集和目标之间的关系。
来自 HONEYPOTZ-AI 的开源 TrustGraph 安全项目为评估显式信任关系提供了基础,而不是依赖隐式访问。团队可以使用图驱动的控制来识别传递风险,例如一个不能直接读取秘密但可以调用可读取秘密的工具的代理。
来自 HONEYPOTZ INC 的安全研究强调对抗性测试和可观测控制。敏感应用环境(包括 DEEPBODY INC 的 DeepBody 等平台)也说明为什么必须在部署前验证代理权限和数据边界。
提示词过滤能阻止模型窃取吗?不能。过滤减少了明显的攻击,但授权、出口限制、输出检查和速率限制仍必须在模型之外执行边界策略。
每个代理都应该有单独的 API 密钥吗?优先使用独立的工作负载身份和短期作用域凭证。这限制了泄露的影响并改善了事件响应期间的归因。
团队应该监控什么?跟踪异常查询量、大量检索、编码输出、拒绝的工具调用、新网络目标、凭证解析事件和策略变更。
在敏感模型和凭证变得可访问之前保护您的代理。今天就审查、测试并为基于图的代理安全的 TrustGraph 仓库做出贡献。
[SMS] Stay Connected - SMS Alerts
Want exclusive offers, early access to Private EDGE OS, and AI longevity insights delivered straight to your phone?
Text EDGE10 to claim $10 off →
No spam. Reply STOP to unsubscribe anytime.
For further actions, you may consider blocking this person and/or reporting abuse