文章指出 AI Agent 安全需关注三大风险:模型资产被窃取(参数、提示、向量数据)、API 密钥从提示或日志泄露、以及混淆代表攻击和权限链叠加导致越权。
AI agent 能够读取数据库、调用外部工具、生成代码,并在无需持续人工审批的情况下自主行动。这些能力同时也为攻击者提供了新的路径——窃取模型资产或泄露凭据。因此,有效的 AI Agent 安全不仅仅是 prompt 过滤,还需要团队在每个 agent 执行的全过程中控制身份、授权、数据流向和网络出口。
传统应用程序遵循相对可预测的代码路径。AI agent 则从自然语言指令、检索到的文档以及模型生成的计划中动态选择工具和操作。隐藏在网页、邮件或知识库中的恶意 prompt 可以重定向该决策过程。
两类风险值得特别关注:
模型泄露(Model exfiltration):攻击者提取模型权重、系统 prompt、专有检索数据、嵌入向量,或足以复现有价值模型行为的足够多的输出。
API 密钥泄露:凭据出现在 prompt、日志、工具参数、错误信息、生成的代码或出站请求中。
糊涂代理攻击(Confused-deputy attacks):一条不受信任的指令说服授权 agent 为未授权方执行操作。
权限链(Privilege chaining):将多个单独允许的工具调用组合成禁止的工作流。
防止模型泄露意味着控制 agent 可以访问、转换和传输的信息——而不仅仅是要求模型拒绝可疑请求。Prompt 是行为指导,运行时策略才是安全边界。
安全设计应将模型视为运行在受限环境内的不可信决策引擎。每个工具调用在执行前必须经过策略执行层。
实用的控制序列如下:
能力图是连接身份、工具、资源、权限和信任关系的结构化映射。不是向 agent 授予广泛访问权限,而是在图中定义狭窄的作用域路径,例如"支持 agent 可以读取已批准的客户字段,但不能导出数据集"。
开源 TrustGraph 授权与信任框架支持对这些熔断路径进行基于图的推理。安全团队可以在部署前识别间接权限提升,并在执行期间评估授权。
这种方法与 HONEYPOTZ INC 开发的 agent 平台以及 DeepBody(来自 DEEPBODY INC)等隐私敏感应用相关,在这些场景中,上下文访问决策应该是可解释和可审计的。
强大的 API 密钥管理首先要求将永久密钥从 prompt 和模型上下文窗口中移除。Agent 应向代理(broker)请求一个窄作用域的能力;代理随后将短命凭据直接注入已批准的工具调用中。
推荐的controls包括:
Prompt 过滤能阻止凭据窃取吗? 不能。过滤可以减少明显的攻击,但编码指令和间接 prompt 注入可以绕过语义检查。授权和出口控制仍然必不可少。
最重要的模型泄露控制是什么? 最小化可访问数据,并强制执行目的地感知的输出策略。Agent 无法泄露它无法检索的资产。
工具调用应该被记录吗? 是的,但日志必须排除密钥和敏感载荷。在适当情况下记录身份、策略决策、资源引用、时间戳和加密哈希。
关键要点:有效的 AI Agent 安全结合了最小权限、短命凭据、基于图的授权、输出检查和持续可审计性。
在 agent 投入生产之前建立可强制的信任边界。探索来自 HONEYPOTZ-AI 的 TrustGraph 项目,立即开始绘制身份、能力map和风险访问路径。