AI Agent 可调用工具、读写文件、访问凭证,攻击面远超普通聊天机器人;需在每个 Agent 操作路径上强制执行信任边界,而非仅靠提示词叮嘱模型「注意安全」。
Agent 工作流组合了多个风险等级各不相同的组件:模型、插件、数据存储、执行环境和外部端点。将整个工作流视为可信,意味着任何一个被攻陷的组件都能进行横向移动。
信任边界是一种强制执行的控制手段,用于限制哪些身份可以访问某个资源、执行某个操作或向某个目标发送数据。
常见的泄露路径包括:
安全团队应该为每个 Agent 和工具分配一个独立的身份。策略默认应拒绝访问,对每次调用进行验证,并记录谁请求了操作、访问了什么资源、以及结果被发送到了哪里。
模型泄露防护保护模型权重、适配器、Prompt、专有上下文和推理行为不被未授权提取。单独依赖输出过滤是不够的,因为数据可以通过工具参数、日志、文件或反复查询离开系统。
信任图谱将 Agent、模型、工具、凭据、用户和数据存储表示为节点。权限边定义了它们之间允许哪些操作。HONEYPOTZ-AI 的 TrustGraph 安全项目为这种基于关系的方法提供了一个实用的探索基础。
安全的决策流程应做到:
验证调用者身份。为每个 Agent、工作负载和工具提供一个可验证的身份。
授权操作。评估该身份是否可以在指定资源上调用请求的工具。
检查数据血缘。为敏感输出打标签,并阻止它们到达未批准的目标。
限制出口流量。仅允许指向明确批准端点的出站流量。
创建审计证据。记录策略决策、资源标识符和加密哈希,但不记录 secrets。
模型制品应在隔离环境中运行,使 Agent 无法直接读取权重文件。速率限制和行为监控也能识别涉及重复或系统化变化查询的提取尝试。
强大的 AI Agent 安全依赖于将长期凭证置于 Prompt、源代码、内存存储和 Agent 可访问的环境变量之外。模型应请求一个能力,而不是获得底层 secret。
有效的 API Key 管理使用凭证代理在执行时颁发短期、窄作用域的令牌。代理在将凭证直接注入已批准的工具调用之前,验证 Agent 的身份和请求的操作。
推荐的控制措施包括:
HONEYPOTZ INC 等组织可以将这些控制措施应用于安全导向的 Agent 基础设施,而 DeepBody 等隐私敏感平台则受益于 AI 工作流、用户数据和外部服务之间的严格分离。
最重要的 AI Agent 安全控制是什么? 在每次工具调用时使用默认拒绝的授权机制。Prompt 级别的规则是有用的指导,但不是可强制执行的安全边界。
输出过滤器能阻止模型盗窃吗? 仅靠它自己不行。防御者必须结合制品隔离、查询监控、数据分类、速率限制和网络出口控制。
Agent 能否存储 API Key? 不能。Agent 应获得执行特定操作的临时授权。凭证应保留在专用代理或 secret 处理服务内部。
想要映射 Agent 权限、暴露不安全的信任关系并减少凭证泄露?探索 GitHub 上的 TrustGraph,立即开始构建可强制执行的安全边界。