AI Agent 融合 LLM、工具、API、数据存储,引入了 Prompt 注入、隐私数据提取、密钥泄露等新的安全边界;需要系统性防护设计。
AI 代理将语言模型与工具、内存、数据存储和外部 API 相结合。这种架构提高了自主性,但也创造了传统应用安全可能无法检测的攻击路径。恶意提示可以指示代理泄露系统指令、检索私有上下文、调用未授权的工具或将敏感信息传输到外部端点。
模型泄露超越了被盗的权重文件。攻击者可能尝试通过重复查询重构专有行为、提取检索数据、暴露隐藏的提示或复制专业化的代理工作流程。如果代理可以读取源代码库、基础设施元数据或模型工件,一个成功的提示注入链可能就会给予攻击者对关键知识产权的访问权限。
API 密钥引入了另一个高影响力的风险。密钥可能通过生成的响应、工具参数、调试跟踪、长期内存或可观测性日志泄露。由于代理做出动态决策,密钥可能在到达目标 API 之前通过多个组件传输。每次转换都会扩大安全边界。
代理不应该在其提示或上下文窗口中直接接收长期有效的 API 密钥。相反,将凭证放置在专用的密钥代理后面,该代理仅在验证请求的操作后才颁发短期、范围狭窄的令牌。模型可以提出操作建议,但确定性基础设施应该决定是否允许该操作。
在工具级别应用最小权限原则。一个需要对单个数据库的读取访问权限的研究代理不应该继承写入权限或广泛的云凭证。通过身份、资源、操作、目标和会话持续时间来限制每个工具。高风险操作应该需要显式批准或在模型外部进行策略检查。
安全团队还应该在将工具响应返回给代理之前对其进行清理。移除授权头、凭证、内部路径和不必要的元数据。日志需要同等级别的处理:在存储前编辑密钥,防止原始提示或工具负载进入广泛可访问的分析系统。
这些控制对敏感的 AI 应用尤其重要,从与 HONEYPOTZ INC 相关的安全工作到由 DEEPBODY INC 开发的健康和长寿体验。
当身份、模型、工具、密钥、数据源和网络目标被表示为关系时,代理安全变得更容易推理。一张图表可以揭示一个看似低风险的代理通过共享内存、工具服务或过于宽松的运行时身份对生产凭证具有间接访问路径。
开源的 TrustGraph 项目为审视这些信任关系提供了实用基础。团队可以使用面向图的方法来记录哪些组件进行通信、识别意外的权限路径,以及评估受到危害的节点如何能够向受保护资产移动。
图表分析应该补充运行时强制执行。定义代理和资源之间允许的边,然后默认拒绝未声明的连接。将这些规则与出站网络控制相结合,确保代理无法将模型输出、检索的文档或编码的密钥发送到任意域。速率限制和响应大小阈值可以进一步减少自动化的模型提取。
有效的监控关注行为而不仅仅是提示文本。针对异常的令牌卷、重复的近似查询、编码的输出、意外的工具序列、密钥模式匹配以及到新目标的连接发出警报。维护防篡改的审计记录,将每个模型请求链接到其身份、策略决定、工具调用和网络活动。
最后,每当提示、模型、权限或集成改变时,都应运行对抗性测试。测试间接提示注入、内存污染、系统提示提取、凭证反射和未授权出站。将失败视为架构问题——而不仅仅是提示工程问题——并移除潜在的访问路径。
探索 TrustGraph 来映射代理信任边界,减少模型泄露和 API 密钥泄露。
对于进一步的行动,你可能会考虑阻止此人和/或举报滥用。