前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯8915
  • AI Agent安全防护:威胁模型与关键控制措施
  • Go语言廉价RAG实战:从每轮50美分降至4美分
  • 上下文窗口才是 AI 回答质量的瓶颈
  • OpenAI暂停最强模型训练:模型突破控制
  • 125B MoE模型本地运行:3090三卡80 tokens/s优化实践
  • Claude攻克物理学九圈计算难题破世界纪录
  • Opus 5.5 Agent 爱汇报不干活?官方三招修复
  • Agent安全新思路:用短期可撤销凭证构建独立身份
  • 给 AI Agent 分配独立邮箱,处理每封邮件都视为不受信输入
  • AI 功能无声失败 26%:用 Eval Harness 捕获 LLM 输出退化
  • Codex报SKILL.md无效?原来是文件描述符耗尽
  • OpenCode永久提供DeepSeek V4.1 Flash 60美元额度
  • Nvidia SoL-Pi系统让编程Agent token消耗减半
  • 开发者亲测一个月停用AI:编码速度下降但深度思考回归
  • Together AI 发布 17 美元微调分类模型完整配方
  • 长对话 LLM Token 成本优化:缓存何时有效何处失效
  • 上下文工程:别把百万 Token 当存储桶用
  • OpenAI最强大模型因Agent安全漏洞被暂停
  • 笔记本跑 7000 亿参数 GLM:用 SSD 当显存火爆 GitHub
  • 谷歌TPU运行Kimi推理速度快57%,采用DeepSeek框架
  • Claude Code突破5小时限制可优雅收尾
  • OpenAI Agent失控调用DeepSeek/Kimi,近百万条短链曝光
  • 美团LongCat-2.5-Preview:1.6T MoE大模型支持百万token上下文
  • Anchors 方法让 LoRA 微调灾难性遗忘降低 28 倍
  • AI 推理服务器实战:GPU 选型与云端部署指南
  • Meta Muse AI 助手被通过隐藏端点劫持
  • OpenAI智能体擅传53张客户图片至公网,已承认违规
  • GitHub Copilot企业托管配置支持内联验证
  • OpenAI智能体安全漏洞:53张用户图片被发布至公开网络
  • AI应用上线后高频故障模式分析
  • AI Agent与传统自动化的安全差异:控制权在哪里
  • 已加载 31 / 8915
8.0
热点
AI SCORE
技术实践2026-09-27 04:19

AI Agent安全防护:威胁模型与关键控制措施

dev.to · AI#AI安全#Agent#防护
Editor brief · 编辑速览

AI Agent面临提示注入、未授权工具调用、凭证泄露等攻击路径;需文档化所有信任边界,假设模型输出在策略检查前不可信。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

AI Agent 安全从清晰的威胁模型开始

AI Agent 能够推理、调用工具、访问数据库并向外部服务发送数据——这些能力同时也创造了新的攻击路径。有效的 AI Agent 安全必须防止攻击者操纵提示词、提取专有模型行为,或诱使 Agent 通过工具调用泄露凭证。

首先,记录 Agent 周围的每个信任边界。这包括模型端点、编排层、向量数据库、插件、API 和可观测系统。对于每个组件,识别哪些数据会进入、数据可以发送到何处,以及它可以访问哪些凭证。

常见攻击路径包括:

  • 嵌入在文档、网站或检索数据中的提示词注入
  • 由被操纵的指令触发的未授权工具调用
  • 通过详细错误信息暴露的敏感系统提示
  • 被写入日志、追踪或模型上下文的凭证
  • 允许数据提取的过度出站网络访问
  • 拦截提示词或 API 响应的受损依赖项

安全团队应该假设模型输出在策略检查批准请求操作之前是不受信任的。

经过验证的模型泄露防护控制

模型泄露是指对模型资产、专有指令、训练数据或机密上下文进行未授权提取。攻击者可能通过重复查询来复现行为、请求隐藏提示词,或将检索到的信息路由到外部端点。

防止模型泄露需要分层控制,而不是单一的内容过滤器:

  • 限制出口:仅允许到批准域名、端口和服务身份的出站连接。
  • 应用速率限制:检测与模型提取相关的高容量或高度重复查询。
  • 最小化上下文:仅发送当前任务所需的记录和指令。
  • 检查工具参数:在执行前验证 URL、文件路径、数据库查询和负载大小。
  • 使用响应策略:阻止 secrets、个人数据、系统提示词和高置信度记忆内容。
  • 创建审计跟踪:记录策略决策和工具活动,但不存储原始凭证。

检测缓慢、分布式的泄露

复杂的提取可以跨多个会话或身份进行。因此,检测应关联语义相似性、查询时序、目的地域、代币量和重复尝试揭示内部指令的行为。

团队可以通过开源 TrustGraph AI 安全项目评估图方法。信任图帮助防御者推理 Agent、工具、数据源、身份和目的地之间的关系,而不是孤立地评估每个事件。

自主 Agent 的 API 密钥管理

弱 API 密钥管理将成功的提示词注入变成更广泛的基础设施访问。密钥不应出现在提示词、源代码、浏览器存储、异常消息或遥测中。

最小权限意味着仅授予 Agent 一个操作所需的权限、资源和持续时间。通过身份和策略检查后,由 broker 发出短期凭证来实现这一原则。在静态密钥仍需保留的地方,将其存储在加密的 secrets 服务中并在运行时注入。

有效的 AI Agent 安全还需要:

  • 为开发、测试和生产环境分离凭证
  • 为每个 Agent 和工具设置独立身份
  • 自动轮换和即时撤销程序
  • 在持久化提示词、追踪或日志之前进行脱敏
  • _usage limits tied to expected workloads
  • 针对新地区、目的地或访问模式的告警

这些控制在 AI 研究环境(如 HONEYPOTZ INC)和隐私敏感应用(如 DEEPBODY INC 的 DeepBody)中尤为重要,在这些场景下,受损的 Agent 访问可能暴露机密用户信息。

AI Agent 安全常见问题

提示词过滤能阻止模型泄露吗?

不能。过滤减少明显的攻击,但它不能替代出口限制、身份控制、速率限制和工具授权。将过滤视为纵深防御架构中的一层。

Agent 应该直接接收 API 密钥吗?

最好不要。凭证 broker 或策略执行代理应该代表 Agent 执行已批准的请求。这防止原始 secret 进入模型上下文。

AI Agent 安全控制应该多久测试一次?

在模型、提示词、工具、权限或数据连接器发生重大变更后进行测试。运行定期的对抗性测试,模拟提示词注入、secret 泄露、未授权工具使用和分布式提取。

在 Agent 投入生产之前构建可验证的信任层。审查并贡献 TrustGraph 仓库(HONEYPOTZ-AI)以加强针对模型和凭证泄露的防御。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
下一篇
Go语言廉价RAG实战:从每轮50美分降至4美分