前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9258
  • MCP服务器多实例实战:15个Safari-MCP并发部署踩坑全记录
  • LangChain构建语音Agent:架构、流式与生产级模式
  • Hermes Soul:让Copilot外壳调用Agent工具链实现内联编辑
  • LLM幻觉深度解析:AI为何编造内容及工程应对策略
  • Playwright AI Agent:自主浏览器自动化的完整工程指南
  • 一致性≠正确性:企业AI需要持续评估的R.A.H.S.I.框架
  • LLM账单有两个杠杆,你们团队只拉了一个
  • SFT 中究竟什么被 token 化:chat template 底层机制详解
  • 社区平台工程指南:Feed不是查询
  • 发布MCP服务器前的安全检查清单
  • Agent工具调用劫持:注入模式与运行时防护
  • AI Agent成本预测:在用户点击运行前估算工作流开销
  • 为何 AI Agent 指令文件总在多台机器间漂移
  • AI 水印无法真正证明作者身份——而且这才是关键
  • 企业级 AI 编程 ROI 量化实践:LoongSuite-Pilot + SLS
  • AI Agent 缺控层:R.A.H.S.I. 框架解决生产级连续保障
  • Grok 4.6 发布:50 万上下文、xhigh 推理级,60 分跻身第一梯队
  • AI Agent 搜索落地指南:减少幻觉的四大实践
  • 截图搜索 App 实战架构:端侧 OCR + Gemini 分类
  • 幂等性:让发布 Agent 不怕中途被杀
  • AI Agent 安全:教程里不会教的防护层
  • 2026生产级AI Agent实战指南:评估体系、生产架构与竞争策略
  • 企业级多Agent架构设计:Agent Mesh实现跨框架互操作
  • 上下文工程:6 文件替代全量历史,Token 消耗降 84%、准确率升 39%
  • AI 编码 Agent 需要确定性验收边界
  • 批处理中的静默失败:十条日志全成功仅两条执行
  • Pest 5:用测试工作流重新定义 Agent 代码验证
  • AI Agent的记忆检索正常却答错了:信息过期的隐性陷阱
  • AI编程的质量瓶颈在于上下文,而非模型本身
  • 自进化AI Agent正在淘汰静态脚手架:2026技术架构解析
  • AMD收购Taalas:芯片级AI推理的时代来了
  • Embabel:JVM上的Spring之父新作,Kotlin编写的企业级Agent框架
  • 6000+评论揭示:Cursor是AI编程安全问题最多的工具
  • 2026年AI编程工具横评:9款主流Harness对比与模型选配指南
  • LTX-2:首个DiT架构音视频生成模型开源
  • 33个生产Agent运行经验:记忆持久化模式总结
  • VLM+DOM Diff实现低误报的UI回归测试
  • 新模型来了?先用自己仓库的历史 commit 跑一遍
  • 廉价新模型上线前,我用 2 小时金丝雀测试决定要不要切
  • 免费模型评测后再付费:AI 编程任务的评估工作流
  • Meta 30B本地Agent模型Mac实测对比
  • 用测试套件自动分流免费/付费模型的工作流
  • Switchyard:Rust 编写的 LLM 流量代理,支持 OpenAI/Anthropic 协议互转
  • RAGFlow v0.4:开源 RAG 引擎支持 DeepSeek v4 与多渠道聊天
  • 廉价模型优先、失败时升级:构建可审计的双层 LLM 流水线
  • Vercel实习生直参生产:CDN、v0、AI Gateway实战复盘
  • DeepSeek-V4-Pro 正式版:Agent 能力大幅提升,支持三档思考强度
  • 2026年Claude Code最佳替代工具横评
  • DeepSeek-V4-Pro 正式版发布:Agent 能力大幅提升,支持 Responses API
  • AI编程工具选型:别比补全速度,比执行位置
  • AI代码审查风险分级路由:用强模型只审高危diff
  • 已加载 51 / 9258
8.0
热点
AI SCORE
技术实践2026-08-13 14:11

AI Agent 安全:教程里不会教的防护层

dev.to · AI#AI安全#Agent#最佳实践
Editor brief · 编辑速览

指出 AI Agent 本质是新增身份,需独立 Service Account + 最小权限 Token;工具调用需做 Scope 限制而非仅靠 Prompt 约束,并给出具体审计日志设计。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

每一个 Agent 教程的结局都一样。你接好模型,给它几个工具,看它查个数据库或约个会议,感觉就像魔法。然后你把它上线了。这些教程几乎从不提及的是,从安全角度看你刚刚做了什么:你把凭证交给了一个自治进程,并把它指向了生产环境。

我想聊聊这个差距,因为这是把一个漂亮 Demo 变成线上事故的转折点。

Agent 是一个新的身份,所以要像对待身份一样对待它

当你构建一个 Agent 时,你实际上不是在添加一个功能,而是在添加一个用户。一个只认证一次、从不睡觉、模型决定什么就做什么的用户。如果你把自己的 Token 交给它来"让它跑起来",它所做的每一项操作在日志里都和你无法区分,你所有的访问权限都在它背后撑着。

从第一天起就给每个 Agent 它自己的身份。它自己的服务账号、它自己作用域受限的 Token、它在审计日志里自己的名字。当凌晨两点出问题的时候,你希望日志说的是"是 invoice-agent 干的",并准确显示它能触达什么,而不是让你眯着眼睛看一行像是你自己干的记录。

给工具划分作用域,而不只是给 Prompt 划分

危险的权限在你给 Agent 的工具里,不在你的 System Prompt 的措辞里。一个只有单表只读数据库权限的工具的模型,和持有任意 SQL 执行权限的工具的模型,是完全不同的风险。同一个 Agent,爆炸半径天差地别。

所以在连接一个工具之前,先问问对它的最坏调用是什么样的。如果你的发邮件工具可以发给任何人,一个被迷惑或被操控的 Agent 就能把你的整个客户列表发个遍。如果你的数据库工具可以删表,一次糟糕的决策就是灾难性的,而不是令人烦恼的。给每个工具赋予工作所需的最小能力。默认只读。只操作一个资源,而不是整个账号。

一个数字让这变得具体:IBM 2025 年泄露报告发现,97% 遭受 AI 相关泄露的组织都缺乏proper的 AI 访问控制。失败模式几乎总是过度授权访问,而不是天才攻击者。

假设模型会被说服做某事

这是开发者最低估的一点。你的 Agent 读取外部内容:一个网页、一封邮件、一个工单、一条用户消息。任何控制这些内容的人都可以把指令埋在里面,而模型无法可靠地把你的指令和藏在它正在处理的数据里的指令区分开。这就是 Prompt Injection,自从 LLM 风险列表存在以来,它就一直排在 OWASP 列表的首位。

你无法完全阻止它,所以要按它一定会发生来构建。救命的规则:永远不要让同一个 Agent 既摄取不可信输入,又持有强大的、不可逆的能力。如果一个 Agent 读取任意网页,它就不应该还能转账或删除记录。把这些拆分成具有独立访问权限的不同 Agent,这样那个负责读取的被劫持了也够不到能造成损害的工具。

在单向门前放一个人

自治对于可逆操作是没问题的。让 Agent 起草、排序、总结、查询、重试,一整天都行。对于那些无法撤消的事情——发送、付款、删除、发布、部署——加上一个人工审批步骤。是的,这样就没那么神奇了。但这也是 Agent 犯个错和 Agent 犯了个你无法挽回的错之间的全部区别。

一个便宜但有效的模式:Agent 提议那个不可逆操作,一个人在 Slack 或一个小仪表盘里批准它,然后它才执行。你保留了几乎所有的速度,同时把负面影响限了顶。

如果你在构建 Agent,大部分安全工作和 AI 无关,也毫不光鲜。给 Agent 它自己的身份。把每个工具的作用域限制到最小。让不可信输入的 Agent 远离你的危险能力。把不可逆操作放在人工后面审批。做好这四件事,你就覆盖了生产环境中真正出问题的大部分情况。

Demo 是最简单的那部分。访问模型才是产品。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
幂等性:让发布 Agent 不怕中途被杀
下一篇
2026生产级AI Agent实战指南:评估体系、生产架构与竞争策略