文章从模型、动作和运行时三个平面分析自主 Agent 的攻击面,指出提示词过滤无法覆盖工具滥用、代码执行和数据外泄等风险。核心思路是围绕 Agent 的实际权限与失控边界设计防护。
交叉发布。原文:stellarbytecapital.com/blog/ai-agent-security-threat-model
聊天机器人只会生成文本,而自主 Agent 会采取行动:调用工具、运行代码、传输数据,以及花费资金。这种转变彻底改变了安全问题的性质。问题不再是“这个 prompt 安全吗?”,而是:这个 Agent 能做什么?当它出现问题时,什么机制能阻止它?
如果把 Agent 安全仅仅当作 prompt 过滤问题,团队最终往往会得到一个令人惊艳的演示,以及一次生产事故。你需要的是一套威胁模型。下面是我们的方案。
Agent 面临的风险分布在三个截然不同的平面上。混淆这些平面,正是防御措施出现疏漏的原因:
模型平面(model plane)——进入和离开 LLM 的内容:prompt、检索到的文档,以及作为上下文重新输入模型的工具输出。
行动平面(action plane)——Agent 可以调用的工具:shell、HTTP、数据库、文件 I/O、支付,以及第三方工具和 MCP server。
运行时平面(runtime plane)——Agent 的代码和工具实际执行的位置:进程、容器、宿主机和网络。
Prompt 过滤只能覆盖第一个平面。大多数真正的损害都发生在第二和第三个平面。
处处遵循最小权限原则。所有工具、挂载点和网络路径默认关闭。
假设代码和内容都具有敌意。生成的代码、检索到的文档和工具输出,全都属于不可信输入。
对后果重大的操作引入人在回路(human-in-the-loop)机制。读取操作成本很低;汇款或删除数据则应设置人工确认关卡,而不能仅凭模型自行判断。
隔离执行环境,禁止出站访问。即使 Agent 逃逸或被劫持,只要它无处传出数据,风险就仍被限制在可控范围内。
审计一切。无法还原的事情,也就无法得到有效保护。
Prompt 过滤关注的是:“模型会不会说出不当内容?”威胁模型关注的则是:“当问题发生时,影响范围有多大?”——并将其压缩到接近于零。
我们是 Xingyao Byte,致力于构建安全的 AI 执行层、量化交易系统和支付平台。远程办公,异步优先 → stellarbytecapital.com
如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。