2026版OWASP LLM Top 10核心论点转向:不再追求不可欺骗的模型,转而设计「模型被欺骗后重要数据不受损」的容错系统;第三名新晋Excessive Agency危害尤为突出。
作者:Mohit Kumar 属于《Agentic Attack Surface》系列文章,聚焦于 AI 系统、agentic 工作流及 AI 软件供应链的安全。
大多数人会用读任何 Top 10 榜单的方式读 2026 版 OWASP LLM 应用 Top 10:扫一眼排名,看看谁升降,然后关掉。
这样做你会错过真正的新闻。榜单不只是重新排了序,它改变了自己的论点。
项目负责人在 2026 版开头提出了一个更像是认输而非安全指南的论点:别再试图构建一个无法被欺骗的模型了。围绕模型构建系统,这样当模型被欺骗时——它一定会被欺骗——不会有重要的事情崩坏。
这不是一个缓解措施。这是一种设计哲学,而且它是对的。它还悄无声息地让当前销售的约一半 AI 安全工具失效了。
前两名没有变化。Prompt Injection 和 Sensitive Information Disclosure 仍占据第一和第二位,这对那些花了十分钟试图防御 LLM 应用的人来说毫不意外。
在其之下,变动比往年更大,按 Help Net Security 对该版本的分解:
Excessive Agency 攀升至第三。实践者投票和事件数据一致认为,agentic 部署才是损失真正发生的地方。
Excessive Agency 攀升至第三。实践者投票和事件数据一致认为,agentic 部署才是损失真正发生的地方。
Unbounded Consumption 上升了四位,原因是一teams现在开始将成本和资源耗尽视为真正的安全后果,而非计费烦恼。
Unbounded Consumption 上升了四位,原因是一teams现在开始将成本和资源耗尽视为真正的安全后果,而非计费烦恼。
Output Handling 从第五降至第十,同时吸收了更多范围。
Output Handling 从第五降至第十,同时吸收了更多范围。
System Prompt Leakage 更名为 Hidden Context Exposure——一个更广泛、也更加诚实的类别名称。
System Prompt Leakage 更名为 Hidden Context Exposure——一个更广泛、也更加诚实的类别名称。
Prompt Injection 扩展到覆盖嵌入在图像和音频中的跨模态攻击,Data and Model Poisoning 吸收了微调颠覆的内容,而不是生成一个新的条目。
Prompt Injection 扩展到覆盖嵌入在图像和音频中的跨模态攻击,Data and Model Poisoning 吸收了微调颠覆的内容,而不是生成一个新的条目。
方法论的改变比任何一个单独排名都重要。以前每个版本都纯粹基于共识——数百名实践者投票选出他们认为最危险的。这次的投票占权重 75%,其余 25% 来自 6,639 个从公开漏洞数据库和 AI-harm 数据库中提取的真实事件。
这是这份榜单首次部分基于证据而非完全基于直觉来论证。它确实有体现。
那个应该重组你威胁模型的区分
在发布内容中埋藏着一个我认为比排名本身更有用的框架:将 LLM 视为一个组件与将 LLM 视为一个行为者之间的明确区分。
组件接收输入并产生输出。你清洗进入的东西,验证出去的东西,失败模式是一个坏字符串。我们知道如何推理这个。它是一个解析器。
行为者有工具、持久记忆和执行权限。它持有凭证。它链接步骤。它的失败模式不是坏字符串——而是坏动作,以你的授权、针对一个你忘了它能触及的系统所执行的坏动作。

一旦你画出了那条线,整份榜单读起来就不一样了。排名第一的 Prompt Injection 不再是"模型说了些粗鲁的话",而变成了初始访问技术。排名第三的 Excessive Agency 不再是一个治理复选框,而变成了权限提升步骤。Hidden Context Exposure 变成了战利品。
这不是一个 Top 10。这是一条杀伤链。
十个风险,十个控制
这是 OWASP 故意没有替你做的事,因为它因架构而异。这是我在审查 LLM 应用时使用的映射,也是我认为 2026 榜单是一份 containment spec 的原因。
注意它们有多少是存在于模型内部的。十个中有九个是架构问题。这才是负责人想要表达的观点。
为什么跨框架映射是那个隐藏的核心功能
2026 版的附录 A 将每个风险映射到了企业已经在运行的框架:OWASP Agentic Applications Top 10 和 GenAI Data Security 指南、MITRE ATLAS、MITRE ATT&CK、CWE、NIST AI 600-1 和 AI RMF,以及 CSA AI Controls Matrix。
如果你曾经尝试过让一个 AI 安全控制获得资金,你就会明白这为什么重要。"模型可能会被 prompt-injected"换来的只是点头,没有预算。"这是 ATLAS 技术 X,它映射到 NIST AI RMF MANAGE 2.2,而我们当前的 AI Controls Matrix 覆盖率是零"才能给你换来一个预算项目。
2026 版将自己变成了 AI 研究词汇和企业保障词汇之间的翻译层。对于在任何大型组织内从事 AI 安全的人来说,这是文档中操作价值最高的东西。
这周我实际会做的三件事
如果你负责一个 LLM 应用,按顺序做这三件事:
将你 estate 中的每个模型分类为组件或行为者。不是按意图——而是按能力。如果它能调用工具,它就是行为者,无论设计文档怎么说。大多数团队会发现他们的行为者比想象中更多。
将你 estate 中的每个模型分类为组件或行为者。不是按意图——而是按能力。如果它能调用工具,它就是行为者,无论设计文档怎么说。大多数团队会发现他们的行为者比想象中更多。
对于每个行为者,用一页纸写出爆炸半径。它持有哪些凭证,它能触及哪些系统,如果被完全攻破,它能做出的最坏单一动作是什么?如果你在一个小时内回答不了,那就是你的发现。
对于每个行为者,用一页纸写出爆炸半径。它持有哪些凭证,它能触及哪些系统,如果被完全攻破,它能做出的最坏单一动作是什么?如果你在一个小时内回答不了,那就是你的发现。
选择你三个爆炸半径最高的行为者,分别添加一个 containment 控制。不是检测。是 containment。检测告诉你模型被欺骗了;containment 才能让你活下来。
选择你三个爆炸半径最高的行为者,分别添加一个 containment 控制。不是检测。是 containment。检测告诉你模型被欺骗了;containment 才能让你活下来。
2026 榜单告诉你业界已经停止相信预防会到来。这不是悲观主义。这是我们几十年前在内存安全方面做出的同样选择:我们不再承诺没有 bug,而是开始构建即使有 bug 也不会掌控机器的系统。
《Agentic Attack Surface》系列第一篇。
我每周写关于 AI 安全、云安全和安全架构的文章。LinkedIn · GitHub