攻击者通过对话诱导 AI 泄露系统提示词和底层架构细节,这种「社会工程学转向软件」的攻击模式正在流行,本质是 prompt injection 的延伸。
一个 AI 助手被人用话术套出了它自己的内部结构描述。这不是那种用来炫技的越狱实验,而是"侦察即服务",任何人在生产基础设施上随意接入 LLM 而不思考模型实际知道些什么,都应该为此感到担忧。
这并不是换了马甲的新领域。通过 LLM 进行提示词注入和信息泄露,早在 ChatGPT 插件时期就有记录——API 开放后几周内,就有人能让模型泄露系统提示词。CoSnitch 增加的是针对性:它不是诱骗 Copilot 泄露一个系统提示词模板,而是诱导出底层架构和安全态势的细节。这是 一种性质截然不同的攻击面。泄露系统提示词只是让人尴尬,泄露架构图则是一份目标清单。
这种模式符合我们一整年都在看到的趋势:攻击者不再试图攻破模型,而是开始试图"访谈"它。社会工程学,只是目标从客服员工换成了软件。相同的心理战术,相同的借口技巧,只是这次的目标不会起疑、不会疲劳、不会记得一小时内被人用五种不同方式问过同一个问题。
"元黑客"这个标题框架在报道中起了很大作用,我理解为什么——它是个好标题。但让我们弄清楚哪些被夸大了,哪些被轻描淡写了。
被夸大的是:这是一种需要全新防御范式的全新技术漏洞。它不过是换了个研究名称的提示词注入。其机制(精心构造的提示词提取模型本不应主动提供的信息)与安全研究者自 RAG 和 Copilot 开始接入内部系统以来就一直在警告的完全相同。
被轻描淡写的是:这一切在多大程度上依赖于助手能够访问本不应该首先塞进其上下文中 的信息。如果 Copilot 能被诱骗描述自己的架构和安全态势,真正的故事不是"巧妙的提示词",而是"为什么模型能够触达那些信息,以及为什么在它能检索什么和能说什么之间没有一个硬边界"。
谁从当前的叙事中获益?主要是研究者和急于发布下一个命名攻击的厂商。这不是嘲讽,给事物命名能推动意识,意识推动修复,这个行业向来如此。但这也意味着每一次增量式的提示词注入技术都被包装成了范式转移,而实际上它们不过是同一个底层弱点穿了不同的马甲。
对于将 AI 助手接入内部工具的开发者:把模型的上下文窗口当作一个网段来对待。如果某个信息本不应该暴露给外部用户,那它就不应该能被外部用户正在对话的那个助手触及,仅此而已。这与最小权限原则是同一课的,只是在我们蓦然回首时,接口从 API 端点变成了聊天框。
对于安全团队:这是"LLM 输出是你的威胁模型中不可信输入"这一栏的又一个条目。你已经(希望如此)不信任用户输入了。现在你也不能完全信任你自己的 AI 助手返回的内容,因为攻击者可以通过对话本身来塑造那个输出。红队需要开始像对待针对客服的社会工程攻击一样对待对内部助手的会话探测,因为功能上现在它确实就是一回事。
对于更广泛的行业:期待更多这样的命名技术出现。提示词注入问题没有解决,在当前架构下可以说根本无法解决——它是模型无法可靠区分指令与数据这一根本属性。每一家推出 Copilot 风格助手的公司都在赌:它们能比研究者更快地加上防护栏。到目前为止,研究者在这场竞速中胜得相当轻松。
如果 LLM 助手能像人类员工一样被社会工程,我们为什么还在把"提示词注入"当作一种全新的技术漏洞,而不是把我们已有的数十年社会工程防御 doctrine(最小权限、需知原则、假设已被入侵)应用到那个已经插入基础设施的东西上?
'CoSnitch' 攻击诱骗 Copilot 绘制出架构图
AI 辅助起草或成像,人类编辑、审核和发布。