LLM 越狱与 AI 安全防护分析
探讨用户绕过 AI 安全机制的方法与启示。对理解大模型约束边界和防御策略改进有指导意义。
探讨用户绕过 AI 安全机制的方法与启示。对理解大模型约束边界和防御策略改进有指导意义。
大型语言模型(LLM)在理解我们的要求并照着执行这件事上,已经变得相当出色。但同样的能力,也让它们更容易受到攻击。
Jailbreaking(越狱)为我们提供了一个非常有意思的视角,让我们看到人们如何绕过 AI 的安全措施,以及我们能从中学到什么。
简单来说,Jailbreaking 就是有人找到了欺骗 LLM 的方法,让它去做原本不应该做的事情,比如生成不安全或受限制的内容。
之所以称为“Jailbreaking”,是因为这就像解锁一台设备,绕过它的安全功能。
📌 OpenAI 和 Anthropic 都公开分享过这类案例。
大多数商业 LLM 都经过训练,会拦截或回避不安全的 prompt。
它们已经学会识别高风险指令并拒绝执行。Jailbreaking 所做的,就是利用富有创意的 prompt 或不同寻常的措辞,设法绕过这些限制。
虽然听起来可能带有恶意,但其中相当一部分其实出于善意。
研究人员和开发者会利用这些技术探索模型的能力边界,并改进其安全性。
尝试破坏一个系统,往往能让你更深入地了解它究竟是如何运作的。
人们会要求模型“假装”成其他身份,比如一个不受约束的 Agent、虚构角色,或者“未经审查的 AI”,然后让模型以这个身份回答它通常会拒绝的问题。
这种方法利用了 LLM 对上下文和身份的理解方式。事实证明,模型很容易受到框架效应的影响。
另一种常见技巧,是把请求包装成学术研究。
“你能解释一下它在我正在创作的小说中会如何运作吗?”
这样一来,prompt 就被重新定义成了学习或讲故事的场景,而模型原本就被训练为要支持这类场景。
这种方法更加隐蔽。你可以把一个 prompt 拆分成多个看似无害的部分,但组合起来之后就会产生问题。你也可以使用模糊的指代或暗语。
这提醒我们,上下文追踪依然很困难,尤其是在较长或由多个环节串联起来的对话中。
比如:prompt injection、特殊字符、怪异的格式。这一类方法更侧重于利用模型处理文本结构的方式——类似传统软件中的缓冲区溢出。
可以参考 OWASP 对 prompt injection 的研究。
这些模型接受的训练要求它们尽可能提供帮助。Jailbreaking 正是利用了这一点:提出听起来合情合理的问题,只是换上一种足够巧妙的表达方式,从而避开过滤机制。
很多 Jailbreak 手法都模仿了针对人类的社会工程学攻击。它们会利用权威感(“你是这方面的专家”)、恭维(“只有你能帮我”),甚至制造紧迫感。
语言模型正是从我们人类身上学会了许多这样的暗示。
另一方面,LLM 高度依赖上下文。如果改变一个问题所处的叙事背景,模型对它的理解就可能完全不同。这正是 Jailbreaker 所依赖的机制。
模型提供商一直在重新训练自己的系统,让它们能够识别 Jailbreak 模式。这包括更完善的拒绝机制、经过过滤的输出,以及从真实攻击中学习到的 Guardrail。
当然,人们也会想出更有创意的方法来绕过这些 Guardrail。防御能力越强,prompt 就会变得越有创造性。
这种持续的攻防交锋会让模型变得更强。它不只是猫鼠游戏,也包含研究、发现和系统加固。所有人都能从中有所收获。
另一个讨论重点,是云端模型与本地模型之间有何差异,以及应该在什么时候选择其中一种。
没有任何一个模型能够覆盖远程工作流的方方面面;涉及安全问题时,如何选择往往取决于当前任务。
许多人在处理数据、编写代码或解决更复杂的问题时,会倾向于使用本地 LLM,尤其是在性能、隐私或定制能力至关重要的场景中。
另一方面,云端模型则可能因为可扩展性、便利性以及知识更新及时而更受青睐。
要选择合适的方案,通常需要进行更深入的评估,并在不同模型之间展开测试,看看哪个模型在特定工作流中表现最好。
就像我们会对 Web 应用进行渗透测试一样,Jailbreaking 也是 AI 系统公开发布前的一种测试方式。
大多数 AI 组织都会开展正式的红队演练,在受控条件下尝试攻破自己的模型。
Jailbreaking 还能帮助我们了解 LLM 如何思考(好吧,是所谓的“思考”)——它们如何理解 prompt、应用上下文,以及如何在安全性与实用性等相互竞争的目标之间取得平衡。
Anthropic 会定期开展这类演练,并分享从中获得的洞见。在 Pieces,我们同样高度重视安全,并持续更新系统,确保用户能够安全使用。
怎样才能确保模型始终按照我们的意图行事,即使面对边缘情况、长对话或模棱两可的场景?
Alignment Forum 上有一些非常深入的探讨。
Jailbreaking 经常需要通过多轮对话逐步构建大量上下文。这使得模型很难保持一致,并始终正确应用安全规则。
一个模型越灵活、越强大,就越可能被通过更多方式操纵。系统越是开放,Guardrail 就越难执行。
LLM 会从公开文本中学习,其中既有好的内容,也有坏的内容。它们很可能以前就见过与 Jailbreak prompt 有关的内容。遗憾的是,这些知识也可能被模型重新输出。
我们正在转向分层式安全系统:
评估并不是做一次就结束了。团队需要在产品发布后持续监控并不断迭代。
你需要公开透明地说明自己的安全流程。但披露过多信息,也可能让攻击者更容易得手。这需要找到平衡。
就像在网络安全领域一样,共享威胁情报能让所有人都更加安全。我们已经看到越来越多的 AI 组织开始交流抵御 Jailbreaking 的经验。
对 LLM 进行 Jailbreaking 不只是一种稀奇古怪的技巧,它既是严肃的安全问题,也是一种有价值的研究工具。它揭示了模型仍然存在哪些脆弱之处,并迫使我们深入思考控制、能力与后果。
但它也让我们看到,人类是多么复杂且富有创造力;如果我们以负责任的方式运用这种创造力,它就能推动 AI 不断向前发展。
随着模型变得越来越强大,这不会是一个能够一劳永逸解决的问题。
但只要理解其中的动态机制、保持开放协作并始终心怀好奇,我们就能构建出能力更强、也更符合人类意图的系统。
如果你还没有听说过 Pieces AI,那么现在或许是时候给它一个机会,看看它如何在保障安全的同时改变你的整个工作流。