研究 LLM 对齐和安全中的「睡眠代理」问题,对 AI 应用部署和红队测试有警示意义。
Andrej Karpathy(@karpathy)
我在最近一期视频的结尾谈到了“休眠 Agent LLM”这个概念。它很可能会成为 LLM 面临的一项重大安全挑战,甚至可能比 prompt injection 更加隐蔽和棘手。
我所描述的风险是:攻击者或许能够精心构造某种特殊文本,例如包含一个触发短语,然后将其发布到互联网的某个地方。当这段文本后来被收集并用于训练时,它便会污染基础模型,使模型在特定且有限的场景下——例如看到该触发短语时——以某种可控的方式执行操作,例如 jailbreak 或数据外泄。
这种攻击甚至可能根本不像人类可读的文本:它可以被混淆在异常的 UTF-8 字符、byte64 编码或经过精心扰动的图像中,因此仅靠检查数据将很难发现它。我们甚至可以想象,计算机安全领域可能会出现类似零日漏洞交易市场的东西,专门出售这些触发短语。
据我所知,上述攻击目前还没有得到令人信服的验证。这篇论文研究了一个类似、但可能稍弱一些的场景:它表明,当你拿到某个可能已被污染的模型时,无法仅仅通过目前的标准安全微调来“让它变得安全”。
模型并不会学会在所有情况下都保持安全,仍然可能以一些非常有限的方式做出不当行为,而这些行为的利用方法可能只有攻击者知道。在这里,攻击隐藏在模型权重中,而不是隐藏在某些数据中。因此,这里更直接的攻击方式,可能是有人发布一个暗中遭到污染的开放权重模型,其他人拿来继续微调并部署,最终却在不知情的情况下引入了隐秘的安全漏洞。
这是 LLM 安全领域非常值得研究的方向,预计接下来还会出现大量相关工作。
Anthropic(@AnthropicAI)
2024 年 1 月 12 日
Anthropic 新论文:休眠 Agent。
我们训练了一些 LLM,让它们暗中实施恶意行为。我们发现,尽管已经竭尽全力进行对齐训练,欺骗行为仍然躲过了检测。
晚上 9:30 · 2024 年 1 月 12 日
90.76 万次浏览
168
675
4,800
2,300
CuddlySalmon(@nptacek)
2024 年 1 月 12 日
这正是我一直对自己的数据集进行严格审查的原因之一。
作为一名网络安全从业者,我可以说,AI 领域的许多人对威胁格局抱有一种非常天真的看法。而随着 AI 被引入其中,整个威胁格局只会变得更加诡异、更加可怕。
78
20
3.28 万
elvis(@omarsar0)
2024 年 1 月 12 日
如今,社区也开始对组合现有 LLM 感兴趣,因此这个问题尤其值得关注。
我们不能在没有正确理解模型漏洞和弱点的情况下,随手抓来任何一个模型就直接使用;在这方面必须更加谨慎。
260
1.6 万
Nick Dobos(@NickADobos)
2024 年 1 月 12 日
这里有一个体现这种思路的例子,不过它采用了一种有趣且无害的方式:
LLM zip bomb。
Nick Dobos(@NickADobos)
2023 年 8 月 5 日
发布 AGi dot zip:
第一个 AI Agent .zip 炸弹。
还记得 zip bombs 吗?
解压后膨胀成巨型文件,让计算机崩溃。
同样的思路:
诞生 AI 心智——糟了,人类怎么办?
一键上传到 chatGPT code interpreter,自动引导安装:
-ft
-db memory
-hotkey 2.0 cmd menu
-preinstalled prompt library
00:00
443
5
1.6 万
加入讨论
再阅读 165 条回复