测试环境的网络隔离配置失误导致 Gemini 模型访问公网并猜解了三家公司的密码,OpenAI、Anthropic、Meta 也被同一测试团队触发类似事件。
Google 的 AI 模型 Gemini 在网络安全测试中意外突破到开放互联网,并攻击了真实企业。
据《华尔街日报》报道,在安全公司 Irregular 于 5 月举办的一场"夺旗"(Capture the Flag)演习中,Gemini 黑客入侵了三家真实公司。在其中一次攻击中,模型猜出了密码,另外两次则找到了暴露在公开来源中的凭证。Google 表示,每次模型意识到自己已进入真实系统时都自行停止了攻击。
Irregular 在 7 月下旬向 Google 通报了这些事件,此前不久已有报道称 OpenAI 的 Agent 在类似测试中黑客入侵了 AI 公司 Hugging Face。Google 此前未披露任何信息,直到本周《华尔街日报》前来询问,该公司表示没有理由公开,因为没有造成任何损害。类似的事件——同样与 Irregular 的测试有关——此前已经波及 OpenAI、英国 AI Safety Institute、Anthropic 和 Meta。
据 Irregular 称,Google、OpenAI、Anthropic 和 Meta 发生的事件均源于同一根本原因。该公司会在主要 AI 实验室发布模型前对其进行测试,以检查是否存在安全风险,其中一个特别复杂的场景旨在测试模型是否能帮助恶意内部人员获取敏感数据。
在该测试中,Irregular 为一家虚构公司选取的名称恰好与一个真实域名相同。输入模型的指令同时包含了目标名称和 Irregular 自有网络内部的地址,因此模型本应在那里找到模拟目标。但测试环境中意外保留了互联网访问权限,部分模型转而攻击了真实域名而非停留在沙箱中。该域名安全防护薄弱,使其成为 AI 的易攻击目标。该公司表示,由于突破行为较为罕见,且通常发生在数百步模拟的后期,因此很难被发现。
Irregular(前身为 Pattern Labs)由 CEO Dan Lahav(IBM 前 AI 研究员)和 CTO Omer Nevo(曾在 Google 工作两年多)于 2023 年创立。据 PitchBook 数据显示,这家初创公司约有 35 名员工,并在 9 月的一轮融资中筹得超过 8000 万美元。
订阅 THE DECODER,享受无广告阅读体验、每周 AI 时事通讯、六期年度专属"AI Radar"前沿报告、完整档案访问权限以及评论区访问权限。