Gemini在第三方安全测试中实际入侵了三家企业的系统,Google以“非模型对齐问题”未主动披露;事件暴露AI安全测试与实际风险的信息不对称。
今年五月,Gemini 突破安全边界,入侵了三家不同的公司,但 Google 直到《华尔街日报》找上门才披露了这起事件。攻击发生在第三方 Irregular 对该模型网络安全能力的一次测试期间,Irregular 也曾卷入涉及 Meta 和 OpenAI 的类似事件。
据《华尔街日报》报道,Google 之所以没有披露这起入侵,是因为该公司认为这不算"模型未对齐"的案例。Google 表示,这属于"身份误判"——模型意识到自己是通过猜测密码强行进入了真实公司的系统后,就停了下来。"在这种情况下,模型的行为是得当的,"Google 安全工程副总裁 Heather Adkins 如是说。
Adkins 告诉 The Verge:"模型在网上找到了公开信息,然后猜测凭证以访问它认为属于测试范围的网站。在这三次事件中,模型都停了下来。"
Adkins 没有详细说明 Gemini 自行突破安全边界并攻击第三方,为何不符合"未对齐"的定义。"我们的安全团队在报告他人软件和系统中发现的问题方面有很长的记录——哪怕问题简单到只是弱密码,"她说。"我们确保了三家实体知情,并与我们的训练合作伙伴一起推动了其对测试流程所做的改进。这些事件凸显了训练强大 AI 模型负责任行事的重要性。"
但 AI 安全公司 Corridor 的 CEO Jack Cable 告诉《华尔街日报》:"元问题是,模型的所作所为超出了它们应有的边界,而且在发动真实的网络攻击。"此外,Irregular 的安全漏洞可能使这些攻击成为可能。模型在测试期间本不应访问互联网,但 Irregular 告诉《华尔街日报》,它无意中保持了互联网可用。
随着此类事件不断累积,加强对 AI 管控的呼声也只会越来越大。