Gemma Scope 2:开放的模型可解释性工具
Google 开源 Gemma Scope 2,为 Gemma 3 系列提供模型行为分析和可解释性工具。对 AI 安全研究有重要价值。
Google 开源 Gemma Scope 2,为 Gemma 3 系列提供模型行为分析和可解释性工具。对 AI 安全研究有重要价值。
语言模型可解释性团队
宣布推出一套全新的开放式语言模型可解释性工具。
大型语言模型(LLM)具备惊人的推理能力,但其内部决策过程在很大程度上仍是一个黑箱。当系统的行为不符合预期时,由于我们看不到它内部的运作方式,往往很难准确定位其产生这种行为的具体原因。去年,我们推出了 Gemma Scope,推动了可解释性科学的发展。这套工具旨在帮助研究人员理解我们的轻量级开放模型系列 Gemma 2 的内部运作机制。
今天,我们正式发布 Gemma Scope 2:一套全面、开放的可解释性工具,覆盖 Gemma 3 从 2.7 亿到 270 亿参数的所有模型规模。这些工具可以帮助我们追踪模型整个“大脑”中潜藏的风险。
据我们所知,这是迄今为止 AI 实验室发布的规模最大的开源可解释性工具。Gemma Scope 2 的开发涉及约 110 PB 的数据存储,并训练了总计超过 1 万亿个参数。
随着 AI 持续发展,我们期待 AI 研究社区使用 Gemma Scope 2 调试模型中涌现出的行为,借助这些工具更好地审计和调试 AI Agent,并最终加快针对越狱、幻觉和谄媚等问题,开发实用且稳健的安全干预措施。
感谢 Neuronpedia 的支持,Gemma Scope 2 交互式演示现已开放体验。
可解释性研究旨在理解 AI 模型的内部运作机制及其学习到的算法。随着 AI 的能力不断增强、结构日益复杂,可解释性对于构建安全可靠的 AI 至关重要。
与上一代产品一样,Gemma Scope 2 就像一台观察 Gemma 语言模型家族的显微镜。它结合稀疏自编码器(Sparse Autoencoder,SAE)和 transcoder,让研究人员能够深入模型内部,了解模型正在思考什么、这些想法是如何形成的,以及它们如何与模型行为相联系。这样一来,研究人员便能更深入地研究越狱,以及其他与 AI 安全相关的行为,例如模型对外表述的推理与其内部状态之间存在差异的问题。
初代 Gemma Scope 已经推动了多个关键安全领域的研究,包括模型幻觉、识别模型掌握的秘密信息,以及训练更加安全的模型。在此基础上,Gemma Scope 2 通过一系列重大升级,为更具雄心的研究提供支持:
**大规模完整覆盖:**我们为整个 Gemma 3 家族提供了一整套工具,覆盖最高 270 亿参数的模型。这对于研究只有在大规模模型中才会出现的涌现行为至关重要。例如,此前拥有 270 亿参数的 C2S Scale 模型曾展现出这类行为,并帮助发现了一条潜在的新型癌症治疗路径。尽管 Gemma Scope 2 并不是基于该模型训练的,但这个案例展示了这些工具未来可能帮助我们理解的涌现行为类型。
**用于解析复杂内部行为的精细化工具:**Gemma Scope 2 包含在 Gemma 3 模型家族每一层上训练的 SAE 和 transcoder。Skip-transcoder 和 Cross-layer transcoder 可以帮助研究人员更轻松地解析分布在模型各处的多步计算过程与算法。
**先进的训练技术:**我们采用了最先进的技术,其中尤其值得一提的是 Matryoshka 训练技术。它可以帮助 SAE 检测出更有价值的概念,并解决 Gemma Scope 中发现的某些缺陷。
**Chatbot 行为分析工具:**我们还提供了专门面向 Gemma 3 聊天场景调优版本的可解释性工具。这些工具能够分析复杂的多步行为,例如越狱、拒绝机制和思维链忠实度。
通过发布 Gemma Scope 2,我们希望为 AI 安全研究社区提供一套前沿的可解释性工具,助力整个领域继续向前发展。对于解决那些只会在更大规模、更现代的 LLM 中出现的现实安全问题而言,这种全新级别的开放访问至关重要。
Gemma Scope:帮助安全研究社区揭示语言模型的内部运作机制