大规模识别LLM的神经元交互机制
Berkeley研究LLM的可解释性与内部决策过程。学术研究,理论价值高于应用价值。
Berkeley研究LLM的可解释性与内部决策过程。学术研究,理论价值高于应用价值。
理解复杂机器学习系统,特别是大语言模型(LLMs),的行为是现代人工智能的关键挑战。可解释性研究旨在使决策过程对模型构建者和受影响的人类更加透明,这是迈向更安全、更可信的AI的一步。为了获得全面的理解,我们可以从不同角度分析这些系统:特征归因(feature attribution),它隔离驱动预测的特定输入特征(Lundberg & Lee, 2017; Ribeiro et al., 2022);数据归因(data attribution),它将模型行为与有影响的训练样本联系起来(Koh & Liang, 2017; Ilyas et al., 2022);以及机制可解释性(mechanistic interpretability),它剖析内部组件的功能(Conmy et al., 2023; Sharkey et al., 2025)。
在这些视角中,同样的根本障碍依然存在:规模下的复杂性。模型行为很少是孤立组件的结果;相反,它源于复杂的依赖关系和模式。为了达到最先进的性能,模型需要综合复杂的特征关系,从多样化的训练样本中找到共享模式,并通过高度互联的内部组件处理信息。
因此,有根据或经过现实检验的可解释性方法也必须能够捕捉这些有影响力的交互(interactions)。随着特征数量、训练数据点和模型组件数量的增长,潜在交互的数量呈指数增长,使得穷举分析在计算上不可行。在这篇博文中,我们描述了SPEX和ProxySPEX背后的基本思想,这些算法能够在规模上识别这些关键的交互。
我们方法的核心是消融(ablation)的概念,通过观察移除组件时的变化来测量影响力。
特征归因:我们掩盖或移除输入提示的特定片段,并测量预测的相应变化。
数据归因:我们在训练集的不同子集上训练模型,评估在没有特定训练数据的情况下模型在测试点的输出如何变化。
模型组件归因(机制可解释性):我们通过移除特定内部组件的影响来干预模型的前向传播,确定哪些内部结构负责模型的预测。
在每种情况下,目标都是相同的:通过系统地扰动系统来隔离决策的驱动因素,希望发现有影响力的交互。由于每次消融都会产生显著成本(无论是昂贵的推理调用还是重新训练),我们的目标是用尽可能少的消融次数计算归因。
通过掩盖输入的不同部分,我们测量原始输出和消融后输出之间的差异。
为了通过可处理数量的消融来发现有影响力的交互,我们开发了SPEX(Spectral Explainer,频谱解释器)。这个框架借鉴信号处理和编码理论,将交互发现推进到比以前方法大几个数量级的规模。SPEX通过利用一个关键的结构观察来绕过这个问题:虽然交互的总数是大得离谱的,但有影响力的交互的数量实际上相当少。
我们通过两个观察来正式化这一点:稀疏性(相对较少的交互真正驱动输出)和低次性(有影响力的交互通常只涉及特征的小子集)。这些性质允许我们将困难的搜索问题重新框架为可解决的稀疏恢复问题。利用信号处理和编码理论中的强大工具,SPEX使用战略性选择的消融来组合许多候选交互。然后,使用高效的解码算法,我们解开这些组合信号以隔离负责模型行为的特定交互。
在随后的算法ProxySPEX中,我们发现了复杂机器学习模型中常见的另一个结构特性:层次性(hierarchy)。这意味着在高阶交互很重要的地方,其低阶子集也可能很重要。这个额外的结构观察产生了戏剧性的计算成本改进:它以大约10倍更少的消融来匹配SPEX的性能。总的来说,这些框架实现了有效的交互发现,为特征、数据和模型组件归因中的新应用开辟了途径。
特征归因技术基于特征对模型输出的影响为输入特征分配重要性分数。例如,如果LLM被用于医疗诊断,这种方法可以准确识别模型得出结论的确切症状。虽然为单个特征分配重要性可能很有价值,但复杂模型的真正力量在于它们捕捉特征之间复杂关系的能力。下图说明了这些有影响力交互的示例:从双重否定改变情感(左)到RAG任务中必要的多个文档综合(右)。
下图说明了SPEX在情感分析任务上的特征归因性能。我们使用忠诚度(faithfulness)来评估性能:这是一个衡量恢复的归因能够在看不见的测试消融上预测模型输出的准确程度的指标。我们发现SPEX在短输入上与现有交互技术(Faith-Shap, Faith-Banzhaf)的高忠诚度相匹配,但独特地在上下文扩展到数千个特征时保持这种性能。相比之下,虽然边际方法(LIME, Banzhaf)也可以在这种规模下运行,但它们表现出明显较低的忠诚度,因为它们未能捕捉驱动模型输出的复杂交互。
SPEX也被应用于电车难题(trolley problem)的修改版本,其中问题的道德模糊被移除,使"True"成为明确的正确答案。鉴于下面的修改,GPT-4o mini只有8%的时间回答正确。当我们应用标准特征归因(SHAP)时,它将单个的"trolley"词实例识别为驱动错误响应的主要因素。然而,用同义词如"tram"或"streetcar"替换trolley对模型的预测影响甚微。SPEX揭示了一个更丰富的故事,识别了"trolley"的两个实例与"pulling"和"lever"这两个词之间的主要高阶协同作用,这一发现与人类关于困境核心组成部分的直觉一致。当这四个词被替换为同义词时,模型的失败率降至接近零。
数据归因识别哪些训练数据点最负责模型在新测试点上的预测。识别这些数据点之间的有影响力的交互对于解释意外的模型行为是关键的。冗余的交互,如语义重复,经常强化特定的(可能是错误的)概念,而协同交互对于定义没有单个样本能单独形成的决策边界是必要的。为了演示这一点,我们在CIFAR-10上训练的ResNet模型上应用ProxySPEX,为各种困难的测试点识别两种交互类型的最显著示例,如下图所示。
如图所示,协同交互(左)通常涉及语义不同的类共同定义决策边界。例如,将协同作用扎根于人类感知中,汽车(左下)与提供的训练图像共享视觉特征,包括跑车的低车身底盘、黄色卡车的方形形状和红色送货车的水平条纹。另一方面,冗余交互(右)往往捕捉视觉重复,强化特定概念。例如,马的预测(中右)受到一群具有相似轮廓的狗图像簇的严重影响。这种细粒度分析允许开发新的数据选择技术,保留必要的协同作用,同时安全地移除冗余。
模型组件归因的目标是识别模型的哪些内部部分(如特定层或注意力头)最负责特定行为。在这里,ProxySPEX也揭示了架构不同部分之间的负责交互。理解这些结构依赖关系对于架构干预至关重要,例如特定任务的注意力头剪枝。在MMLU数据集(highschool-us-history)上,我们演示了ProxySPEX通知的剪枝策略不仅优于竞争方法,而且实际上可以改善模型在目标任务上的性能。
在这个任务上,我们也分析了跨模型深度的交互结构。我们观察到早期层主要在线性体制中运行,其中头对目标任务的贡献基本独立。在后期层中,注意力头之间交互的角色变得更加突出,大多数贡献来自同一层内头之间的交互。
SPEX框架代表了可解释性的重大进步,将交互发现从数十个扩展到数千个组件。我们已经在整个模型生命周期中展示了框架的多功能性:探索长上下文输入的特征归因,识别训练数据点之间的协同作用和冗余,以及发现内部模型组件之间的交互。展望未来,围绕统一这些不同视角、提供对机器学习系统更全面理解的许多有趣研究问题依然存在。系统性地评估交互发现方法与现有科学知识(如基因组学和材料科学领域)是非常有趣的,既可以基础化模型发现,又可以生成新的、可检验的假设。
我们邀请研究社区加入我们的努力:SPEX和ProxySPEX的代码已完全集成并在流行的SHAP-IQ存储库中可用。
https://github.com/mmschlk/shapiq (SHAP-IQ Github)
https://openreview.net/forum?id=KI8qan2EA7 (ProxySPEX NeurIPS 2025)
https://openreview.net/forum?id=pRlKbAwczl (SPEX ICML 2025)
https://openreview.net/forum?id=glGeXu1zG4 (Learning to Understand NeurIPS 2024)