将 LLM 剪枝建模为伊辛优化问题,通过移除区块而非个别权重来优化模型,提出新的结构化剪枝方法论。
我们的最新论文 LLM Compression by Block Removal with Constrained Binary Optimization 将这种对应关系付诸实践。我们将 block 选择重新表述为一个约束二元优化(CBO)问题,该问题可以直接映射到一个 Ising 玻璃——一种无序自旋系统,具有全连接相互作用和固定数量的"向上"自旋。该自旋系统的能量恰好是剪枝后模型在基准测试中实际表现的强且廉价的代理,这意味着我们可以对大量候选配置进行排序而无需对任何配置进行基准测试,并将困难实例交给 Multiverse 在其他地方使用的同类经典求解器和量子启发求解器。在深度压缩 regime 收益巨大:在对 Llama-3.3-70B-Instruct 进行 50% 压缩时,我们在 MMLU 上比最好的竞争性 block 删除方法高出近 23 个百分点。
大多数现有的 block 删除方法各自对每个 block 打分,然后移除看起来最不重要的 block,使用幅度、敏感性或"block 影响"启发式方法。在物理学术语中,这些都是平均场方法:它们将每个 block 视为其贡献独立于其他 block,就像平均场理论用一个单一的 averaged 场替代一个自旋的邻居一样。一个相关的捷径是只移除单个连续运行的 block,这使问题保持很小但丢弃了大部分搜索空间。
问题在于 block 并不独立,就像真实磁体中的自旋一样。移除 block 20 是否会损害模型取决于你是否也移除了 block 19 或 block 24,这是两个决策之间的相互作用或耦合。随着模型变得越来越深和越来越异构,忽略这些耦合会丢失质量,尤其是在你想要一次移除大量 block 时。你真正想要的是在考虑它们如何相互作用的情况下搜索 block 组合,但组合数量呈指数增长,因此暴力搜索看起来毫无希望。这正是统计物理工具发挥作用的 regime:具有成对耦合的指数级大配置空间。
我们为每个 transformer block 附加一个二元变量:0 表示保留,1 表示移除,就像一个可以向下或向上的自旋。然后我们对这些变量执行模型 loss 的二阶泰勒展开,产生一个(近似的)Hessian 矩阵。该 Hessian 的对角线是每个 block 本身的重要程度;非对角线条目正是 block 之间的成对耦合,即平均场方法丢弃的多体物理。
这种重新表述将"我应该移除哪些 block?"转变为一个清晰的优化:找到移除后使能量 xᵀH⁰x 最小化的 M 个 block 集合,同时受限于恰好移除 N 个 block 中的 M 个。从数学上讲,这是一个约束二元优化问题;从物理上讲,这是一个 Ising 玻璃,一个具有守恒磁化的全连接耦合自旋系统(被移除 block 的固定数量扮演着固定总自旋的角色)。我们建立的关键性质是,这个能量是下游质量的一个强代理:自旋系统的低能量状态对应于高性能的剪枝模型。最小化能量和最大化基准测试分数成为同一次搜索。

Block 选择成为一个约束二元优化问题,等价于找到 Ising 玻璃的低能量状态;每个解都表明从 N 个 block 中删除哪 M 个。右图:我们插入每个 block 残差路径中的耦合变量 α 以构建 Hessian。来源:论文图 1。
这在实践中的关键是成本。Hessian,即完整的耦合集,只从一个小校准数据集的前向和后向传递计算一次。之后,评估任何候选配置都是一次廉价的能量计算,无需运行实际模型,更不用说对其进行基准测试了。而且由于耦合不依赖于压缩目标,相同的 Hessian 可以重复使用来求解许多不同的 M 值。
对于大多数模型,配置空间很大但仍可检查。由于计算一次能量非常便宜,我们在单个 GPU 上暴力搜索,检查多达数百亿个自旋配置。数百万个配置只需几秒;这里最难的可处理情况是移除 Llama-3.3-70B 的 80 个 block 中的 8 个(约 290 亿个配置),大约需要两天。
在这一点之外,精确方法就失效了,而这正是将问题表述为 Ising 玻璃第二次获得回报的地方。在其等价的 QUBO 形式(约束被吸收到惩罚项中)中,相同的任务可以交给为这类 Hamiltonian 构建的高度优化的经典、量子和量子启发求解器——量子退火、QAOA、tabu 搜索和专用分支定界的机制。我们发现,一个开源 tabu 求解器可靠地在几秒内达到最低能量状态,即使在我们可以用暴力方法验证的最难的情况下也是如此。因此,该方法可以扩展到枚举配置不可行的模型,使用恰好属于 Multiverse 领域的求解器。
这里有一个微妙但重要的点,它与优化的通常思路背道而驰。通常 CBO 或退火求解器的评判标准是它是否找到真正的基态。我们实际上不需要基态。我们需要的是一种快速生成少量良好低能量状态的方法,而这是一个更容易达到的标准,这就是为什么轻量级求解器对我们如此有效,也是为什么我们可以负担得起运行其中几个求解器。
能量是质量的强代理,但不是完美的代理,因此单个最低能量状态并不总是最好的模型。事实证明这是一个特性,而不是缺陷:一旦 Hamiltonian 设置好,读出基态和低激发态基本上是免费的,提供了一系列高质量候选剪枝方案而不是一个脆弱的答案。探索激发态,而不仅仅是基态,本身就是活跃的物理研究领域,它巧妙地映射到实践者在这里实际需要的东西。
一个具体例子:对于 Llama-3.1-8B-Instruct 移除 16/32 个 block,大多数 top 状态会剪掉模型末尾附近的 block,正如先前的工作所预期的那样。但第 17 个激发态是第一个提议移除模型开头附近 block 的状态,经过轻度再训练后,该配置在多个基准测试中优于基态。这直接反驳了常见的假设——最好的剪枝是一个连续的中间或末尾 block 块——并表明为什么尊重问题的完整多体结构是有回报的。

左图:20 个最低能量状态中每个状态移除的 block(红色 = 移除)。右图:第 17 个激发态,它移除一个早期 block,在再训练后在多个基准测试中击败了基态。最好的模型是一个激发态,而不是基态。来源:论文图 2。
在 Llama-3.1-8B-Instruct、Qwen3-14B 和 Llama-3.3-70B-Instruct 中,我们的方法(CBO)与最先进的 block 删除基线相当或更好,并且随着压缩变得更加激进,差距扩大。
最明显的胜利是对 Llama-3.3-70B-Instruct 进行深度压缩,在不进行再训练的情况下评估。移除多达 24 个(共 80 个)block,CBO 与 block influence 大致相当。但在 32/80 和 40/80 时,它决定性地领先,在最深层设置下 MMLU 优势近 23 点,在每个我们测试的基准测试中都击败了基线。对于 Qwen3-14B 移除 12/40 个 block,CBO 在 MMLU 上领先约 10 个点。在较轻的压缩下方法相当,这是预期的:耦合在深度剪枝时最重要。
在 40/80(50% 深度),CBO 将 MMLU 保持在 77 左右,而最强的基线则降至 mid-50s。来源:论文表 2。
在现代异构架构上,block 删除变得更加困难,不同的 block 类型交错排列,而 Ising 公式并不关心:无论每个位置上是哪种 block,耦合就是耦合。为了压力测试这一点,我们将该方法应用于 NVIDIA-Nemotron-3-Nano-30B-A3B-FP8,这是一款混合模型,以非均匀模式交错 Mamba2、attention 和混合专家(MoE)层,无需任何再训练。
我们的公式没有任何假设同质堆叠的地方,因此它可以直接迁移。移除 2-3 个 MoE 层或 2 个 attention 层,CBO 找到在 AIME25 和 GPQA 上击败 block influence 的配置。结果还证实了这些混合模型中的冗余是真实的但分布不均:一些 expert 层比其他层更容易被丢弃,而该方法搜索耦合配置空间的能力正是找到良好剪枝点的关键。即使在这里,来自密集模型的模式也成立——最好的配置通常是激发态而不是基态。
将一个混乱的机器学习问题重新表述为 Ising Hamiltonian,然后使用为物理构建的经典和量子启发优化机制来求解,这完全在 Multiverse 的能力范围内——这是贯穿我们压缩技术栈的相同直觉。而且 block 删除与该技术栈的其余部分可以组合:量化、低秩/SVD 压缩、宽度剪枝和基于知识蒸馏的修复——因此它可以插入更大的管道而不是与之竞争。
想要完整的技术细节,包括泰勒展开推导、QUBO 映射、求解器基准测试、校准数据集消融实验和完整结果表?请阅读 Hugging Face 上的完整论文,或联系我们的团队讨论将这种方法应用于您自己的模型。代码在 github.com/CompactifAI/Block_removal_through_constrained_binary_optimization 开源。