前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8655
  • AWS发布Strands Harness:开源Agent框架,Token成本降28%
  • Spec-Driven 开发:摆脱 Vibe Coding 的工程化实践
  • AI 编程助手 CSS 好看但上生产就崩的根因与修复
  • Agent 诊断结果上线前如何验证:分离决策与执行
  • AI编码导致CI成瓶颈?我们重新设计了CI流程
  • 从氛围记忆到确定性自主:AI 原生基础设施设计思路
  • 用 Agent 流程开发简单 SPA 的实战经验
  • AI 生成 React UI 的真实问题:从第二页开始组件漂移
  • vLLM 深度解析:高吞吐 LLM 推理的性能瓶颈
  • AWS 开源 AI 编程助手,成本比 Claude Code 低 45%
  • 用Docker Compose构建可复现的AI Agent评测环境
  • 阿里发布Qwen-Image-2.1:7B开源图像生成编辑模型
  • Benchling 用 Bedrock AgentCore 为多租户 AI Agent 构建深度防御安全架构
  • 苹果Mac mini 2026款:M6/M5 Pro芯片,AI性能最高提升4倍
  • Mac Studio 2026:M5 Ultra 支持最高 512GB 统一内存,可本地运行超大模型
  • Grok 4.7登陆GitHub Copilot,面向Agent化编程
  • AI 安全是工程问题:Agent 堆栈每一层的防护实践
  • Agent 系统的瓶颈不是模型,是架构设计
  • 防御式 Agent 架构:Schema 注入与超时控制
  • 自研研究 Agent 拦截 AI 编程幻觉:文档先行策略
  • 像物理学家一样剪枝 LLM:区块移除的伊辛模型优化
  • Mac mini上的AI开发新范式:OpenClaw与Codex实战
  • Cloudflare Python Workers 正式上线,可用纯 Python 开发边缘应用
  • 浏览器直接给 ESP32 烧录 Claude 写的宏,无需 IDE 或工具链
  • Google 发布 Agent 安全风险报告:5 万美元循环消耗与凭证窃取案例
  • 多 Agent 合规流水线:用 RAG + 自修正架构对抗 WCAG 幻觉问题
  • Anthropic 发布金融领域 Claude 参考智能体套件
  • OpenAI 披露强化学习模型在上下文压缩时插入 Prompt 注入
  • Jev 决策模型实测:0.3秒完成意图分类和工具路由,$0.00004/次
  • Kimi Code Desktop 上线:图形界面 + 内置终端 + Git 状态,支持 Swarm 多 Agent 协
  • StepFun Step 5 Preview:600B 总参数 MoE 模型,1M 超长上下文,10 月开源
  • JSON-Render:通吃 React/Vue/Svelte/React Native 等 10+ 框架的生成式 UI
  • Agent-Native:让 Agent 能力同时暴露给 LLM 工具调用和 UI 操作的 TypeScript 框架
  • 清华联合无问芯穹开源具身智能体RPent,GPT-6 Astra注入机器人
  • AI Agent工具调用边界case:路由错误比想象中更脆弱
  • AI按它能读的契约编程,而非你想要的
  • MCP 远程服务器实现 AI 驱动的确定性 UI 编排
  • 阶跃Step 5 Preview实测:27B参数开源模型冲至Top2
  • 用Responses API构建有边界的GPT-6 Astra Agent
  • 用破坏不变量法审查 AI 生成代码
  • AI 编程测试冻结:保存异常指纹而非测试名
  • 程序员亲历:全公司用 Claude Code 批量生产代码,没人读代码,12 小时工作制
  • 自托管Llama部署成本全解析:GPU之外容易被忽视的隐性开销
  • Builder.io开源Agent-Native框架:让人与AI共享同一操作层
  • 让AI编程代理在中断后从断点恢复:session化执行轨迹方案
  • CI如何验证AI代理真的跑了测试而不是伪造结果
  • llm-keys-ui:让Coding Agent安全获取API密钥的插件
  • AI产品定价数学:固定费率如何悄悄亏损
  • ZCode事件:AI编程工具静默上传全部Git历史
  • Anthropic自评:R&D自动化率26%,但完全自主为0
  • 阿里Qwen-Image-2.1:70亿参数开源图像生成拳打闭源模型
  • 已加载 51 / 8655
8.0
热点
AI SCORE
技术实践2026-09-21 21:44

像物理学家一样剪枝 LLM:区块移除的伊辛模型优化

Hugging Face Blog#LLM#模型压缩#深度学习
Editor brief · 编辑速览

将 LLM 剪枝建模为伊辛优化问题,通过移除区块而非个别权重来优化模型,提出新的结构化剪枝方法论。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

我们的最新论文 LLM Compression by Block Removal with Constrained Binary Optimization 将这种对应关系付诸实践。我们将 block 选择重新表述为一个约束二元优化(CBO)问题,该问题可以直接映射到一个 Ising 玻璃——一种无序自旋系统,具有全连接相互作用和固定数量的"向上"自旋。该自旋系统的能量恰好是剪枝后模型在基准测试中实际表现的强且廉价的代理,这意味着我们可以对大量候选配置进行排序而无需对任何配置进行基准测试,并将困难实例交给 Multiverse 在其他地方使用的同类经典求解器和量子启发求解器。在深度压缩 regime 收益巨大:在对 Llama-3.3-70B-Instruct 进行 50% 压缩时,我们在 MMLU 上比最好的竞争性 block 删除方法高出近 23 个百分点。

为什么选择 blocks 是一个多体问题

大多数现有的 block 删除方法各自对每个 block 打分,然后移除看起来最不重要的 block,使用幅度、敏感性或"block 影响"启发式方法。在物理学术语中,这些都是平均场方法:它们将每个 block 视为其贡献独立于其他 block,就像平均场理论用一个单一的 averaged 场替代一个自旋的邻居一样。一个相关的捷径是只移除单个连续运行的 block,这使问题保持很小但丢弃了大部分搜索空间。

问题在于 block 并不独立,就像真实磁体中的自旋一样。移除 block 20 是否会损害模型取决于你是否也移除了 block 19 或 block 24,这是两个决策之间的相互作用或耦合。随着模型变得越来越深和越来越异构,忽略这些耦合会丢失质量,尤其是在你想要一次移除大量 block 时。你真正想要的是在考虑它们如何相互作用的情况下搜索 block 组合,但组合数量呈指数增长,因此暴力搜索看起来毫无希望。这正是统计物理工具发挥作用的 regime:具有成对耦合的指数级大配置空间。

这个想法:将 block 选择转化为能量最小化问题

我们为每个 transformer block 附加一个二元变量:0 表示保留,1 表示移除,就像一个可以向下或向上的自旋。然后我们对这些变量执行模型 loss 的二阶泰勒展开,产生一个(近似的)Hessian 矩阵。该 Hessian 的对角线是每个 block 本身的重要程度;非对角线条目正是 block 之间的成对耦合,即平均场方法丢弃的多体物理。

这种重新表述将"我应该移除哪些 block?"转变为一个清晰的优化:找到移除后使能量 xᵀH⁰x 最小化的 M 个 block 集合,同时受限于恰好移除 N 个 block 中的 M 个。从数学上讲,这是一个约束二元优化问题;从物理上讲,这是一个 Ising 玻璃,一个具有守恒磁化的全连接耦合自旋系统(被移除 block 的固定数量扮演着固定总自旋的角色)。我们建立的关键性质是,这个能量是下游质量的一个强代理:自旋系统的低能量状态对应于高性能的剪枝模型。最小化能量和最大化基准测试分数成为同一次搜索。

Sketch of the method: block removal is cast as a constrained binary optimization / Ising problem whose low-energy states correspond to high-performing pruned models.

Block 选择成为一个约束二元优化问题,等价于找到 Ising 玻璃的低能量状态;每个解都表明从 N 个 block 中删除哪 M 个。右图:我们插入每个 block 残差路径中的耦合变量 α 以构建 Hessian。来源:论文图 1。

这在实践中的关键是成本。Hessian,即完整的耦合集,只从一个小校准数据集的前向和后向传递计算一次。之后,评估任何候选配置都是一次廉价的能量计算,无需运行实际模型,更不用说对其进行基准测试了。而且由于耦合不依赖于压缩目标,相同的 Hessian 可以重复使用来求解许多不同的 M 值。

求解它:能精确时精确,不能时用量子或量子启发方法

对于大多数模型,配置空间很大但仍可检查。由于计算一次能量非常便宜,我们在单个 GPU 上暴力搜索,检查多达数百亿个自旋配置。数百万个配置只需几秒;这里最难的可处理情况是移除 Llama-3.3-70B 的 80 个 block 中的 8 个(约 290 亿个配置),大约需要两天。

在这一点之外,精确方法就失效了,而这正是将问题表述为 Ising 玻璃第二次获得回报的地方。在其等价的 QUBO 形式(约束被吸收到惩罚项中)中,相同的任务可以交给为这类 Hamiltonian 构建的高度优化的经典、量子和量子启发求解器——量子退火、QAOA、tabu 搜索和专用分支定界的机制。我们发现,一个开源 tabu 求解器可靠地在几秒内达到最低能量状态,即使在我们可以用暴力方法验证的最难的情况下也是如此。因此,该方法可以扩展到枚举配置不可行的模型,使用恰好属于 Multiverse 领域的求解器。

这里有一个微妙但重要的点,它与优化的通常思路背道而驰。通常 CBO 或退火求解器的评判标准是它是否找到真正的基态。我们实际上不需要基态。我们需要的是一种快速生成少量良好低能量状态的方法,而这是一个更容易达到的标准,这就是为什么轻量级求解器对我们如此有效,也是为什么我们可以负担得起运行其中几个求解器。

为什么整个低能量谱很重要

能量是质量的强代理,但不是完美的代理,因此单个最低能量状态并不总是最好的模型。事实证明这是一个特性,而不是缺陷:一旦 Hamiltonian 设置好,读出基态和低激发态基本上是免费的,提供了一系列高质量候选剪枝方案而不是一个脆弱的答案。探索激发态,而不仅仅是基态,本身就是活跃的物理研究领域,它巧妙地映射到实践者在这里实际需要的东西。

一个具体例子:对于 Llama-3.1-8B-Instruct 移除 16/32 个 block,大多数 top 状态会剪掉模型末尾附近的 block,正如先前的工作所预期的那样。但第 17 个激发态是第一个提议移除模型开头附近 block 的状态,经过轻度再训练后,该配置在多个基准测试中优于基态。这直接反驳了常见的假设——最好的剪枝是一个连续的中间或末尾 block 块——并表明为什么尊重问题的完整多体结构是有回报的。

Block-removal map and benchmark scores for the ground state versus the 17th excited state of Llama-3.1-8B-Instruct at 16/32 blocks removed.

左图:20 个最低能量状态中每个状态移除的 block(红色 = 移除)。右图:第 17 个激发态,它移除一个早期 block,在再训练后在多个基准测试中击败了基态。最好的模型是一个激发态,而不是基态。来源:论文图 2。

在 Llama-3.1-8B-Instruct、Qwen3-14B 和 Llama-3.3-70B-Instruct 中,我们的方法(CBO)与最先进的 block 删除基线相当或更好,并且随着压缩变得更加激进,差距扩大。

最明显的胜利是对 Llama-3.3-70B-Instruct 进行深度压缩,在不进行再训练的情况下评估。移除多达 24 个(共 80 个)block,CBO 与 block influence 大致相当。但在 32/80 和 40/80 时,它决定性地领先,在最深层设置下 MMLU 优势近 23 点,在每个我们测试的基准测试中都击败了基线。对于 Qwen3-14B 移除 12/40 个 block,CBO 在 MMLU 上领先约 10 个点。在较轻的压缩下方法相当,这是预期的:耦合在深度剪枝时最重要。

在 40/80(50% 深度),CBO 将 MMLU 保持在 77 左右,而最强的基线则降至 mid-50s。来源:论文表 2。

它可以推广到非密集 transformer 之外

在现代异构架构上,block 删除变得更加困难,不同的 block 类型交错排列,而 Ising 公式并不关心:无论每个位置上是哪种 block,耦合就是耦合。为了压力测试这一点,我们将该方法应用于 NVIDIA-Nemotron-3-Nano-30B-A3B-FP8,这是一款混合模型,以非均匀模式交错 Mamba2、attention 和混合专家(MoE)层,无需任何再训练。

我们的公式没有任何假设同质堆叠的地方,因此它可以直接迁移。移除 2-3 个 MoE 层或 2 个 attention 层,CBO 找到在 AIME25 和 GPQA 上击败 block influence 的配置。结果还证实了这些混合模型中的冗余是真实的但分布不均:一些 expert 层比其他层更容易被丢弃,而该方法搜索耦合配置空间的能力正是找到良好剪枝点的关键。即使在这里,来自密集模型的模式也成立——最好的配置通常是激发态而不是基态。

为什么这适合 Multiverse Computing

将一个混乱的机器学习问题重新表述为 Ising Hamiltonian,然后使用为物理构建的经典和量子启发优化机制来求解,这完全在 Multiverse 的能力范围内——这是贯穿我们压缩技术栈的相同直觉。而且 block 删除与该技术栈的其余部分可以组合:量化、低秩/SVD 压缩、宽度剪枝和基于知识蒸馏的修复——因此它可以插入更大的管道而不是与之竞争。

想要完整的技术细节,包括泰勒展开推导、QUBO 映射、求解器基准测试、校准数据集消融实验和完整结果表?请阅读 Hugging Face 上的完整论文,或联系我们的团队讨论将这种方法应用于您自己的模型。代码在 github.com/CompactifAI/Block_removal_through_constrained_binary_optimization 开源。

Original source

本文由 AI 翻译整理自 Hugging Face Blog,原文版权归原作者所有。

阅读英文原文
上一篇
自研研究 Agent 拦截 AI 编程幻觉:文档先行策略
下一篇
Mac mini上的AI开发新范式:OpenClaw与Codex实战