用物理方法剪枝大模型:把删除Transformer块变成伊辛优化问题
为什么选块是个“多体问题”
让大语言模型跑得更快、占内存更少,最直接的办法之一就是砍掉一些Transformer块——这叫深度剪枝。模型变短了,推理速度自然提升,还能和量化、低秩分解等技术叠加使用。但难点在于:到底该删哪些块?
现有的大多数方法会给每个块单独打分,比如看权重大小、对损失的敏感度,或者所谓的“块影响力”,然后挑分数最低的一批删掉。这种思路在物理学里叫“平均场近似”:它假设每个块的作用是独立的,就像把周围所有自旋的影响简化成一个平均磁场。
但现实没那么简单。删掉第20个块会不会伤模型,很大程度上取决于你是不是也删了第19或第24个块。这些决策之间存在相互作用(或者说“耦合”)。随着模型越来越深、结构越来越复杂,忽略这些耦合会让模型性能白白损失,尤其是在要一次性删掉很多块的时候。你真正需要的是在考虑块间相互作用的前提下,搜索块的组合。而组合数量是指数级增长的,暴力穷举根本不现实。这正是统计物理工具大显身手的场景——处理具有成对耦合的超大构型空间。
把选块变成能量最小化问题
研究团队的做法很巧妙:给每个Transformer块分配一个二元变量,0表示保留,1表示删除,就像一个可以向上或向下的自旋。接着,他们对模型损失函数关于这些变量做二阶泰勒展开,得到一个近似的Hessian矩阵。

这个矩阵的对角线元素代表每个块自身的“重要性”,而非对角线元素则精确刻画了块与块之间的耦合强度——这正是平均场方法丢掉的关键信息。
这样一来,“该删哪些块”就转化成了一个清晰的优化问题:在总共N个块中,找出M个块,使得删除它们后的“能量” xᵀH⁰x 最小。从数学上看,这是一个带约束的二元优化(CBO)问题;从物理角度看,它等价于一个伊辛玻璃(Ising glass)模型——一个具有全连接相互作用、且总磁化强度(即被删除的块数)固定的无序自旋系统。
最关键的一点是,他们发现这个“能量”是下游任务性能的一个强力代理指标:伊辛系统的低能态,对应着高性能的剪枝后模型。于是,最小化能量和最大化基准测试分数变成了同一件事。
这种方法的实用性在于成本极低。Hessian矩阵(即所有耦合项)只需用一个小校准数据集跑一次前向和反向传播就能算出来。之后,评估任何一个候选方案都只需要一次廉价的能量计算,完全不需要运行模型本身,更不用说做完整的基准测试了。而且,同一个Hessian可以复用,用来求解不同压缩率(不同的M值)下的最优解。
求解策略:能穷举就穷举,不能就上专用求解器
对于大多数模型,虽然构型空间巨大,但因为单次能量计算非常快,研究者们直接在单块GPU上暴力穷举。几百万种组合只需几秒,即便是Llama-3.3-70B这种80个块里删8个(约290亿种组合)的最难情况,也只花了两天左右。
一旦问题规模超出穷举能力,把问题建模成伊辛玻璃的第二个好处就显现出来了。它可以被转换成标准的QUBO(二次无约束二元优化)形式,然后交给为这类哈密顿量专门设计的高度优化求解器来处理,包括经典的、量子的或量子启发的算法,比如量子退火、QAOA、禁忌搜索(tabu search)或专用的分支定界法。
实验发现,一个开源的禁忌搜索求解器就能在几秒钟内可靠地找到已验证案例中的最低能量态。这意味着该方法可以轻松扩展到那些构型空间大到无法想象的巨型模型上,而这正是Multiverse Computing这类公司的专长所在。
这里有个反直觉但重要的细节:我们其实并不需要找到绝对的基态(能量最低点)。我们需要的只是一个能快速生成少量优质低能态的方法,这个要求要宽松得多。这也是为什么轻量级的求解器在这里表现如此出色,并且可以同时运行多个求解器来增加找到好解的概率。
为什么整个低能谱都很重要
能量虽然是性能的强力代理,但并非完美。因此,能量最低的那个状态(基态)并不总是实际表现最好的模型。这反而成了一个优势:一旦哈密顿量建立起来,读取基态和一系列低激发态几乎是零成本的。这给了我们一个高质量的候选剪枝方案谱系,而不是一个脆弱的单一答案。
一个具体的例子是Llama-3.1-8B-Instruct模型,在删除16/32个块的情况下,大部分低能态都倾向于删除模型靠后的块,这符合以往的认知。但第17个激发态首次提出删除一个靠近模型开头的块。经过轻微的再训练后,这个配置在多个基准测试上都超过了基态方案。

这个发现直接推翻了“最优剪枝一定是删除中间或靠后连续块”的普遍假设,也证明了尊重问题完整“多体”结构的价值。
实验结果
在Llama-3.1-8B-Instruct、Qwen3-14B和Llama-3.3-70B-Instruct等多个模型上的测试表明,他们的方法(CBO)要么与当前最先进的块删除基线持平,要么更好,而且压缩越狠,优势越明显。
最突出的成果是在Llama-3.3-70B-Instruct上的深度压缩(无需再训练)。在删除32/80和40/80(即50%深度)时,CBO方法取得了决定性领先。在50%压缩率下,其MMLU得分稳定在77分左右,而最强的基线方法(块影响力)则跌到了54分,差距接近23个百分点,并且在所有测试的基准上都全面胜出。对于Qwen3-14B,在删除12/40个块时,CBO在MMLU上也领先约10分。在轻度压缩时,各方法表现接近,这也符合预期——只有在深度剪枝时,块间的耦合效应才变得至关重要。
方法可推广到异构架构
现代模型越来越多地采用混合架构,比如交错排列Mamba、注意力和专家混合(MoE)层。在这种情况下,块删除变得更加复杂。但伊辛模型的表述对此毫不在意:无论每个位置上是什么类型的块,耦合就是耦合。
为了验证这一点,研究团队将该方法应用于NVIDIA的Nemotron-3-Nano-30B-A3B-FP8模型,这是一个非均匀交错Mamba2、注意力和MoE层的混合模型,且未进行任何再训练。结果表明,该方法能直接迁移,并成功找到了优于基线的配置。例如,在删除2-3个MoE层或2个注意力层时,CBO在AIME25和GPQA基准上都取得了更好的成绩。
这些结果也证实了混合模型中的冗余是真实存在的,但分布极不均匀:某些专家层远比其他层更容易被舍弃。正是该方法搜索耦合构型空间的能力,才精准定位到了这些“好切”的位置。和稠密模型一样,这里的最优解也常常是一个激发态,而非基态。
为什么这很“Multiverse”
将一个混乱的机器学习工程问题,重新表述为一个伊辛哈密顿量,然后用为物理学问题打造的经典和量子启发优化工具来解决,这正是Multiverse Computing的核心思路。这种方法并不是孤立的,它可以无缝集成到他们现有的压缩工具链中,与量化、低秩/SVD压缩、宽度剪枝以及基于知识蒸馏的修复技术协同工作,形成一个更强大的整体解决方案。