英文原标题:Pruning LLMs Like a Physicist: Block Removal as an Ising Optimization Problem

本文为英文原文的机器翻译摘要,原文见:Hugging Face Blog ↗

  • 文章将大语言模型的块移除(深度剪枝)重新表述为约束二进制优化问题,并映射为具有全连接相互作用和固定数量“向上”自旋的Ising玻璃。
  • 通过损失对二进制变量的二阶泰勒展开得到近似Hessian矩阵,其对角线表示单个块的重要性,非对角元素表示块之间的成对耦合,从而将块选择转化为最小化能量xᵀH⁰x的优化问题。
  • 该能量被证明是下游质量的强代理,低能态对应高性能剪枝模型;Hessian只需在小校准数据集上计算一次,之后评估候选配置仅需廉价能量计算,且可复用于不同压缩率M。
  • 求解时,在可枚举范围内用单GPU暴力搜索数十亿自旋配置;超出后利用QUBO形式交给经典、量子及量子启发求解器,开源tabu求解器能在数秒内可靠达到最低能量态。
  • 低能谱整体重要:基态和低激发态提供多个高质量候选剪枝,Llama-3.1-8B-Instruct在16/32块移除时,第17激发态首次建议移除模型前部块,经轻量重训练后性能超过基态。

关键数据

  • 在Llama-3.3-70B-Instruct上50%压缩时,MMLU比最佳竞争块移除方法提升近23个百分点。
  • 移除Llama-3.3-70B的80个块中的8个(约290亿种配置)暴力搜索约需两天。
  • Llama-3.1-8B-Instruct在16/32块移除时,第17激发态首次建议移除模型前部块。

引语

  • 低能态对应高性能剪枝模型
  • 开源tabu求解器能在数秒内可靠达到最低能量态

为什么值得看:该方法将块移除从独立排序问题转变为考虑块间耦合的组合优化,在深度压缩场景下显著提升模型质量,并利用物理求解器高效搜索。

站内导航