像物理学家一样修剪LLM:把模块移除当作Ising优化问题

Multiverse Computing 团队提出把大模型“整块删除”式压缩重新表述为受约束的二进制优化问题,等价于寻找 Ising 自旋玻璃的低能态,用一次性算出的耦合矩阵替代逐个试删,从而在不跑基准测试的情况下挑出最优删块组合。在 Llama-3.3-70B-Instruct 压缩 50% 的场景下,MM…

一句话看懂:Multiverse Computing 团队提出把大模型“整块删除”式压缩重新表述为受约束的二进制优化问题,等价于寻找 Ising 自旋玻璃的低能态,用一次性算出的耦合矩阵替代逐个试删,从而在不跑基准测试的情况下挑出最优删块组合。在 Llama-3.3-70B-Instruct 压缩 50% 的场景下,MMLU 成绩比现有最优方法高出近 23 个百分点。

事件核心:发生了什么

深度剪枝(depth pruning)的思路很直接:把 Transformer 中整个 block 删掉,模型层数变少,推理自然更快,还能和量化、低秩压缩叠加使用。难点在于删哪些块——块与块之间存在耦合,删掉第 20 块的影响取决于你是否同时删了第 19 或 24 块,所以这是一个组合优化问题,而不是按重要性排序的问题。

该团队(Antonio Tiene、Ali Hashemi、David Jansen、Roman Rausch 等)在 Hugging Face Blog 发布的论文《LLM Compression by Block Removal with Constrained Binary Optimization》中,给每个 block 配一个二进制变量(0 保留、1 删除),对模型损失做二阶泰勒展开得到近似 Hessian:对角线代表单块重要性,非对角项正是被主流方法忽略的成对耦合。于是“删哪 M 块”变成在 N 块中选 M 块、最小化 xᵀH⁰x 的约束二进制优化,物理上就是一个磁化强度固定的全连接自旋玻璃。Hessian 只需用少量校准数据做一次前向和反向传播即可算出。

为什么重要

目前公开信息显示,现有 block removal 方法多属“平均场”式做法:单独给每块打分,或只允许删除一段连续 block,搜索空间被大幅压缩。在深度压缩区间,这种近似会明显损失质量。把选择问题交给 Ising 求解器(经典或量子启发式均可),意味着压缩率和下游表现之间的权衡可以被系统性搜索,而不靠启发式拍脑袋。50% 压缩下 MMLU 提升近 23 个百分点,说明在大比例删块的激进场景里,组合搜索带来的收益远大于更精细的单块评分。

对行业而言,这条路线巩固了“推理效率”作为独立技术赛道的地位:它与量化、蒸馏、MoE 等并不冲突,可叠加使用,且直接缩短模型深度、带来可预期的延迟下降。

对用户/开发者/创作者的影响

开发者若自行部署开源大模型,这类方法有望降低单位推理成本,让 70B 级模型在更少 GPU 或更低显存下运行;由于删块与量化兼容,边缘设备和私有化部署场景受益更直接。使用 API 的团队短期不一定看到价格变化,但服务商若采用类似压缩,长上下文和高并发场景的响应速度可能改善。需要注意的是,论文使用的是 Llama-3.3-70B-Instruct 等特定模型和校准集,迁移到其他架构或领域数据时效果仍需验证,目前公开信息显示尚未有成熟工具链一键集成。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一,是否有开源实现或推理框架(如 vLLM、llama.cpp)集成该方法,把 Hessian 计算和求解流程产品化。二,压缩后的模型在 MMLU 之外的推理、代码、多语言任务上是否同样稳健,还是只在知识类基准占优。三,经典求解器与量子启发式求解器在更大模型上的耗时和可扩展性对比,决定这套方案能否走出论文进入生产。

来源:Hugging Face Blog

celebrityanime
celebrityanime
文章: 24801

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注