论文

SQS: 通过稀疏量化子分布的贝叶斯 DNN 压缩

SQS: 通过稀疏量化子分布的贝叶斯 DNN 压缩

压缩大规模神经网络对于在资源受限设备上部署模型至关重要。现有方法大多单独采用权重剪枝 或低位量化,往往为保持可接受的性能下降而牺牲压缩率。我们提出了一个统一框架 SQS,通过贝叶斯变分学习同时实现剪枝与低位量化,在保持可比性能的同时取得高于既有基线的压缩率。 核心思路有两点: 1. 采用 spike-and-slab 先验 诱导权重稀疏性; 2. 用 高斯混合模型(GMMs) 对量化权重建模,以实现低位精度。 由于同时包含 spike-and-slab 先验与 GMMs 的目标函数难以精确求解,我们推导出一个高效近似,从而在极小精度损失下完成有效压缩。在理论层面,我们针对所提出的变分方法给出了稀疏且量化深度神经网络的一致性结果。 在 ResNet、BERT-base、Llama3.2 与 Qwen2.5 上的大量压缩实验表明,我们的方法在性能下降相当的情况下,压缩率优于一系列现有方法。项目主页:https://comeusr.github.io/SQSWebpage。

论文精读

TL;DR SQS 提出统一贝叶斯变分框架,用 spike-and-slab 先验诱导稀疏、高斯混合模型实现低比特量化,同时剪枝与量化,在 ResNet、BERT、Llama3.2、Qwen2.5 上以更低精度损失达到更高压缩率。

问题

问题背景

当前深度神经网络模型规模持续增长,但部署到资源受限设备(如边缘端、移动端)时,计算与存储开销成为主要瓶颈。模型压缩领域因而聚焦于权重剪枝和低比特量化两大技术路线,目标是在可接受的精度损失下最大化压缩率。

现有方法局限

现有方法大多将剪枝与量化作为独立步骤处理,存在明显不足:

  • 剪枝单独使用:通过稀疏化权重减少参数量,但保留的权重仍为全精度,存储和计算效率提升有限。
  • 量化单独使用:将权重映射到低比特离散值,但对全精度权重直接量化容易在长尾分布或离群值上产生较大误差。
  • 简单组合剪枝与量化:先剪枝后量化或反之,无法保证两者协同最优,因为剪枝会改变权重分布,影响量化误差;同时两阶段优化可能导致累积精度损失。
  • 缺乏概率建模:确定性方法难以同时刻画稀疏结构与量化不确定性,导致压缩后的模型缺乏理论保证。

为什么这个问题难/重要

统一剪枝与低比特量化面临双重挑战:

  1. 模型容量与精度的权衡:过度稀疏或过低比特都会导致表征能力急剧下降,需要在同一优化目标中平衡两者。
  2. 贝叶斯推断的难解性:使用 spike-and-slab 先验诱导稀疏,并结合 高斯混合模型(GMM) 建模量化权重时,后验分布与目标函数不可解,需要高效的变分近似。
  3. 业界关注度:大模型(如 Llama3.2、Qwen2.5)边缘部署需求强烈,统一压缩框架能显著降低工程复杂度,并可能成为标准方案。

行业类比

这类似于在移动设备上同时进行模型减重(剪枝)与参数打包(量化),需要统一的调度策略,而非分头行动。

相关工作可参考项目主页 SQS_Webpage 与代码库 SQS_TMLR。

核心洞察

  • 统一贝叶斯变分框架将权重剪枝与低比特量化视作同一后验近似问题,通过 spike-and-slab 与 GMM 联合诱导稀疏和离散分布,避免两阶段流水线造成的次优压缩。大多数现有方法分别优化剪枝和量化,或简单顺序组合,忽略了二者耦合;SQS 在一个目标函数里同时学习权重的重要性(spike 部分)和量化中心归属,能在训练中动态决定哪些权重被剪掉、哪些被量化到低位,压缩率和精度权衡更优。
  • 使用 Gaussian Mixture Model 对量化权重进行软建模,替代硬量化或 STE,提供更平滑的梯度信号,并允许在训练过程中逐步收敛到离散量化值。传统低比特量化依赖直通估计或硬舍入,梯度近似粗糙,特别在极低比特下不稳定;SQS 的 GMM 后验为每个权重分配混合概率,优化目标是连续可微的,能更好地探索量化空间,最后推理阶段采样或选择最大后验分量,得到真正的离散权重。相比其他软量化方法,SQS 进一步结合 spike 分量,使得权重可以直接归零,实现剪枝与量化的统一决策。

方法

输入与目标

SQS 接收预训练 DNN 的权重矩阵(如 ResNet、BERT-base、Llama3.2、Qwen2.5 的线性层或注意力层参数),目标是同时完成权重剪枝与低比特量化,在可接受性能损失下最大化压缩率。

关键模块与流程

  1. 贝叶斯变分建模:每个权重被视为随机变量,先验采用 spike-and-slab 分布——spike 分量集中在零值附近,负责诱导稀疏;slab 分量是连续分布(高斯混合),负责建模非零权重的数值。
  2. GMM 量化机制:slab 部分使用 Gaussian Mixture Models (GMM) 近似,每个高斯分量对应一个离散量化中心(即量化级别)。训练时通过变分推断学习各分量的均值、方差和混合系数,使权重自然聚类到低位宽可表示的网格上,无需额外量化器。
  3. 近似目标与训练:由于 spike-and-slab + GMM 的精确后验不可解,作者推导了一个可优化的下界目标(ELBO),并采用重参数化梯度估计或类似策略进行反向传播。训练中引入窗式量化策略(windowing strategy),针对大模型(如 Llama3.2、Qwen2.5)权重分布长尾现象,将权重范围划分为多个窗口分别设置量化尺度,避免极端值影响整体量化精度。
  4. 输出与推断:训练完成后,根据后验分布推断每个权重的稀疏状态(保留或置零)和所属量化中心,得到一组稀疏且低比特的离散权重,直接部署到硬件加速器。

该方法与既有的“先剪枝再量化”或“联合训练但分开优化”不同,SQS 在单一贝叶斯变分框架内同时推断稀疏结构和量化级别,理论上有额外的一致性保证,避免了分步压缩造成的误差累积。

实验

实验设计

  • 在 ResNet、BERT-base、Llama3.2、Qwen2.5 四个代表性模型上验证 SQS,覆盖视觉与语言任务。
  • 对比基线包括单独权重剪枝、单独低比特量化以及部分联合压缩方案。
  • 核心评估维度为压缩率与性能下降程度。

关键发现

  • SQS 在可比性能下降下取得更高压缩率,优于现有基线。
  • Spike-and-slab 先验有效诱导稀疏性,Gaussian Mixture Models 建模量化权重,支持低比特精度。
  • 变分近似目标函数高效可行,避免了直接优化不可解目标。

与基线对比

  • 独立剪枝或量化通常会为了保持精度而接受次优压缩率;SQS 联合优化两者,避免这一限制。
  • 与已有联合压缩方法相比,SQS 通过统一 Bayesian 框架推导近似优化,在极低精度损失下实现更高压缩比。
  • 对工程部署的启示:该方法为资源受限设备上的大模型压缩提供了新思路,但需关注变分推断的额外计算开销。

行业影响

落地场景

  • 边缘端大模型部署:智能音箱、工业 IoT 网关等设备可运行压缩后的 Llama3.2 / Qwen2.5 级别模型,实现离线语音交互与本地数据隐私保护。
  • 实时推理服务:内容平台推荐系统、电商搜索排序模型采用压缩后的 BERT-base,降低推理延迟与显存占用,提升吞吐。
  • 嵌入式视觉应用:医疗影像分析、自动驾驶感知模块使用 ResNet 压缩模型,满足车载 SoC 或移动设备的功耗与内存约束。

商业价值

  • 降本:联合稀疏化与低比特量化可显著减小模型体积,降低云端 GPU 推理成本;同时使模型能运行在更廉价的边缘硬件,扩大可服务的设备范围。
  • 体验提升:端侧推理减少网络往返,实现低延迟响应;本地处理增强用户数据隐私,提升产品合规性与用户信任。
  • 差异化优势:相比单独剪枝或单独量化,SQS 在相似精度损失下可获得更高压缩率,提高企业模型压缩投入的产出比。

与现有产品/工作流的接口

  • 后训练压缩步骤:在原始模型训练完成后,使用 SQS 变分学习微调得到稀疏量化模型,再导出为 ONNX / TensorRT 格式,无缝接入现有推理引擎。
  • 兼容量化感知训练工具链:可替换或增强现有 QAT 损失函数,基于 PyTorch / TensorFlow 实现,降低迁移成本。
  • 开源可复现:项目提供 GitHub 实现 与 项目主页,便于算法团队快速集成到内部压缩 pipeline 并进行二次开发。

局限

  • **训练复杂度与近似误差**:SQS 采用 spike-and-slab 先验与 GMM 的变分推断,需要推导 KL 散度上界等近似目标,这引入了额外的超参数(如混合分量数、温度参数等)和可能的近似偏差。论文未报告训练时间、内存开销或收敛速度,但在实际工程中,变分推断通常比标准剪枝或量化方法更耗时,且对超参数敏感,可能限制其在超大规模模型上的可扩展性。
  • **部署效率与硬件支持未充分评估**:论文重点展示压缩率(模型大小缩减)和精度保持,但未提供推理延迟、吞吐量或能耗数据。低比特量化(如 2-4 bit)往往需要定制化算子或专用硬件才能实现实际加速,而论文未讨论在不同硬件平台(GPU、NPU、边缘设备)上的兼容性和量化推理实现,这导致其工程落地价值尚不明确。
  • **实验覆盖范围与基线选择**:虽然实验涵盖 ResNet、BERT-base、Llama3.2 和 Qwen2.5,但任务类型集中于图像分类和语言模型,缺少在目标检测、图像分割、生成模型等复杂任务上的验证。此外,对比的基线可能未包含所有最新的混合精度量化或结构化剪枝方法,且未展示在极端压缩率(如 1-bit 或 95% 稀疏度)下的鲁棒性,使得方法的适用边界和失效模式不够清晰。
论文Ziyi Wang2026-09-07原文

相关内容