Forgetting That Sticks: 通过电路归因实现量化持久的遗忘
标准遗忘评测在训练后立即测量全精度下的行为抑制,而每个部署的语言模型都先经过量化。近期工作表明4-bit训练后量化可逆转机器遗忘;我们证明这不是调优假象,而是系统性双重失败:实现有意义遗忘的梯度方法在压缩下失效,而能经受住量化的方法几乎不改变模型。两种失败溯源同一根本原因:所有基线中,每参数更新量低于NF4量化 bin 宽度的47-828倍;遍布数十亿参数的更新无法越过量化 bin 边界,我们将其形式化为稀疏-持久性权衡。我们提出MANSU(机制对齐零空间遗忘),通过组合因果电路归因以隔离最小遗忘子图、基于对角Fisher保持界限的电路受限零空间投影,以及保证量化生存的逐参数幅值下限,解决了两种模式。我们还引入电路归因散度(CAD),一种区分结构擦除与行为抑制的机制验证指标,现有指标无法区分。在多个模型家族和危险基准上,MANSU是首个同时满足全部四个属性(有意义遗忘、保持保留、非正向PTQ差距、结构擦除)且每个属性都有余量的方法,而梯度基线在压缩下恢复多达+0.05准确率。
论文精读
TL;DR MANSU 首次解决 4-bit 量化逆转遗忘的难题:通过电路归因定位须遗忘的最小子图,并强制参数更新幅度越过量化分箱边界,实现压缩下仍永久生效的结构性擦除。
问题
问题背景
机器遗忘 (machine unlearning) 是部署语言模型的关键安全能力,既要消除模型对危险知识(如生化武器、网络攻击)的记忆,又要满足数据删除法规。然而,几乎所有生产环境的大模型都会先进行量化压缩(如 4-bit NF4)以降低资源消耗,这一实际部署流程与现有遗忘算法的假设脱节。
现有方法的局限
标准遗忘评估在 全精度 (FP32/FP16) 下测量行为抑制,忽略了量化引入的影响。近期工作发现 4-bit 后训练量化 (PTQ) 会逆转遗忘效果,本文进一步揭示这并非调优瑕疵,而是系统性双重失败:
- 梯度类方法(如梯度上升、DPO 变体)虽能有效遗忘,但其参数更新幅度仅为 NF4 量化 bin 宽度的 1/47 至 1/828,更新被量化离散化完全抹除,导致压缩后遗忘效果消失。
- 能经受量化的方法(如表示调控)往往只做浅层行为抑制,模型内部知识结构几乎未变,本质上不是真正遗忘。
根源在于所有方法的参数更新都过于稀疏和微弱,无法穿越量化 bin 边界,造成 稀疏性–持久性权衡 (sparsity-permanence tradeoff)。此外,现有指标无法区分行为抑制 (behavioral suppression) 与结构擦除 (structural erasure),导致虚假的安全感。
为何该问题既困难又重要
量化是模型上线的必经之路,遗忘必须 量化后依旧持久 (quantization-permanent),否则部署后危险知识可能复燃,构成安全合规风险。技术挑战在于:既要保证更新幅度足够大以穿越量化网格,又不能破坏模型的基础能力,且需精准定位与遗忘目标相关的子网络,避免全局扰动。业界对可信 AI 的监管日益严格,持久可验证的遗忘 成为刚需。
行业类比
就像自动驾驶系统通过 OTA 更新移除危险驾驶策略后,若模型压缩导致部分行为回退,上路后可能触发严重事故——遗忘不持久,安全就无从谈起。
核心洞察
- **量化暴露了遗忘的稀疏-持久性权衡**:现有梯度遗忘方法在 full precision 下有效,但 4-bit 量化后效果几乎消失,根源是参数更新量普遍低于 NF4 量化区间宽度(47-828 倍之差),扩散到数十亿参数后无法跨越量化边界。这并非调参问题,而是部署 LLM 必然遭遇的量化压缩与遗忘更新之间的结构性矛盾,揭示了所有遗忘方法必须考虑量化后持久性。
- **电路归因 + 空空间投影实现选择性、量化鲁棒的遗忘**:MANSU 首先用因果电路归因定位遗忘行为的最小参数子图,然后只在电路内做空空间投影,并用对角 Fisher 约束保留其他知识,最后强制参数更新幅度不低于量化区间下限,保证量化后遗忘不反弹。相比全局梯度上升等基线,这种电路限制的干预显著减少了模型能力损失,同时首次实现了有意义的遗忘、保留保持、非正 PTQ 差距和结构擦除四项指标的联合满足。
- **Circuit Attribution Divergence (CAD) 区分结构擦除与行为抑制**:以往遗忘评估仅依赖行为指标(如 loss 变化),无法辨别模型是真正“遗忘”了知识还是仅仅学会了抑制表达,后者容易被对抗或微调恢复。CAD 通过比较遗忘前后电路图中 edges 的归因差异,量化因果结构的改变,为测量遗忘深度提供了更本质的验证手段,避免了行为抑制带来的虚假安全感。
方法
核心问题
标准遗忘方法在 FP16 下能抑制目标知识,但部署时必需的 4-bit 量化(如 NF4)会因参数更新幅度远低于量化 bin 宽度而使遗忘失效。MANSU 通过三阶段设计解决这一稀疏性-持久性权衡。
阶段 1:因果电路归因(输入 → 关键子图)
- 使用 EAP-IG(边归因 + 积分梯度)在模型前向中定位对遗忘集预测起决定作用的最小参数子集(电路 (\mathcal{C})),通常仅占 MLP 层少于 1% 的权重。
- 归因聚焦 MLP 子层(注意力层不稳定),输出高稀疏电路,作为后续唯一更新域。
阶段 2:电路限制的零空间投影(保持保留行为)
- 在电路 (\mathcal{C}) 上计算对角 Fisher 信息矩阵(基于保留数据),近似参数对保留损失的重要性。
- 将遗忘更新方向投影到保留损失零空间,通过约束梯度上升最小化遗忘损失,同时用原始模型作为 KL 锚点 防止保留能力退化。
- 该阶段产生行为抑制模型,但参数变动仍远小于 NF4 量化间距,直接量化即抹除。
阶段 3:幅度下界强制(保证量化后保留)
- 解析 NF4 量化级别,为每个参数设定最小更新幅度下界(floor,通常 ~0.01),使其至少跨越一个量化 bin。
- 对阶段 2 所得更新量做截断:小于 floor 的改为 ±floor(符号对齐),并验证是否违反保留约束;若违反则回退。
- 最终模型参数 = 原始参数 + floor 截断更新,天然兼容 NF4 量化。
输出与验证
得到量化鲁棒遗忘模型,在 FP16 和 NF4 下均保持遗忘与保留。引入 CAD(电路归因散度)度量——量化前后电路内归因分布变化,区分结构性擦除与行为抑制。
差异点
与梯度上升、偏好优化等基线相比,MANSU 首次同时达成 有效遗忘、保留无损、非正 PTQ gap、结构擦除 四项指标,根源在于将遗忘浓缩于极小电路并引入量化感知幅度保证,而非在全部参数上做微小、易丢失的更新。
实验
实验设计
本研究在 Gemma、Llama、Qwen 等多模型家族及危险知识基准(如 WMDP、MUSE)上进行系统性量化永久性遗忘评估。实验流程为先全精度遗忘训练,紧接着 4-bit NF4 量化,测量量化前后遗忘与保留指标。对比基线包括梯度上升及其变体、偏好优化、零空间投影等方法。核心评价指标有四:(1) 量化前遗忘准确度(衡量行为抑制),(2) 保留准确度(衡量通用能力保持),(3) PTQ Gap(量化前后遗忘效果差,希望 ≤0 表示不恢复),(4) 新提出的 Circuit Attribution Divergence (CAD)(衡量结构擦除程度)。消融实验依次移除电路定位、零空间投影与幅度下限,验证各组件必要性。
关键发现
所有基于梯度的遗忘方法在量化后均出现知识恢复,上限可达 +0.05 accuracy。根源在于:梯度更新分布在数十亿参数上,其平均幅度仅为 NF4 quantization bin width 的 1/47 至 1/828,无法越过量化区间边界,因而参数在压缩后被钳位回近似原值,遗忘仅停留在行为层面而非结构擦除。由此揭示了 sparsity-permanence tradeoff:参数更新越稀疏,量化后保持遗忘的可能性越低。我们提出的 MANSU 通过因果电路归因精确锁定遗忘子图,并在该子图上施加约束零空间投影(配以对角 Fisher 保留锚)与逐参数幅度下限(NF4_floor),首次同时满足全部四个属性:有意义遗忘、保留保护、非正 PTQ Gap、结构擦除。消融表明缺失任一组件都会导致 PTQ Gap 转正或保留能力骤降。
与基线对比
基线方法在全精度下虽能压制遗忘相关行为,但量化后因参数更新幅不足 bin 边界而恢复,PTQ Gap 始终为正。MANSU 则通过设计保证每步更新均不低于 NF4_floor,使得量化后的参数分布仍保持遗忘状态,PTQ Gap 稳定 ≤0。此外,电路限制使更新仅涉及最少节点(通常不足原参数量的 5%),极大缓解了对保留性能的干扰,保留准确度较全局更新方法高出数个百分点。相比偏好优化等方法,MANSU 无需额外训练偏好数据,在结构擦除(CAD)上更具优势。该优势在 Gemma、Llama、Qwen 等不同架构上一致复现,证明方法的泛化性。
行业影响
落地场景
量化部署已成为大模型上线的标准操作(NF4/ GPTQ/ AWQ 等 4-bit 方案),但遗忘后量化会导致已遗忘危险知识“复活”,使安全对齐失效。MANSU 首次保证量化前后遗忘效果一致,可直接嵌入以下业务:
- 企业级 AI 助手:须按 GDPR / EU AI Act 要求擦除特定用户数据或敏感知识,模型仍需保持通用能力。MANSU 确保 Erased 后量化模型不掉点。
- 内容安全审核:需动态移除模型对暴力、生化武器等有害知识的记忆,但又不能损伤正常文本生成质量。MANSU 提供结构级擦除(CAD 指标),而非表面行为抑制。
- 医疗/金融领域模型:需要定期遗忘过时法规、错误诊疗知识或客户隐私,同时量化推理以节省成本。
商业价值
- 降本:避免因量化失效而重新全参微调或重新对齐,节省数倍 GPU 成本;模型可直接从全精度遗忘状态转换到量化部署,无需额外改正步骤。
- 合规:满足遗忘验证的法规要求,降低法律风险。CAD 指标能提供可审计的结构性遗忘证据,比传统行为指标更可靠。
- 体验提升:量化后始终如一的遗忘效果,让产品安全与可用性兼得,避免出现“遗忘后又回忆”的灾难性客户体验。
与现有产品/工作流的接口
MANSU 可作为遗忘流程的后处理模块插入:
- 使用原有遗忘方法(如梯度上升、NPO、SimNPO 等)产生初步遗忘模型;
- 运行 MANSU 三个阶段:电路归因定位最小需改子图、电路约束零空间投影实现遗忘且保性能、幅度下限强制保证量化后更新不消失;
- 量化并部署,MANSU 保证 PTQ 间隔非正。
集成简单:支持 HuggingFace Transformers + BitsAndBytes 或 GPTQ 等常见量化库;可与现有 CI/CD 管线结合,在模型发布前加入 CAD 验证关卡。
具体落地方案
- 电商对话机器人:客服模型曾记忆某次内部测试中用户的支付信息,需彻底遗忘。先使用 NPO 遗忘,再经 MANSU 加固,4-bit 量化部署后无信息泄露,且通用问答能力不下降。
- 医疗 AI 预问诊:模型学习了过时诊疗指南,需移除对应知识。通过 MANSU 定位相关电路并擦除,量化后推理准确性不变,避免错误导诊。
局限
- **计算开销较大**: MANSU 依赖细粒度因果电路归因 (EAP-IG) 和受限参数更新流程,归因阶段需对每个遗忘样本计算梯度路径,训练阶段需强制执行幅值底线和零空间投影,整体时间成本显著高于简单梯度上升或偏好优化基线。这在资源受限或要求快速遗忘的场景下构成障碍,限制了其在极高吞吐量部署环境中的实用性。
- **量化格式泛化性未充分验证**: 方法设计紧密围绕 NF4 的量化箱宽度和结构,力保更新幅值能跨过量化边界;虽然实验涵盖多模型家族,但量化格式多限于 NF4,未系统探索 GPTQ、AWQ 等格式下的持久性。在其他量化策略下,幅值底线公式是否仍有效、PTQ 间隙是否仍为非正,均缺少证据。
- **电路定位的可靠性问题**: 遗忘性能高度依赖因果电路的质量,若归因未能精准隔离所有相关知识节点(例如跨层扩散的隐式记忆),则可能残留危险知识。论文未深入分析假阴性电路的影响以及归因方法的鲁棒性;当知识分散程度高或训练数据分布偏移时,局部修复的有效性可能衰减。