越流行,越难忘:面向 LLM 遗忘的自适应流行度方法
流行事实在预训练阶段被记忆得更深,因此比稀有事实更难被移除,但现有的 LLM 遗忘方法通常对所有训练数据施加统一的梯度压力,忽略了数据出现频率的影响。 我们提出 AdaPop(Adaptive Popularity)方法,将局部 token 置信度与基于外部代理(如 Wikidata 链接数、LLM-as-Judge)推导出的每事实流行度指数相结合,并引入双上升控制器自动调节遗忘-保留平衡——每个训练周期动态调整保留惩罚项。 在三个模型家族和两个基准测试上,AdaPop 在释义查询下的遗忘内容泄露比对比方法低约 5 倍,在对抗性改写下低约 1.6 倍。内部指标进一步支持我们的分析:与现有方法相比,AdaPop 使遗忘集的隐藏状态更远离预训练模型的表征,同时保持保留集的表征接近原始状态。
论文精读
TL;DR 热门事实在 LLM 预训练中记忆更深、更难遗忘,现有 unlearning 却施加均匀梯度压力。AdaPop 按事实流行度自适应调节梯度,并用 dual-ascent 自动平衡遗忘与保留,在改写与对抗查询下大幅降低遗忘内容泄露。
问题
问题背景
当前 LLM 去学习(machine unlearning)领域关注如何在保留模型通用能力的前提下,移除特定事实、隐私数据或有害知识,以满足数据合规与安全要求。
现有方法局限
主流梯度类方法(如 GA、GD、NPO)对遗忘集施加均匀梯度压力,忽略训练数据频率差异:
- 热门事实 在预训练中重复更多、记忆更深,但现有方法对所有 token 一视同仁,导致热门内容擦除不足,或为覆盖热门内容而过度更新,损害保留集性能。
- 遗忘-保留平衡通常靠固定超参或人工调参,缺乏自动化机制,面对不同数据分布时鲁棒性差。
为什么难/重要
- 技术难点: 需要为每个事实引入 popularity 信号,并映射为梯度指数;同时用 dual-ascent 动态调整保留项权重,避免 Pareto 前沿偏移。
- 业界关注: 数据删除请求、版权内容移除、模型安全红队等场景都要求可验证、低泄漏的遗忘,且不能破坏模型对话、推理等通用能力。
类比: 就像从已部署的推荐模型中删除爆款敏感内容——热度越高,用户向量中残留越多,常规删除难以根除。
核心洞察
- 事实流行度是遗忘难度的关键变量,但现有方法将梯度压力均匀施加。AdaPop 通过外部代理(如 Wikidata sitelinks 或 LLM-as-Judge)计算每事实的流行度指数,与局部 token 置信度结合,使梯度压力与训练频率对齐。这一设计解释了为什么流行事实在 paraphrased 和 adversarial 查询下更难根除,并针对性地增强了遗忘集内部差异的处理,相比 NPO、GA 等基线,在相同训练预算下显著降低泄漏。
- 双上升控制器将遗忘与保留的权衡自动化,避免人工调参。AdaPop 把 retain 惩罚系数视为对偶变量,每 epoch 根据约束违反程度动态调整,将 unlearning 形式化为约束优化。工程上,这免去了对不同模型/基准反复扫描 forget/retain 权重的负担,同时保证在多个模型家族上保持通用能力。内部指标显示 forget-set 隐藏状态远离原模型而 retain-set 保持接近,证明优化方向正确且未过度破坏保留知识。
方法
方法详解
输入:预训练 LLM、遗忘事实集、保留集,以及外部流行度代理(如 Wikidata sitelinks 或 LLM-as-Judge 打分)。
关键模块:
流行度感知遗忘目标:对每个事实,基于外部代理计算流行度分数,映射为逐事实的流行度指数,用于调节遗忘损失的梯度贡献;同时结合局部 token 置信度,对模型输出高置信的 token 施加更大压力,使梯度更集中于顽固记忆。流行度越高(训练中出现越频繁),所需遗忘压力越大,避免“浅层擦除”。
双重上升控制器:将遗忘与保留建模为约束优化问题,在每个 epoch 自动调整保留惩罚系数,在遗忘集损失下降的同时保持保留集性能稳定,避免过遗忘与灾难性遗忘。
输出:更新后的 LLM 参数,遗忘集内容在各类查询下泄漏显著减少,保留集性能接近原始模型;内部表示上,遗忘集隐藏状态远离预训练模型,保留集隐藏状态保持接近。
与同类方法差异:现有梯度上升类方法对全部遗忘样本施加统一梯度压力,难以平衡流行事实与罕见事实的遗忘难度;AdaPop 根据事实流行度与模型置信度自适应调节遗忘强度,并自动平衡遗忘/保留,显著降低泄漏。
实验
实验设计
在 Llama-3.1-8B-Instruct、Gemma-7B-it、Qwen2.5-7B-Instruct 三个模型家族上,使用 DUET 和 RWKU 两个基准的改写与对抗子集评估 AdaPop。方法结合局部 token 置信度和基于外部代理(如 Wikidata sitelinks、LLM-as-Judge)的流行度依赖指数,并通过 dual-ascent 控制器 每 epoch 调整保留惩罚。
关键发现
在改写查询下,AdaPop 相比竞争方法少泄露约 5 倍 遗忘内容;在对抗性改写下,少约 1.6 倍。内部指标显示,遗忘集隐藏状态与预训练模型状态距离更大,而保留集表示保持接近。
与基线对比
与统一梯度压力的方法相比,AdaPop 根据事实流行度差异化施加梯度,更有效地移除深度记忆的流行事实,同时保护保留集。dual-ascent 控制器 自动平衡遗忘与保留,避免手动调参,提升训练稳定性。
行业影响
落地场景
- 电商智能客服: 用户依据数据保护法规要求删除历史订单、收货地址等个人事实时,AdaPop 可对高频出现的用户信息施加更强梯度压力,避免在 paraphrase 查询下重新泄漏。
- 内容平台版权下架: 当书籍、影音等内容因版权或违规被移除,模型需要忘记相关情节与细节,同时保留相邻领域的通用知识;AdaPop 的流行度自适应机制可优先擦除被高频引用的特定事实。
- 医疗 / 金融合规: 面向患者的问答系统需在撤回患者同意后彻底删除个性化数据,AdaPop 对敏感实体及其组合的事实进行定向遗忘,降低对抗性改写下的重现概率。
商业价值
- 降本:
dual-ascent controller自动平衡遗忘与保留损失,省去逐任务人工调参;相比重新训练或传统 GA/GD 方法,可显著减少因未彻底遗忘导致的事后修复与人工审核成本。 - 风险控制: 在基准测试中,AdaPop 将遗忘内容泄漏量降低约 5 倍(paraphrase)与 1.6 倍(adversarial),直接降低因数据泄漏带来的罚款与声誉损失。
- 体验提升: 保留集隐藏状态接近原模型,通用能力退化较小,产品可快速响应合规请求而不牺牲整体性能。
与现有工作流接口
- 模型更新阶段: 在 SFT/RLHF 之后、部署之前,将 AdaPop 作为轻量 fine-tune 步骤注入遗忘集,使用
Wikidata sitelinks或LLM-as-Judge作为 popularity 代理计算每个事实的梯度指数。 - 评估与监控: 在现有 MLOps 评测 pipeline 中加入 paraphrase 与 adversarial reformulation 测试集,监控
ΔLP、ΔRank等指标;双上升控制器的动态 α 状态可作为 checkpoint 元数据保存,便于回滚与审计。 - 多模型适配: 已在 Llama-3.1-8B-Instruct、Gemma-7B-it、Qwen2.5-7B-Instruct 上验证,可直接集成至基于 Hugging Face transformers 的 serving 栈,无需额外推理时开销。
局限
- **外部代理依赖**:AdaPop 需要外部代理(Wikidata sitelinks 或 LLM-as-Judge)估算事实流行度,引入额外标注成本与潜在噪声。在缺乏结构化知识库的领域或代理判断不稳定时,流行度指数 `β` 可能失准,导致遗忘强度分配错误。论文虽在附录 F 验证了噪声鲁棒性,但实际部署中代理质量更差,且代码、推理等非事实类知识难以用 sitelinks 衡量,方法普适性受限。
- **基准与模型覆盖有限**:实验仅在 Llama-3.1-8B-Instruct、Gemma-7B-it、Qwen2.5-7B-Instruct 三个 7-8B 指令模型上,使用 DUET 和 RWKU 两个事实类遗忘基准。未测试更大规模模型或非事实类知识,也未提供正式的可证明遗忘保证,依赖经验指标难以满足严格隐私法规要求。
- **超参数敏感与校准复杂度**:AdaPop 引入 popularity 指数 `β` 与 dual-ascent 控制器,需设置 anchor points 和学习率等,附录 C 虽分析了系数敏感性,但实际使用中仍需针对不同模型/数据集重新校准,工程负担较大。与固定系数的 NPO 等方法相比,调参空间更大,anchor 选择不当会导致遗忘不充分或保留能力下降。