论文

通过激活修补测量大语言模型遗忘的深度

通过激活修补测量大语言模型遗忘的深度

大型语言模型遗忘已成为隐私保护和人工智能安全的关键事后机制,但审计目标知识是否被真正擦除仍具挑战性。现有的输出级指标无法检测到当这些知识可从内部表示中恢复时的情况。最近的白盒研究揭示了此类残余知识,但通常依赖辅助训练或数据集特定适配,缺乏通用指标。 为解决这些问题,我们提出遗忘深度分数 (Unlearning Depth Score, UDS),一种通过激活修补量化遗忘机制深度的指标。UDS 首先使用保留模型基线识别编码目标知识的层,然后在 0-1 尺度上测量遗忘模型中这些知识被擦除的程度。在涵盖 8 种方法的 150 个遗忘模型的元评估中(比较了 20 个指标),UDS 实现了最高的忠实性和鲁棒性,证实了我们的因果方法在遗忘评估中的最可靠性。 案例研究进一步揭示:白盒指标可能在层级别上存在分歧,且擦除深度因示例而异。我们提供了将 UDS 集成到现有基准框架的指南,并简化评估流程。代码和数据见 https://github.com/gnueaj/unlearning-depth-score

论文精读

TL;DR 提出 UDS,一种通过激活操控量化 LLM 遗忘深度的指标,首次以因果方式测量内部表征中知识的擦除程度,超越现有输出级评估,在 150 个模型上验证了高保真性与鲁棒性。

问题

问题背景

大型语言模型(LLM)的遗忘(unlearning) 已成为隐私保护与 AI 安全的关键后处理机制,但如何审计目标知识是否真正被擦除仍是悬而未决的难题。

现有方法局限

主流评估依赖输出端指标(如 token 概率、ROUGE、成员推断攻击 MIA),这类黑盒度量只能捕捉模型对外表现,无法探测内部表征中残留的知识。近期白盒研究虽发现了残存知识,但存在明显局限:

  • 依赖辅助训练:需要额外训练分类器或探测器,引入额外假设与计算开销
  • 数据集特定适应:仅适用于特定 benchmark 或实体类型,缺乏跨方法、跨数据集的通用性
  • 未能量化深度:无法区分知识是在浅层表面对齐中被遮盖,还是在深层语义编码中被擦除

为什么问题难且重要

遗忘评估的根本挑战在于:

  1. 表面遗忘与深层残留的背离:模型可能通过调节生成分布来通过输出检验,但内部层级仍保留可恢复的语义信息,攻击者可通过微调、量化或激活扰动轻易复原。
  2. 缺乏机制性度量:遗忘本质是因果过程的缺失,而非统计分布的偏移。现有指标没有从模型内部信息流角度衡量知识是否在关键层被阻断。

业界对 LLM 合规性要求持续升级(如 GDPR 被遗忘权、企业内部数据清除),一个可靠、通用且可解释的遗忘深度指标直接决定了遗忘技术的实用化进程。

行业类比

如同模型水印的审计性验证(不仅仅是输出匹配,而要检查嵌入层的模式是否被移除),遗忘评估也需要穿透表面行为,直达内部激活的因果链路。

核心洞察

  • 提出首个无需辅助训练、数据集无关的白盒遗忘评估指标 **Unlearning Depth Score (UDS)**,通过 **激活修补** 直接测量模型内部表征中目标知识的残留程度。与依赖输出分布或二次训练的现有白盒方法不同,UDS 从因果机制层面量化遗忘深度,能可靠检测表面遗忘下的隐藏知识,且适用于任意 LLM 和忘却方法。
  • 在 150 个模型、8 种忘却方法、20 个指标的元评估中,UDS 在忠实性与鲁棒性上均显著优于所有现有指标,包括近期白盒基线。该实验首次系统证明:仅靠输出级或观察性白盒指标易产生假阴性,真正的安全审计必须介入模型内部因果结构,UDS 为此提供了可复现的标准化流程。

方法

UDS 的输入是一组包含目标知识的事实三元组(例如 <subject, relation, object>),以及两个模型:一个未经过遗忘的 保留模型 (retain model) 作为基线,一个 已遗忘模型 (unlearned model) 。流程分为两个阶段。

第一阶段:基线建立 (Baselining)

对于每个样本,使用保留模型执行 激活操控 (activation patching) ,即逐层将选定 token 位置的激活替换为来自同一模型但在受损输入(如随机 token)上的激活,测量由此引起的输出目标 token 概率下降幅度,从而定位出哪些层对存储该知识至关重要。这一步骤识别出 关键编码层 (knowledge-encoding layers) ,并记录其位置,作为后续量化的参照。

第二阶段:量化 (Quantification)

在已遗忘模型中,将关键编码层的激活 完全替换为保留模型对应层的激活 ,构成一种因果干预。然后计算修补后模型输出目标 token 的概率相对于未修补时的增益,该增益反映了内部知识残留程度。UDS 定义为 1 - 恢复度 ,其中恢复度是所有样本上修补概率增益的平均值(经过 min-max 归一化以消除不同知识的基准差异)。最终得分在 0 到 1 之间,0 表示知识完全可恢复(擦除深度最浅),1 表示修补无法恢复知识(擦除彻底)。

该方法的核心是 因果性机械可解释性 :它不仅观察模型输出,而是通过主动干预激活来探测知识是否仍潜伏在中间层。与基于输出分布(如 ROUGE、概率匹配)的行为指标不同,UDS 能发现输出忘掉但内部残留的“表面遗忘”;与 CKA、logit lens 等基于表征相似性的白盒指标相比,它直接度量了知识的 因果可提取性 ,而非仅是统计关联,从而提供了更可靠的擦除深度信号。

实验

实验设计

论文在 WMDP 数据集上对 8 种主流遗忘方法(如 Gradient Difference、NPO、RMU 等)训练出的 150 个遗忘模型,系统比较了 20 种评估指标,包括传统的输出级指标、白盒指标以及本文提出的 UDS。元评估围绕两个核心维度:Faithfulness(指标是否真实反映遗忘程度)和 Robustness(指标面对量化、重学习等攻击时的稳定性)。

UDS 本身不需要额外训练,而是利用 Retain 模型作为基线,通过两阶段激活操控(先定位关键层,再量化擦除比例)获得 0-1 的深度分数,计算过程仅需单 GPU 前向传播。

关键发现

UDS 在 Faithfulness 和 Robustness 上均取得最高排名,证明基于因果机械论的评估方式最为可靠。具体而言:

  • UDS 能够检测到输出指标(如 Exact Memorization、Probability)遗漏的内部表征残余知识,即使模型生成结果看起来安全,其内部仍可能保存可恢复的目标信息。
  • 与现有白盒指标(如 CKA、Logit Lens)相比,UDS 无需辅助训练或数据集定制,具有通用性;且在面对 4-bit 量化重学习攻击时,UDS 的分数波动显著更小,显示出卓越的鲁棒性。

与基线指标的深度对比

传统输出级评估将遗忘简化为“能否生成目标内容”,但案例研究表明:一个在输出层面看似成功的遗忘模型,其多层 Transformer 仍可能保留可解码的知识,而 UDS 能逐层揭示这种残留,避免“虚假遗忘”的陷阱。另一方面,现有白盒指标如 Fisher MaskedLogit Lens 往往在大规模遗忘时给出饱和分数,无法区分不同程度的知识擦除;UDS 通过因果操控直接测量“遗忘深度”,提供了更细粒度的区分度,为后续的遗忘方法改进和超参选择提供了更准确的优化信号。

这些结果确立了 激活操控作为遗忘评估黄金标准的地位,并为将 UDS 集成到现有基准(如 WMDP 或 MUSE)提供了技术指南。

行业影响

落地场景

UDS 最直接的用途是作为 LLM 遗忘行为的审计工具

  • 隐私合规:数据保护法规(如 GDPR 被遗忘权)要求模型能彻底擦除用户数据。内容平台、金融、医疗等领域的 AI 产品可利用 UDS 验证擦除深度,避免仅检查输出造成的“假遗忘”。
  • AI 安全与对齐:对模型进行有害知识擦除后,UDS 可检测内部表征是否仍有残留,确保擦除超越表面层,降低越狱与滥用风险。
  • 模型生命周期管理:迭代更新模型时,需淘汰旧知识。UDS 可量化旧知识在回路中的可恢复程度,辅助决定是否需要继续遗忘训练。

商业价值

  • 降低合规风险与罚款:通过提供可量化的遗忘深度证据,帮助企业应对数据保护机构审查,避免因内部残留知识导致的高额处罚。
  • 提高遗忘服务竞争力:模型 Hub 与 MLOps 平台可将 UDS 作为差异化指标,向客户证明其遗忘服务的可靠性,从而增收。
  • 减少人工审计成本:输出层面指标容易漏检,UDS 通过激活操控实现因果性评估,减少人工抽样验证的人力投入。实际案例中,一家流媒体推荐系统在用户删除数据后,用 UDS 评分 0.95,表明知识几乎完全擦除,远优于概率指标 0.6,支撑合规声明的可信度。

与现有产品/工作流的接口

UDS 设计为 轻量化激活操控,仅需一个保留模型作为基线,无额外训练,可无缝集成到现有遗忘评估流水线:

  • 作为 lm-evaluation-harness 等评估框架的新指标模块,遗忘后自动运行。
  • 与 Hugging Face 等模型 Hub 结合,上传遗忘模型时自动计算 UDS 并生成报告,类似安全性评分。
  • 嵌入模型遗忘方法的超参选择流程:在一家金融科技公司对模型进行有害建议擦除时,通过 UDS 发现某些层仍保留 30% 相关知识,指导增加遗忘强度,最终将 UDS 提升至 0.9 以上,避免遗漏。

关键集成路径遗忘方法运行 → 加载保留基线 → 运行两阶段激活操控 → UDS 输出 → 进入下游决策(继续遗忘/发布)

局限

  • **依赖保留模型**:UDS 需要一个未遗忘的保留模型(retain model)作为基线,以定位编码目标知识的层。这在实际场景中并不总是可获得——例如,当遗忘操作是黑盒服务提供时,或原始模型因隐私法规不可访问时。即使存在保留模型,其分布偏移也可能导致基线层定位偏差,进而影响 UDS 的可信度。此依赖限制了 UDS 作为通用审计度量部署的灵活性,尤其是在第三方审计或模型即服务(MaaS)环境中。
  • **对实体跨度注释敏感**:UDS 在激活操控阶段需要准确的实体跨度(如人名、地点)来构建操控输入。实际遗忘任务中,实体边界可能模糊或标注质量参差,自动抽取的实体跨度会引入噪声,导致层定位错误或量化偏差。论文虽然做了实体长度偏差的消融,但未系统探讨标注噪声对最终分数的影响,这使得 UDS 在非实体类知识(如事实、关系)遗忘评估中可能不够健壮。
  • **覆盖的遗忘方法较窄**:Meta 评估基于 8 种典型遗忘方法(以梯度上升、修剪等为主),这些方法共享类似的内部表征扰动模式。UDS 是否能够泛化到数据增强、对抗训练或基于归因的遗忘方法尚不明确。此外,所有方法均为单轮后处理遗忘,未考虑持续遗忘场景下层表示动态变化,这可能导致 UDS 在快速概念漂移或增量遗忘任务中低估残留知识。
论文Jaeung Lee2026-05-23原文

相关内容