论文

ZeroUnlearn: 大型语言模型中的少样本知识遗忘

ZeroUnlearn: 大型语言模型中的少样本知识遗忘

大型语言模型因在海量网络语料上训练,不可避免地保留了被定义为可能引发有害生成的输入——即敏感信息,从而引发了隐私和安全担忧。现有的机器遗忘方法主要依赖重训练或激进微调,但前者计算成本高昂,后者容易损害相关知识及整体模型效用。 本文将机器遗忘重新建模为通过模型编辑实现的精准知识重映射问题,并提出ZeroUnlearn——一个少样本遗忘框架。它通过将敏感输入映射到中性目标状态并移除其原始表示来重写这些输入。ZeroUnlearn 利用具有闭式解的乘法参数更新来强制表示正交性,从而实现高效且靶向的遗忘。我们进一步将 ZeroUnlearn 扩展到基于梯度的变体,以支持多样本遗忘。 实验表明,我们的方法在保持通用模型效用的同时,超越了现有基线。代码已开源:https://github.com/XMUDeepLIT/ZeroUnlearn。

论文精读

TL;DR ZeroUnlearn 将机器遗忘重新定义为知识重映射,通过闭式解乘法更新实现少样本精准擦除敏感信息,同时保持模型通用能力。

问题

问题背景

大语言模型 (LLMs) 在海量网络数据上训练,不可避免地记忆了敏感信息(如个人隐私、偏见内容)。这引发了隐私与安全合规风险,推动 机器遗忘 (machine unlearning) 成为研究热点,旨在从模型中移除特定知识,而不重建整个模型。

现有方法的局限

  • 重新训练:计算代价极高,对百亿参数模型几乎不可行。
  • 激进微调:通过损失函数反向抑制敏感知识,但易导致灾难性遗忘,损害模型在无关任务上的通用能力。
  • 传统模型编辑:通常针对单条知识进行局部修改,难以扩展到多样本遗忘,并且缺乏对遗忘后表示空间的有效约束,易残留原始知识的痕迹。

为什么这个问题难且重要

技术挑战在于 精准性与泛化的矛盾:遗忘必须足够彻底(移除敏感表示),同时不能扰动模型的其他知识。此外,实际场景要求少样本甚至单样本即可完成遗忘,这对参数更新的灵敏度与解耦性提出极高要求。业界关注度持续上升,因为数据隐私法规(如 GDPR)强制要求“被遗忘权”,且模型服务商需快速修复暴露的安全漏洞,而非重新预训练。

行业类比

类似于智能音箱需要即时删除特定用户的对话记录,而不影响对通用指令的理解与执行;机器遗忘技术赋予 LLM 这种“选择性失忆”能力,在维持服务质量的同时满足隐私合规。

核心洞察

  • 将机器遗忘重新定义为模型编辑中的知识重映射,实现高效、精确的敏感信息移除。ZeroUnlearn 通过乘性参数更新直接将敏感输入的原始表示覆盖为中性目标,并施加表示正交性约束,确保遗忘过程对无关知识的影响最小。相较于依赖重训练或激进微调的传统遗忘方法,该方案无需完整再训练即可完成遗忘,计算开销低,且不会造成模型通用能力的显著退化。
  • 引入闭式乘性更新与梯度变种的两阶段遗忘策略,灵活适配 few-shot 与多样本场景。ZeroUnlearn 的闭式解直接通过空空间约束实现一步到位的遗忘,适合快速少量样本处理;而当遗忘样本增多时,梯度变种可增量优化,避免闭式解在高维矩阵求逆时的复杂度瓶颈。这种组合在效率和遗忘精度之间提供了实用折衷,相较于仅用梯度修正或仅用闭式更新的单一机制方法,能更好地服务于实际部署中不同规模的遗忘需求。

方法

输入与目标设定

ZeroUnlearn 将知识遗忘重新定义为模型编辑问题:给定一个包含敏感信息的输入序列(如隐私问答对),目标是将该输入对应的隐藏表示从原始表示 (\mathbf{h}_s) 重映射到一个中立目标表示 (\mathbf{h}_n),同时移除原始表示以阻止模型生成有害输出。中立表示通常来自一条通用拒绝回答的模板,确保模型对该输入不再激活相关知识。

核心机制:零空间约束的乘法更新

方法的核心在于表示正交性强制。ZeroUnlearn 在选定的 Transformer 层(通过层识别实验确定 MM_weights 层为最优干预点)对 MLP 权重矩阵 (\mathbf{W}) 执行一次乘法参数更新,引入一个低秩校正矩阵 (\Delta\mathbf{W})。更新后的权重使原始敏感表示 (\mathbf{h}_s) 与中立表示 (\mathbf{h}_n) 在输出空间中被强制正交,从而将 (\mathbf{h}_s) 投影到中立方向的零空间,等价于擦除了原始表示。

这一更新具有闭式解:不需要任何迭代训练,只需根据 (\mathbf{h}_s)、(\mathbf{h}_n) 及原权重 (\mathbf{W}) 直接计算 (\Delta\mathbf{W}),计算复杂度低,仅涉及简单的矩阵运算。整个过程仅需少量样本(few-shot),甚至一个样本即可完成遗忘。

多样本扩展

面对多样本遗忘需求,精确闭式解在高维下可能因样本间冲突而失效。ZeroUnlearn 进一步提供了梯度基变体:将正交约束转化为可微损失函数,通过若干步梯度下降优化 (\Delta\mathbf{W}),从而在多个敏感样本上联合学习一个共享的校正矩阵,保持遗忘效果与效率的平衡。

工程启示

  • 高效部署:闭式解意味着遗忘操作几乎瞬间完成,适合须快速响应隐私删除请求的线上系统。
  • 可控性:仅修改特定层权重,避免全模型微调带来的灾难性遗忘,下游评估显示通用能力不受明显影响。
  • 可解释性:通过强制表示正交,遗忘过程在隐空间中有明确几何意义,便于验证与调试。

与同类方法的差异:区别于基于梯度上升(如对敏感样本进行负对数似然最大化)或重新训练(需要访问原始数据)的方案,ZeroUnlearn 直接从表示空间切入,利用闭式解实现无需迭代训练、单步完成的精准遗忘,且对辅助数据依赖极低,避免了一般微调引发的知识扰动与高昂计算开销。

实验

实验设计

ZeroUnlearn 在知识遗忘基准(如 MQUAKE)与通用效用基准上评估。首先通过目标层识别选择最优干预层,然后分别执行少样本遗忘多样本遗忘实验,对比重训练、激进微调等基线。评估维度包括遗忘成功率、下游任务性能保持、参数更新效率以及计算开销。

关键发现

  • 遗忘效果:在两种设置下均实现最先进的遗忘成功率,同时将模型通用能力损失控制在极小范围。
  • 正交表示:通过乘法参数更新将敏感输入映射到中性状态,并强制原表示与新表示正交,实现精准知识擦除。
  • 效率优势:闭式解直接计算更新矩阵,无需迭代训练,单次遗忘耗时极短,适合在线部署。
  • 可视化验证:PCA 投影显示遗忘后目标表示与原表示呈正交关系,证实方法机理。

基线对比深度解读

传统机器遗忘依赖全量重训练或激进微调,二者在计算成本与遗忘-效用平衡之间存在固有矛盾。ZeroUnlearn 以模型编辑视角重构问题,利用零空间约束对参数进行结构化修正,既避免了全量重训练的高额开销,又比微调方法更精确地保护了邻近知识。实验表明,相比现有基线,ZeroUnlearn 在遗忘质量与模型整体能力维持上具备显著优势,为语言模型的隐私合规提供了轻量级、可插拔的工程方案。

行业影响

落地场景

ZeroUnlearn 解决了 LLM 部署中敏感信息残留的核心痛点,适用于任何需快速、精准移除模型内特定知识的场景。典型应用包括:

  • 客服机器人:电商、金融等领域使用 LLM 构建对话系统,但训练数据可能包含用户隐私(地址、身份证号等)。ZeroUnlearn 仅需少量样本即可抑制模型对这些模式的记忆,避免泄露。
  • 内容安全审核:平台需保证推荐或生成模型不输出暴力、偏见等有害内容,可通过定向遗忘训练数据中的污染片段来加固安全防线。
  • 合规性处理:当法规要求删除特定用户数据时(如 GDPR 被遗忘权),无需重训模型,直接对目标知识进行正交化遗忘,大幅缩短响应时间。

商业价值

  • 降本:传统重训练或激进微调成本极高,ZeroUnlearn 的闭式解更新只需一次矩阵乘法,可在分钟级完成遗忘,将计算开销降低数个数量级。
  • 增收:增强模型合规能力,避免因隐私泄露导致的巨额罚款与品牌声誉受损,间接保障商业收益。
  • 体验提升:遗忘过程只破坏目标知识的表征,不影响模型通用能力(如语言理解、常识推理),确保下游业务质量不滑坡。

与现有产品 / 工作流的接口

ZeroUnlearn 作为轻量级模型编辑工具,可无缝嵌入 MLOps 流水线:

  • 集成方式:提供 Python API,接收遗忘样本及目标层配置,输出更新后的参数。可封装为容器化服务,通过 REST 或 gRPC 调用。
  • 协同组件:需配合 敏感知识探测模块(如正则匹配、分类器)定位待遗忘信息;更新后的模型可直接替换原有推理服务中的权重,无需改动推理框架。
  • 运行成本:仅修改 MLP 或 Attention 的少数层,内存占用低,适合在线增量更新。

具体用例

  1. 电商智能客服的隐私清洗
    某全球电商平台使用 LLM 客服,但在微调时误用了含真实用户地址的对话日志。利用 ZeroUnlearn,只需提供 3–5 条包含地址的示例,即可使模型对类似格式的字符串不再生成具体地址,转而输出“** [已脱敏] **”。整个过程在单张 GPU 上耗时数秒,对客服应答的流畅度与准确率几乎无影响。

  2. 金融投资建议模型的合规遗忘
    金融机构的 LLM 助手曾学习过某对冲基金的内部策略报告。当该基金要求数据删除时,合规团队使用 ZeroUnlearn 的梯度变体,对涉及该基金的多条样本进行批量遗忘。更新后模型对相关问题的回应变为“无法提供该信息”,但仍能正常回答市场宏观分析,既满足监管又维持了服务质量。

局限

  • **对靶层选择的依赖性较强**:ZeroUnlearn 依赖在特定层进行乘法参数更新,论文通过消融实验识别最优层,但不同模型架构或遗忘任务可能需要重新搜索,这在实际部署时会引入额外计算开销。若靶层选择不当,遗忘效果可能下降,而自动化、自适应的层选择策略尚未给出,限制了其在不同 LLM 上的即插即用性。
  • **遗忘类型的覆盖范围有限**:方法将遗忘定义为敏感输入到中性目标输出的重映射,并强制原表示与新表示正交。这种范式天然适合一对一或一对多的输入改写,但对于抽象概念(如偏见、危险知识)的全局遗忘、或需要解耦多个关联知识的复杂场景,其有效性未经验证。当敏感信息的变体或组合出现时,残留表示可能仍能被激活。
  • **实验评估缺少对抗稳健性验证**:论文主要在 MQUAKE 等知识编辑基准上评估,虽然包含了下游效用测试,但未考虑对抗性越狱或提示工程攻击。在真实隐私场景中,攻击者可能通过精心设计的提示重新提取被遗忘的信息,而 ZeroUnlearn 的闭式解和正交约束能否抵御此类攻击仍属未知,这限制了其在安全性要求高的生产环境中的可信度。
论文Yujie Lin2026-05-20原文

相关内容