论文

MANCE:流形感知概念擦除

MANCE:流形感知概念擦除

概念擦除旨在从表示中移除目标概念,同时保留其中编码的其他信息。由于表示编码了许多与擦除目标相关的概念,直接移除目标会损伤这些信息。我们提出流形约束假设(MCH):若自然表示集中于结构化低维流形,则干预应限制在该流形上,从而更好地保留表示中的其他信息。 将MCH实例化为新方法流形感知概念擦除(MANCE)。MANCE利用预测目标概念的分类器信号对表示进行迭代更新,通过自然输入获得的表示估计流形,并将概念移除更新投影到该流形上。在119个文本与视觉设置(包括13个语言模型、3个NLP概念、40个CelebA-CLIP属性)上广泛评估。在先前方法基础上应用MANCE一致改善了泄露结果。还引入MANCE+ 与MANCE++ ,在使用MANCE前附加闭式擦除算法,相比对齐的全空间更新实现了更好的泄露-外科手术性权衡。最佳方法MANCE++在非线性概念擦除上取得最先进结果。 这些结果支持擦除场景下的MCH:干预应限制在自然表示流形上。

论文精读

TL;DR MANCE 将概念擦除更新投影到自然表示流形上,显著降低目标泄露并提升手术式擦除精度,在非线性场景下达到最优。

问题

问题背景

概念擦除旨在从模型表征中移除特定概念(如敏感属性),同时保留其他与任务相关的信息,是 AI 安全、可解释性、隐私保护等领域的核心需求。

现有方法局限

传统方法多基于线性变换(如 LEACE)或对抗训练,存在明显短板:

  • 线性假设失效:自然表征通常呈非线性流形结构,线性投影难以精准分离纠缠概念,擦除后常残留信息(泄漏)或破坏无关特征。
  • 手术性不足:移除目标时易附带损害高度相关的概念(如去除“性别”导致“职业”预测受损),无法实现精确的“手术刀式”干预。
  • 忽略几何约束:更新方向未考虑真实数据分布所在的低维流形,导致生成分布外(OOD)表征,引入伪影或造成下游性能下降。

技术挑战与重要性

表征空间中概念高度交织,维度间存在复杂非线性耦合,直接修改极易扩散影响。该问题的核心难点在于如何在破坏目标概念的同时,严格保护其他信息不被牵连。解决这一难题对以下场景意义重大:

  • 模型去偏见:在不损失任务精度的前提下消除歧视性关联;
  • 隐私保护:从共享表征中彻底剥离个人身份信息;
  • 可控生成:精确编辑生成内容的特定属性,维持其余部分不变。

行业类比

类似在图像修复中去除水印:若不顾纹理流形结构直接涂抹,会留下明显痕迹并破坏原图;而基于流形约束的修复可贴合自然图像分布,实现无感知残留的“无痕擦除”。

核心洞察

  • **流形约束假设 (MCH)** 指出,自然表征聚集在低维流形上,因此概念擦除的干预方向必须与该流形相切,才能避免破坏其他信息。这与以往直接在原始空间做投影或减法的擦除思路截然不同——MANCE 通过局部估计切空间,将擦除更新投影到流形上,使得擦除过程保留更多的非目标语义结构,本质上是一种尊重数据内在几何的先验。
  • **MANCE 的迭代流形投影** 使得每一步擦除更新都只沿着与自然表征一致的方向进行,从而在强擦除(低泄露)与高手术精度(低ΔY)之间取得了此前方法未能实现的平衡。相比一次性闭式解(如 LEACE),迭代式投影能逐步剥离仅通过非线性可分的概念残余,而这种逐步精细化的擦除在工程上更可控,且对超参(如邻域半径)的依赖表现出良好的可迁移性。
  • **MANCE++ 的混合策略** 先用闭式擦除(LEACE 或协方差非对称投影)去除线性可分部分,再用 MANCE 处理剩余的非线性成分,实现了泄露–手术性曲线上的帕累托改进。这一思路表明,将线性预处理作为流形擦除的前置步骤,可以显著降低后续迭代的难度和计算量,同时将目标与非目标属性的关联解耦得更加干净,为实际部署中灵活权衡擦除强度与模型能力保留提供了清晰的工程路径。

方法

输入

  • 原始表示 $h \in \mathbb{R}^d$:来自语言或视觉模型的隐藏层特征,每个样本一个向量。
  • 目标概念标签 $c$:需要擦除的概念(如情感、性别属性)。
  • 预训练概念分类器 $f(h)$:用于判断表示中是否仍残留目标概念信息,提供优化信号。
  • 自然参考表示集:从无干预的普通数据中收集的表示,用于流形估计。

关键模块

  1. 局部流形估计:从参考表示集中为每个输入样本选择 $k$ 个最近邻,对其做局部分解(如 PCA),获得以 $k$ 为上限的局部主子空间,近似该点处的切空间。该步骤决定了擦除更新允许移动的方向。
  2. 切线擦除方向构建:利用分类器对当前表示的梯度或预测差异,计算出能降低目标概念可预测性的方向,并投影到上一步的局部切空间上,保证更新与流形相切。
  3. 迭代投影更新:以小步长沿投影后的方向更新表示,重复从流形估计到更新的过程,将表示逐步推离目标概念,同时被约束在流形附近。每次迭代都重新计算 k-NN 和局部子空间以适应表示位移。
  4. 闭式预处理(MANCE+ / MANCE++):在迭代前先用一阶或二阶统计量对齐(如 LEACE 擦除均值差异,或协方差不对称投影消除线性可分性)进行快速粗擦除。MANCE++ 在此基础上进一步执行流形约束迭代,实现非线性残余信息的精细移除。

输出

  • 擦除后表示 $\tilde{h}$:目标概念分类器无法可靠预测 $c$(低泄漏),同时其他概念(如其他属性)的预测能力尽量保持不变(高手术性)。

与同类方法的差异

传统对抗擦除(如 AdvErase)在全空间做无约束梯度更新,容易偏离数据流形而损坏无关信息。MANCE 通过强制更新沿局部流形方向,显著提升了泄漏-手术性权衡,尤其是处理概念间非线性关联时效果更优。MANCE++ 结合闭式预处理与流形投影,在多项基准上取得非线性概念擦除的最优结果。

实验

实验设计

  • 评估规模:覆盖119个设置,包括13个语言模型在三种NLP概念(如毒性、情感、性别偏见)上的表现,以及CelebA-CLIP的40个视觉属性。
  • 基线方法:与先前的线性及非线性概念擦除方法对比,如LEACE、协方差不对称投影等。MANCE可作为后处理步骤叠加于这些基线之上。
  • 评价指标:使用目标泄漏度(Target leakage)、手术性(Surgicality ΔY)、手术性预算(Surgicality budget DY)及覆盖率(Coverage)全面衡量擦除效果与信息保留的权衡。

关键发现

  1. 一致提升泄漏性能:在多种基线上添加MANCE流形投影后,几乎所有设置下目标泄漏均显著降低,证明流形约束的通用增益。
  2. MANCE++取得最优泄漏-手术性权衡:先通过闭式擦除预处理(如LEACE或协方差不对称投影),再施加MANCE迭代投影,在非线性概念擦除任务上达到当前最优(SOTA),尤其在不牺牲过多无关信息的前提下最大程度移除目标概念。
  3. 流形约束使擦除更精准:当目标概念与其余信息纠缠较深、难以手术性分离时,MANCE的改进幅度最大。这表明将更新限制在由自然输入估计的表示流形上,能有效避免对其他概念的误伤。
  4. 延迟代价MANCE每步需执行分类器前向传播与投影计算,相比纯闭式方法增加推理延迟,但换来手术性的显著提升。

与基线对比的深度解读

  • 传统线性投影等方法直接在表示空间整体移除方向时会显著破坏与目标相关的其他概念,因为无约束的任意方向变动容易脱离自然表示实际分布的流形。MANCE通过估计局部流形并将更新投影回流形,实现了类似“外科手术”般的精确擦除。
  • 对比全空间迭代更新,流形约束更新在相同的泄漏水平下能保留更多无关信息,手术性指标更优。在CelebA属性擦除中,**MANCE++**在保持较高覆盖率的同时,手术性显著领先于纯闭式方法或全空间迭代基线。
  • 这些实验结果直接支撑流形约束假设(MCH):自然表示倾向于聚集在具有内在结构的低维流形上,概念擦除等干预若限制在该流形内,能更好地保留其他信息,为未来表示编辑提供原理性指导。

行业影响

落地场景

MANCE 提供了一种更精准的概念擦除方法,适用于需要从模型内部表征中移除特定敏感或不需要的概念,同时尽量保留其他信息的场景。直接可落地的产品/业务包括:

  • 内容审核与安全过滤:在文本或图像生成模型中,擦除暴力、偏见等有害概念,而非粗暴地过滤整个输出。
  • 隐私保护与合规:从用户表征中移除身份、性别等受保护属性,以满足 GDPR 等法规要求,同时不破坏下游任务性能(如推荐系统)。
  • 模型编辑与对齐:在大语言模型中移除特定知识或风格,实现更细粒度的模型行为矫正,而不必重新训练。
  • 生成控制:在图像生成(如扩散模型)中,精准控制输出不包含特定视觉属性,而不影响其他特征。

商业价值

MANCE 的价值核心在于在保持模型性能的前提下,更精确地移除目标概念,直接对应降本与体验提升:

  • 降低合规风险与人工审核成本:自动化的概念擦除可减少人工后处理审核,并降低因模型输出不当内容导致的品牌风险或法律罚款。
  • 提升用户体验与信任:精准擦除偏见或不当内容,而不过度破坏模型流畅度或相关性,可提升用户对 AI 产品的接受度和粘性。
  • 加速模型迭代与部署:无需重新训练即可修整模型行为,大幅缩短从发现问题到修复上线的时间,降低重新训练的计算与数据成本。
  • 增强产品差异化:提供比竞品更“安全可控”的 AI 服务,可为企业赢得更多注重合规与伦理的客户。

与现有产品/工作流的接口

MANCE 可作为一个后处理模块集成到现有推理流水线中:

  • 表征层介入:在已有模型的编码器或中间层输出之后、解码器/分类头之前插入 MANCE 更新步骤,无需修改模型权重。可直接对现有 ONNX/TensorRT 推理图进行扩展。
  • 与现有擦除方法配合:论文中 MANCE+ 和 MANCE++ 就是在 LEACE 等封闭式方法之后叠加 MANCE,因此可作为现有安全工作(如公平性工具包)的增强插件。
  • 轻量级部署:计算开销主要在局部流形估计与少量迭代,可通过 k_min 等参数调控延迟,对在线服务增加可控的推理耗时(~ms 级)。
  • 流程化:训练一个针对目标概念的线性探针(已有公开工具),离线估计流形基,然后在线时对每个样本进行迭代投影更新,可封装为微服务或库函数。

具体落地用例

  1. 社交媒体内容推荐:在用户和帖子表征中擦除政治倾向、年龄等敏感属性,使得推荐系统在保证个性化效果的同时符合去偏见化要求。先对预训练的用户/内容编码器应用 MANCE,再输入排序层,保持 CTR 等核心指标。
  2. AI 写作助手:从模型中间层擦除“抄袭风格”或“过度正式”这类概念,使得辅助生成的内容在保持原意的同时更符合企业品牌调性。用户使用时,输出前经过 MANCE 模块进行实时矫正,提升输出可控性。

局限

  • **流形估计的依赖与质量**:MANCE 依赖对自然表示流形的局部线性估计,通过局部 PCA 构建切空间。该估计的质量受超参数(如局部邻域大小、基秩 `r`)影响较大,论文尚未提供在无监督下自适应选择这些参数的通用策略。当表示分布偏离流形假设或噪声较高时,估计的切方向可能不准确,导致擦除不彻底或引入额外失真。此外,在极高维表示下,局部流形估计的计算与存储开销会显著增加。
  • **计算效率与迭代开销**:MANCE 需要对每个样本进行迭代更新,并计算局部邻域和投影,推理延迟明显高于一次性闭合形式擦除方法(如 LEACE)。对于需要实时处理或大规模部署的场景,这种额外计算可能成为瓶颈。尽管论文展示了 MANCE+ 和 MANCE++ 与闭合形式的结合,但仍需在推理时执行多次迭代,难以满足低延迟要求。
  • **评估范围与泛化性**:实验覆盖了 13 个语言模型、三种 NLP 概念和 40 个 CelebA-CLIP 属性,但所有评估均在控制性分类器泄漏和手术性指标上进行,缺少对下游任务(如生成、推理)中擦除后模型行为影响的系统分析。同时,方法默认目标概念可由分类器可靠预测,当目标概念难以线性分类或标注数据有限时,MANCE 的适用性受限。与一些无需分类器信号的对抗性擦除方法相比,MANCE 对标注质量的依赖是潜在弱点。
论文Matan Avitan2026-07-04原文

相关内容