论文

局部支撑学习

局部支撑学习

我们在大规模预训练模型的背景下探究灾难性遗忘 问题。将遗忘视为每个权重矩阵输入空间中的几何问题后,我们发现存在一个自然的保持目标,而基于梯度的优化器所产生的更新在该目标下是次优的。基于这一观察,我们提出 Local Support Learning(LSL),这是一个通用框架,无需访问先前数据即可在基于梯度的训练中增强对既有能力的保持。 在新的学习阶段中,LSL 将两个角色不同的组件配对: - 一个标准的权重适配器(weight adapter),照常训练以最小化损失; - 一个门控函数(gating function),仅在该适配器自身训练分布的输入激活上启用它,从而使更新对该分布是局部的。 关键挑战在于,这个门必须能正确路由来自所有学习阶段的数据,却只能在本阶段数据上训练。我们用基于高斯混合模型(GMM) 的门来解决这一点:其似然在远离训练数据时迅速衰减,因而天然倾向于在先前阶段的数据上保持关闭。 我们表明,这种训练后(post-training)方法可以解决参数量高达 70 亿 的 LLM 中的遗忘问题,在多个训练阶段中同时保持预训练与微调能力,同时在内存与计算上高效、对超参数选择稳健,并展现出可扩展潜力。

论文精读

TL;DR 提出 Local Support Learning (LSL):用 GMM 门控让 adapter 只在当前任务分布激活,无需旧数据即可保留预训练与微调能力,在 7B LLM 上有效抑制灾难性遗忘。

问题

问题背景

现代深度学习依赖大规模预训练模型,随后通过多阶段微调适配新任务。但在连续微调中,模型会遗忘先前能力,即 灾难性遗忘。业界部署 LLM 后持续更新时挑战严峻。

现有方法局限

  • 正则化方法(EWC、SI)约束重要参数,但常过度限制新任务学习,可塑性受损;
  • 回放方法 需存储或生成旧数据,有隐私与存储成本,生成式回放可能引入分布偏差;
  • 参数隔离方法(LoRA、adapter)虽减少主干干扰,但多阶段连续微调时多个 adapter 仍相互干扰,且现有 gating 依赖旧数据训练,无法用于无数据 post-training。

为什么这个问题难/重要

难点在于:梯度优化器自身无保留旧知识的目标,更新必然改变旧输入分布上的函数行为;无旧数据则无法直接约束偏移。论文从几何视角看遗忘:每个权重矩阵输入空间中旧分布区域的激活被新更新改变。关键是在 不访问旧数据 的情况下设计门控,判断输入是否属于当前分布。LSL 采用 GMM 的快速衰减似然作门控,天然对旧分布关闭,实现局部更新。在 LLM 规模下,全量重训或 replay 成本极高,这方法有效且内存高效。业界对持续学习、模型编辑、终身学习关注升温。

行业类比:部署后的智能助手需持续学习新指令,同时保留预训练常识,LSL 相当于为每个新技能装一个按需激活的“局部开关”。

核心洞察

  • 将灾难性遗忘重新定义为权重矩阵输入空间中的几何问题,并证明在该视角下梯度优化器的更新是次优的。这不同于主流的正则化或数据重放方法,它不依赖于外部约束或历史数据,而是从权重更新的局部性入手:标准梯度更新会同时改变所有输入分布上的行为,而 LSL 显式限制更新只影响当前任务分布的支持集,从而在源头避免遗忘。
  • 提出基于高斯混合模型(GMM)的门控函数,让适配器仅在输入激活来自其自身训练分布时启用,实现无数据重放的局部更新。与基于记忆的持续学习方法需要存储旧样本、基于约束的方法需要精心设计惩罚项相比,GMM 门控利用似然函数的自然衰减特性自动对未知分布关闭,无需任务边界或额外存储,且门控与适配器可在单一阶段联合训练,显著降低工程复杂度和超参数敏感性。

方法

输入与问题设定

LSL 面向多阶段微调场景:模型已经过预训练及若干次微调,现需在新任务数据上继续训练而不遗忘旧能力。输入仅为当前阶段数据 D_t,无旧数据访问权限。

关键模块

LSL 引入两个协同组件:

  1. 标准权重适配器(如 LoRA 低秩矩阵):以常规梯度下降最小化当前任务损失,负责学习新能力。
  2. 基于 GMM 的门控函数:对每个权重矩阵的输入激活建模一个高斯混合分布,其似然值随输入偏离训练分布而迅速衰减。门控输出一个缩放系数,控制适配器输出的激活程度。

训练时只使用 D_t 拟合 GMM 并优化适配器;但门控在推断阶段需对所有历史阶段的数据路由。GMM 似然的快速衰减特性使其对旧分布数据自然输出近零门控值,从而使适配器关闭,保留原始模型输出。

推理与效果

对任意输入激活,门控先计算其属于当前适配器训练分布的似然,若高于阈值则启用适配器更新,否则直通原始层。这种局部支持机制将梯度更新限制在适配器的训练分布邻域内,避免干扰旧知识。

与同类方法差异

相比基于正则化或回放的持续学习方法,LSL 无需存储旧数据或旧模型,而是通过几何视角下的 GMM 门控实现更新局部化,在 7B 参数 LLM 上能以较低内存和计算开销保留多阶段能力。

实验

实验设计

根据摘要,论文在多阶段训练场景下评估 LSL,模型规模覆盖至 70 亿参数 LLM。LSL 与标准梯度优化器对比,在微调新任务时保留预训练及先前微调能力。具体数据集和基准未在摘要中披露。

关键发现

  • LSL 通过局部支持学习,利用 GMM 门控使权重更新仅作用于当前训练分布,从而有效缓解灾难性遗忘。
  • 该方法无需访问历史数据,在多个训练阶段后仍能保留预训练与微调能力。
  • 框架内存和计算高效,对超参数选择鲁棒,并展现出扩展潜力(至 7B 参数)。

与基线对比

摘要指出:"updates produced by gradient-based optimizers are suboptimal"。

这表明传统梯度更新在几何上对保留目标并非最优。LSL 通过门控机制限制更新作用范围,弥补这一缺陷。与常规适配器(如 LoRA)相比,LSL 引入的 gating 使更新局部化,从而避免跨分布干扰。但摘要未提供具体指标数值,因此无法量化优势。

行业影响

落地场景

LSL 适用于需要持续更新模型能力且不能丢失旧能力的场景:

  • 电商平台智能客服与推荐:模型持续学习新品类、促销策略与用户行为,同时保留对历史商品和基础对话逻辑的支持。
  • 金融机构反欺诈模型:不断适应新型欺诈手段,但必须保留对旧欺诈模式的识别能力,避免误判率上升。
  • 内容平台审核与标签系统:持续接入新违规类型或新话题,但原有审核规则不能退化。
  • 企业级知识库问答:随着内部文档迭代,模型增量学习新知识,同时保留历史知识检索能力。

商业价值

  • 降低训练与数据管理成本:无需每次融合全部历史数据或重新训练基座模型,节省 GPU 算力与数据存储开销。
  • 提升模型复用率:同一预训练模型可安全叠加多个定制阶段,减少为不同任务维护独立模型的部署成本。
  • 改善服务质量:用户不会因模型新增功能而在旧任务上性能骤降,保持稳定体验。
  • 合规优势:不要求存储或重放旧数据,降低隐私泄露与数据合规风险。

与现有工作流接口

LSL 作为后训练框架,可以轻量集成到当前主流微调栈:

  • 在 Hugging Face Transformers 或 PEFT 流程中,LSL 的 GMM 门控 与适配器模块可直接替换或叠加在 LoRA/IA3 之上。
  • 训练完成后,门控与适配器可作为轻量路由模块部署,推理时根据输入激活选择是否启用适配器,额外延迟可忽略。
  • 适用于多阶段训练流水线:预训练 → 指令微调 → 领域微调 → 任务特定微调,每个阶段均可无损叠加,无需访问先前阶段数据。

具体落地用例

  1. 电商平台大促期间模型更新:例如在“黑色星期五”期间,推荐模型需要学习短期爆发式用户行为,但日常推荐逻辑不能受到破坏。使用 LSL 可在促销数据上训练新适配器,门控自动将其限制在促销相关输入上,日常流量仍走原始路径。
  2. 银行反欺诈模型持续学习:金融机构每月新增欺诈案例,传统做法是定期全量重训或依赖回放缓冲区。LSL 只需在新欺诈数据上训练适配器与门控,旧欺诈模式识别能力保持不变,同时新欺诈模式得到覆盖。

局限

  • 基于 GMM 的门控假设每个学习阶段输入激活分布可用高斯混合模型拟合,对于高维稀疏或非高斯分布(如长尾、离散 token 嵌入)可能不够准确,导致门控误判,影响旧任务性能。论文未在高维视觉或语音特征上验证,且 GMM 参数估计可能对初始化敏感,尽管作者声称超参数鲁棒,但在更复杂数据上仍需验证。
  • 存储开销随学习阶段线性增长:每个阶段需要保存一个独立的门控 GMM 和一个权重适配器(adapter),在多阶段持续学习中,模型参数和门控参数不断累积,对于需要成百上千个任务的场景(如终身学习)不可扩展。论文仅展示有限阶段(可能两到三阶段)的实验,未讨论大规模任务数量下的内存和计算成本。
  • 实验主要在 LLM 文本任务上(如指令微调、偏好对齐)验证遗忘消除,未在更广泛持续学习基准(如视觉分类任务序列、强化学习环境)上系统比较。与一些基于重放(replay)或正则化的方法相比,LSL 不访问旧数据,但可能牺牲了新任务上的最终性能(因为门控限制了 adapter 作用范围),论文未报告新任务性能与标准微调的差距是否显著。
论文Assaf Ben-Kish2026-10-01原文

相关内容