论文

利用 Reinforcement Fine-Tuning 克服视觉持续学习中的灾难性遗忘

利用 Reinforcement Fine-Tuning 克服视觉持续学习中的灾难性遗忘

近期研究表明,Reinforcement Fine-Tuning (RFT) 相比 Supervised Fine-Tuning (SFT) 对灾难性遗忘具有更强的韧性。然而,RFT(如 GRPO)在具有挑战性的视觉持续学习场景(如 class-incremental learning (CIL) 和 domain-incremental learning (DIL))中能否有效克服遗忘仍是开放问题。 通过预研,我们确认 RFT 尽管始终优于 SFT,但仍存在不可忽视的遗忘现象。实验追踪发现瓶颈在于 Trajectory-level Drift Agnosticism:在获得相同任务奖励的候选轨迹中,与前一任务策略的 KL 散度差异显著,且与跨任务灾难性遗忘高度相关。受此启发,我们提出 Retention-aware Policy Optimization (RaPO),一种简单有效的 RFT 方法,通过轨迹级奖励塑形显式缓解遗忘。RaPO 包含两个核心组件: 1. Retention Reward:将轨迹级分布漂移转化为连续奖励信号,优先强化组内保留知识的轨迹。 2. Cross-Task Advantage Normalization (CTAN):跨任务边界维护奖励统计的指数移动平均,以稳定持续学习中的优化进程。 利用 MLLMs 的自由形式文本泛化能力,我们在五种视觉持续学习设置中全面评估 RaPO。大量实验表明,RaPO 取得领先性能,显著降低灾难性遗忘的同时保持强塑性。据我们所知,这是首次系统探索 RFT 在视觉持续学习中的应用,其洞察有望启发未来研究。

论文精读

TL;DR 首次在视觉持续学习中系统探索强化微调,揭示灾难性遗忘源于**轨迹级漂移不敏感**,并提出**保留感知策略优化 (RaPO)**,通过轨迹奖励塑形与跨任务优势归一化,在类增量、域增量等多场景大幅降低遗忘,同时保持强可塑性。

问题

问题背景

持续学习(Continual Learning)的核心挑战在于模型依次学习新任务时避免灾难性遗忘。近期,强化微调(RFT,如 GRPO)被证实相比传统的监督微调(SFT)对遗忘具有内在鲁棒性,但它在视觉类增量学习(CIL)和域增量学习(DIL)场景下是否真正有效仍是开放问题。

现有方法局限

RFT 在此前工作中表现优于 SFT,但本文通过初步实验揭示其仍存在不可忽略的遗忘:根本瓶颈在于 轨迹级漂移不可知论(Trajectory-level Drift Agnosticism)——即对于达到相同任务奖励的多个 rollout,其与旧任务策略的 KL 散度差异巨大,而标准 RFT 优化过程完全忽略这一分布漂移。这种盲目性导致模型在追求高奖励时,可能选择大幅偏离先前解空间的轨迹,积累跨任务遗忘。传统持续学习方法多依赖经验回放或参数正则化,但未针对 RFT 特有的组内相对优势估计设计保留机制,使得直接迁移 KL 正则化等做法难以稳定增量训练。

技术挑战与重要性

持续学习的稳定性-可塑性权衡在 RFT 框架下更为尖锐:组内奖励归一化与策略采样随机性会放大短视的风险,模型极易牺牲长期知识保留换取当前任务微小的奖励增益。视觉任务(分类、检测、视频理解)的高维表征空间进一步加剧了分布漂移的隐性累加。随着多模态大模型(MLLM)在开放世界视觉应用中成为主流,如何安全、高效地实现持续对齐与技能叠加,而非每次重新全量微调,直接关系到部署成本与系统可靠性。

行业类比

这与对话智能体的 RLHF 对齐类似:模型在持续学习新指令或新偏好时,若不对策略漂移加以约束,往往会逐渐丧失早期学到的通用能力或安全护栏,造成生产环境中的退化。

核心洞察

  • - **轨迹级漂移不可知论**(Trajectory-level Drift Agnosticism)是RFT遗忘的根源:在获得相同任务奖励的候选展开中,与前一任务策略的KL散度差异巨大,且该差异与遗忘程度强相关。此发现指出了仅依靠奖励或全局KL正则化的局限性,需要更细粒度的轨迹级知识保留控制。
  • - **通过轨迹级奖励塑造**(Retention Reward)将知识保留直接嵌入优化目标,配合**跨任务优势归一化**(CTAN)稳定学习动态,实现了无需重放或额外结构即可抑制遗忘的强化微调方法。这为持续学习中的策略优化提供了新范式,即利用组内竞争同时最大化任务奖励和旧知识保留,克服了监督微调中灾难性遗忘难以处理的难题。

方法

Retention-aware Policy Optimization(RaPO)方法流程

输入阶段:给定一个新任务的视觉样本(如类别增量学习中的新类图片)及对应的自然语言提示,利用多模态大模型(MLLM)作为策略网络,为每个样本生成一组候选输出序列(rollouts)。

核心模块一:Retention Reward(保留奖励) 对于每条 rollout,同时计算两种奖励:

  • 任务奖励:根据任务目标(如分类正确性)设计的标量反馈;
  • 保留奖励:通过将该 rollout 下的策略分布与前一任务策略(anchor policy)的分布进行 KL 散度估计,定量衡量轨迹级别的分布漂移,并将这种漂移映射为一个连续的奖励信号。漂移越小,奖励越高,从而在组内偏好选择与旧任务更一致的 rollout。

保留奖励的引入直接解决了 Trajectory-level Drift Agnosticism 瓶颈——传统 RFT 仅依据任务奖励选择 rollout,忽视了不同高奖励轨迹在知识保留程度上的巨大差异。

核心模块二:Cross-Task Advantage Normalization(CTAN,跨任务优势归一化) 持续学习中,任务奖励分布的绝对尺度会随任务切换剧烈变化,导致优势估计不稳定。CTAN 维护一个跨任务边界的奖励均值和方差的指数移动平均,对每个 rollout 的原始优势值进行归一化,使得优势计算在不同任务之间保持一致的相对尺度,从而平滑优化进程,避免对新任务的过拟合与对旧任务遗忘的剧烈波动。

策略更新与输出:结合保留奖励与任务奖励得到轨迹级的总奖励,利用 CTAN 归一化后的优势进行策略梯度更新(遵循 GRPO 的整体框架)。最终输出一个可同时适应新任务且最大限度保留旧能力的策略,有效缓解灾难性遗忘。

差异点:与标准 GRPO 仅依赖任务奖励不同,RaPO 首次在轨迹级别显式建模并奖励知识保留,并通过跨任务统计量归一化稳定持续学习中的优化过程,使其在视觉类增量与域增量场景下遗忘率显著降低。

实验

实验设计

实验覆盖五种视觉连续学习设定:类增量图像分类类增量目标检测类增量视频分类域增量图像分类域增量目标检测。利用 MLLM 的自由文本生成能力定义任务奖励,以 GRPO 作为基础 RFT 算法。对比基线包括 SFT、标准 RFT (GRPO) 以及本文提出的 RaPO,主要衡量平均准确率与遗忘率。

关键发现

初步研究表明,RFT 虽优于 SFT,但仍受限于 轨迹级漂移不可知性(Trajectory-level Drift Agnosticism):在同一任务奖励水平下,不同候选 rollout 与先前任务策略的 KL 散度 差异巨大,并与灾难性遗忘高度相关。 RaPO 的两项核心设计—Retention RewardCross-Task Advantage Normalization (CTAN)—直接针对该瓶颈:

  • Retention Reward 将轨迹级的分布漂移量化为连续奖励信号,鼓励组内保留旧知识的 rollout;
  • CTAN 跨任务维护奖励统计的指数移动平均,稳定优势估计,避免优化震荡。 实验显示,RaPO 在所有设定下均大幅降低遗忘,同时保持甚至提升新任务的学习能力(塑性)。

与基线的对比解读

相比标准 RFT,RaPO 无需额外存储旧样本或旧模型,仅通过奖励塑形优势归一化就显著缓解遗忘,这表明显式建模策略漂移对连续学习至关重要。 与 SFT 相比,RFT 本身已具备更强抗遗忘能力;RaPO 在此基础上进一步缩小了与多任务联合训练上限的差距。该工作首次对 RFT 在视觉连续学习 中的行为进行了系统性探索,为后续研究提供了新方向。

行业影响

落地场景

视觉持续学习(Visual Continual Learning)在工业界面临的核心挑战是:模型部署后需要持续吸收新类别或新领域数据,同时不遗忘旧知识。本文提出的 RaPO 方法可直接嵌入以下产品线:

  • 电商商品识别:商品目录频繁新增 SKU,使用 RaPO 可在不重训历史模型的前提下,使视觉系统持续学习新商品类别,避免重新上线时性能断崖。
  • 内容审核与推荐:短视频平台需要扩展违规检测类别或适应新拍摄风格(领域增量),RaPO 能维持旧审核规则精度,同时快速适配新内容形式。
  • 自动驾驶感知:道路目标类别逐步增加(如新型交通标志、异形车辆),域增量学习(不同城市、天气)要求模型在线更新而不丢失基础感知能力。
  • 医疗影像分析:罕见疾病分类任务中,新病种不断出现,模型需在保持常见病识别准确率的同时学习新病灶特征。

商业价值

  • 降低训练成本:传统监督微调(SFT)在面对新任务时往往需要联合所有历史数据重新训练,RaPO 通过轨迹级奖励塑形(retention reward)与跨任务优势归一化(CTAN)显著减轻灾难性遗忘,节省重复标注与算力开销,模型更新周期可从数周缩短至天级。
  • 提升服务体验:已上线智能服务(如视觉搜索、AR 试妆)在添加新功能时不再出现“旧功能退化”的回归问题,用户满意度与留存率得到保障。
  • 加速应用迭代:产品团队可快速验证新类别或新场景,无需担心破坏现有模型可靠性,决策周期更短,试错成本更低。

与现有产品/工作流的接口

RaPO 是一种强化微调(RFT)策略,基于 GRPO 优化框架,与当前主流大模型微调管线天然兼容:

  • 模型架构无关:适用于各类多模态大模型(MLLM),只需定义任务奖励函数,即可通过修改损失函数集成进现有训练脚本,无需改动模型结构。
  • 与 SFT 互补:可在基础 SFT 阶段后,将 RaPO 作为“防遗忘”阶段插入持续学习循环中,形成 SFT + RaPO 流水线。
  • 轻量级监控:CTAN 仅需维护跨任务奖励统计量的指数移动平均,不引入额外大型存储或回放缓冲区,适合边缘设备或资源受限的端侧更新场景。

具体落地案例

  1. 跨境电商平台多语言商品描述生成:模型采用视觉-语言大模型,为商品图片自动生成多语言内容。当平台扩展至新站点(新语言领域)时,使用 RaPO 进行域增量学习,模型在学会新语言描述的同时,保持原有语言的生成质量,避免翻译腔或内容丢失。
  2. 工业缺陷检测系统:在电子制造中,缺陷类型(划痕、脏污、元件缺失)持续增加,且不同产线光照、背景变化大。RaPO 使模型能在线学习新缺陷类别与产线环境,已有的缺陷检出率不下降,大幅减少人工复判与模型重训频次。

局限

  • - **依赖大型多模态模型(MLLMs)**:RaPO 建立在 MLLM 生成式策略之上,推理与训练的计算开销远高于典型持续学习方法(如重播或正则化),且性能与模型规模强相关。这限制了其在低算力设备或实时场景中的部署,论文未给出与轻量级模型组合的可行方案。
  • - **锚点策略的长期退化风险**:Retention Reward 需要前一任务策略作为分布约束的参考,随着任务序列加长,锚点策略逐渐偏离当前分布,约束效果可能减弱。虽然论文采用了 EMA 更新的锚点,但在超长序列下策略漂移的累积影响尚未量化分析。
  • - **评估设置相对保守**:实验集中于最多 100 类的增量分类和 4 步增量检测,对更大规模(如 ImageNet-1K 全量增量)或更多步长序列的验证缺失。MLLM 的强零样本能力可能掩盖遗忘的本质困难,导致优势被高估。
论文Meng Lou2026-05-10原文

相关内容