论文

Language Models Need Sleep: Learning to Self-Modify and Consolidate Memories

Language Models Need Sleep: Learning to Self-Modify and Consolidate Memories

过去几十年,机器学习算法设计取得了显著进展,从早期任务特定的浅层模型到更通用的深度大语言模型(LLMs)。尽管在需要即时预测或上下文学习(in-context learning)的任务中表现出色,现有模型缺乏持续学习能力,无法有效将其短期上下文知识转化为长期参数。受人类学习过程启发,我们引入一种“Sleep”范式,使模型能够持续学习,通过重放(replay)将短期脆弱记忆提炼为稳定的长期知识,并通过“Dreaming”过程递归地自我改进。 具体而言,睡眠包含两个阶段: 1. Memory Consolidation:一种向上的蒸馏过程,称为Knowledge Seeding,将较小自我的记忆蒸馏到更大网络中,在保留知识的同时提供更大容量。作为概念验证,我们提出一种新的Generalized Distillation过程(即同策略蒸馏与基于Reinforcement Learning (RL) 的模仿学习的组合)。 2. Dreaming:自我改进阶段,模型使用RL生成合成数据的课程,以排练新知识并在无需人工监督的情况下完善现有能力。 我们在长程任务、持续学习、知识融入和少样本泛化等实验上验证了睡眠阶段的重要性。

论文精读

TL;DR 提出“Sleep”范式,通过知识播种与梦境自我改进,让语言模型将短期上下文记忆巩固为长期参数知识,实现持续学习与自我进化。

问题

问题背景

当前 大语言模型(LLM) 在即时预测、上下文学习方面表现突出,但其持续学习能力仍十分有限:模型往往只能在 单次推理上下文 中临时利用新信息,而无法将其稳固地融入自身参数,导致后续推理无法复用已有经验。这推动了学术界对 终生学习、在线适应、知识注入 等方向的深度探索。

现有方法的局限

现有方案至少存在三类瓶颈:

  1. 灾难性遗忘:为不同任务添加 参数高效适配模块(LoRA / adapter) 虽然能部分隔离新知识,但新旧模块之间缺乏共享与融合机制,旧能力仍会随时间退化。
  2. 知识蒸馏单向性:常见的 教师–学生蒸馏 依赖预定义的教师信号,只能将已学知识进行压缩或迁移,缺乏从自身短期记忆(如上下文)向长期参数做 向上蒸馏 的闭环回路。
  3. 自改进依赖监督:基于 强化学习(RL) 的自我改进常需要人工精心设计的奖励函数或大量偏好标注,难以形成全自动的“无监督自提升”循环,且合成数据质量波动容易引入偏见。

为什么难与重要

持续学习本身是神经元网络长期未解的核心难题:如何在新信息到来时更新参数,又不破坏已有表示。LLM 的上下文窗口虽可暂存新知识,但面临 长度限制、推理成本高、无法跨会话复用 等问题。因此,必须有一种机制将 脆弱的短期上下文记忆 提炼为 稳定的长期参数化知识,同时避免对旧知识的覆盖。这不仅关系到模型在 长周期任务 上的可靠性,也是实现通用智能体自由累积经验的工程技术基石。业界对 “睡眠式巩固” 的关注度急剧上升,因为若能让模型像人脑一样自动筛选、巩固和排练记忆,将极大降低持续学习的工程与数据成本。

行业类比

这类似于 个人 AI 助手 需要在与用户的多轮交互中不断吸收新偏好,却不能被单次对话带偏核心能力——恰如人脑需通过睡眠将短期海马体记忆转化为皮层长期记忆。

核心洞察

  • - **睡眠范式将人类记忆巩固与梦境演练机制首次完整映射到 LLM 持续学习**:通过 **记忆巩固**(知识播种)和 **做梦** 两个阶段,模型先在小网络中积累短期上下文经验,再通过参数扩展与向上蒸馏将其无损迁移至大网络,最后利用 RL 生成自我演练课程。这与仅依靠外部重放缓冲区或参数高效适配的方案(如 rehearsal、EWC、LoRA 组合)形成本质区别:它不仅解决了容量瓶颈,还让知识迁移与自我进化变为模型内生能力,使长期学习不再依赖人工标注的持续供给。
  • - **知识播种提出的广义蒸馏整合了 On-Policy 蒸馏与 RL 模仿学习,开创了模型升级中知识无损迁移的新路径**:传统蒸馏通常在固定架构下进行,而本文在从较小自身模型向更大自身模型扩展时,通过 RL 确保蒸馏后的策略分布与原模型一致,避免了灾难性遗忘,同时为新任务预留了容量。实验在长上下文推理(BABILong)和知识融合(ARC)任务中显示,该方法比直接微调或独立增量学习方案保留旧知识的能力更强,为 LLM 产品在迭代更新时保持一致性提供了可工程化的方案。

方法

整体流程:从短期记忆到长期巩固的“睡眠”范式

论文提出了一种模拟人类睡眠机制的持续学习框架,核心流程分为两个阶段:记忆巩固 (Memory Consolidation)梦境自改进 (Dreaming)。模型在常规的 清醒 (Awake) 阶段通过上下文学习或即时预测获取短期、容易遗忘的知识(上下文记忆);进入睡眠后,则将这些知识蒸馏并固化为稳定的参数记忆,同时通过自我生成的合成数据进行自我提升。

记忆巩固:从“小我”到“大我”的知识播种

记忆巩固阶段采用 参数扩展 (Parameter Expansion) 策略:将当前较小的模型(smaller-self)作为教师,其学到的知识通过一种称为 Knowledge Seeding 的向上蒸馏过程迁移到一个参数容量更大的模型(larger-self)。蒸馏的核心是一种新的 广义蒸馏 (Generalized Distillation) 方法,它结合了 on-policy 蒸馏基于强化学习的模仿学习 (RL-based imitation learning)。具体而言,学生模型(大网络)通过强化学习模仿教师模型(小网络)的策略轨迹,同时在自身策略采样状态下进行蒸馏,从而避免分布漂移,确保知识迁移的保真度。

梦境阶段:无监督的自我改进闭环

在梦境阶段,模型利用 强化学习 (RL) 自动生成一个由易到难的课程式合成数据流。这些数据用于“预演”新知识并精炼已有能力,整个过程无需额外的人工监督。梦境本质是一个 Self-Modifying 过程:模型通过 RL 生成的数据不断调整自身参数,实现类似于人类睡眠中记忆重组与技能增强的效果。

与同类方法的差异

与传统的离线知识蒸馏或依赖固定数据回放的持续学习方法不同,Sleep 范式引入 on-policy 广义蒸馏RL 驱动的合成梦境,能够在扩展模型容量的同时主动生成训练课程,从而在长周期、持续学习的场景中更好地平衡稳定性与可塑性。

实验

实验设计

实验围绕Sleep范式的两个核心阶段 —— Memory Consolidation(含Knowledge Seeding)与Dreaming—— 展开,旨在验证其对持续学习的增益。任务覆盖长程推理(BABILong)、知识注入与少样本泛化(ARC)等场景。模型以流式方式接收新任务,比较 无Sleep 的普通微调、参数高效适配方法以及完整Sleep的变体。消融实验探究蒸馏策略、RL replay 机制与网络扩展方式的影响。

关键发现

Sleep 阶段显著缓解了灾难性遗忘,使模型能将上下文中的短期记忆固化为长期参数。具体而言:

  • Memory Consolidation 中,通过 广义蒸馏(on-policy 蒸馏 + RL 模仿学习)将较小模型的记忆向上迁移至更大网络,在扩充容量的同时保留旧知识;
  • Dreaming 阶段利用 RL 自主生成课程难度递进的合成数据,无监督地巩固新能力并防止遗忘,实现自我改进。 整体上,Sleep 使模型在多个步骤的长程任务上保持稳定准确率,而基线持续学习模型性能随任务累积迅速衰退。

与基线的深度对比

相比常规的增量微调LoRA等参数高效方法,Sleep 的关键区别在于主动调节记忆的双向流动:Knowledge Seeding 提供容量扩展时的知识无损迁移,Dreaming 则通过生成式 replay 维持分布覆盖,无需外部存储旧样本。这使得模型在任务序列上不仅避免遗忘,还能正向迁移已有技能。与单纯依赖 RL 或知识蒸馏的方案相比,组合策略在少样本泛化和长上下文推理上优势明显。然而,该范式仍受限于扩展网络结构的选择与 RL 训练稳定性,未来需进一步优化 on-policy 蒸馏的计算开销。

行业影响

落地场景

睡眠(Sleep)范式 使大语言模型(LLM)具备持续学习记忆巩固能力,可嵌入任何需要动态适应数据流的产品。典型场景:

  • 个性化推荐引擎:电商、内容平台中,用户兴趣和趋势快速变化,模型可在低流量时段执行睡眠阶段,将短期行为记忆蒸馏为长期参数,同时通过梦想(Dreaming) 过程生成合成数据自我演练,避免灾难性遗忘。
  • 对话式 AI 助手:企业客服或虚拟伴侣需要持续吸收新知识(产品文档、用户反馈),睡眠机制可把对话上下文中的临时知识沉淀到权重,保持回答一致性。

商业价值

  • 降本:梦想阶段利用强化学习(RL)自动生成课程式合成数据,大幅减少人工标注和全量重训开销,尤其适合长尾领域数据稀缺的场景。
  • 增收:更及时准确的个性化推荐直接提升转化率与用户粘性;持续更新的模型能更快响应市场变化,抓住商业机会。
  • 体验提升:记忆巩固防止旧知识遗忘,保证服务质量稳定;自我改进使模型越用越聪明,输出质量逐步提高,减少人工干预。

与现有产品 / 工作流的接口

该范式可作为现有 ML 管道的附加阶段,与 LoRA 微调、模型检查点、向量数据库 等已有组件协同:

  • 在模型服务期间,将实时交互记录作为临时记忆流存入缓存。
  • 定期(如夜间)触发睡眠任务:先通过知识播种(Knowledge Seeding) 将小模型的记忆蒸馏到大容量主模型,再利用梦想阶段进行策略梯度优化,生成高质量 replay 数据。
  • 更新后的权重经过评估后部署,形成闭环。

具体集成用例

  1. 全球电商搜索推荐:每天凌晨,系统对前一天的用户 session 数据执行记忆巩固,将新商品和趋势行为蒸馏到推荐模型;同时梦想阶段生成多样化查询序列,增强模型对冷启动商品的泛化能力。
  2. 金融风控模型:交易模式不断演变,风控模型通过睡眠逐步吸收最新欺诈案例(短期记录),并自我生成对抗样本演练,提升对未知攻击的鲁棒性,避免定期重建的高昂计算成本。

局限

  • 该方法引入的睡眠范式包含记忆巩固和做梦两个阶段,均需额外计算资源。特别是做梦阶段利用强化学习生成合成数据进行自我改进,不仅需要额外的训练迭代,RL 训练本身也面临稳定性和调参困难,这在大规模语言模型上的部署成本和计算开销可能非常显著,限制了其在实际系统中的快速迭代和持续在线学习的应用场景。
  • 论文实验设置相对受限,主要在长程持续学习任务和 BABILong、ARC 等基准上验证,尚未在大规模通用语言模型如数十亿参数级别上进行充分测试。概念验证阶段的实验规模较小,其结论能否泛化到更大模型和更复杂任务尚未可知,且缺乏与最新持续学习方法(如参数高效微调组合)的直接全面对比,削弱了结果的说服力。
  • 做梦阶段依赖 RL 自动生成课程数据,但合成数据的质量和分布可能影响模型自我改进的效果。如果 RL 策略不够成熟,可能生成冗余或噪声数据,导致模型能力退化或灾难性遗忘。此外,该范式在非语言任务或混合模态任务上的适用性未被探讨,方法的通用性有待进一步验证。
论文Ali Behrouz2026-06-02原文

相关内容