论文

MemFold:通过 On-Policy 优化学习用于长上下文个性化的紧凑软记忆

MemFold:通过 On-Policy 优化学习用于长上下文个性化的紧凑软记忆

长时间服务同一用户的助手,必须依据该用户所透露的信息作答:哪些偏好仍然有效、哪些已被修改、哪些约束当下适用。但保留信息并不等于据此行动,而二者通常被当作同一件事来优化。以文本形式保留信息会让 reader 的输入随历史增长;压缩为固定数量的 latent 向量虽限定了接口规模,却通常以重建文本或模仿参考答案为目标来训练,而这两者的评分都基于 reader 从未生成的序列。 MemFold 按软记忆所支撑的行为来优化固定预算的软记忆:查询条件化的文本记忆被压缩为 K 个连续向量,构成 reader 的记忆接口;reader 随后在自身的 rollout 上接受两种互补信号训练 —— 面向任务结果的 group-relative 奖励,以及 confidence-gated on-policy distillation,由冻结的文本记忆 teacher 在文本记忆下为学生采样出的 token 重新打分。teacher 从不被采样,因此监督始终位于学生当前分布上,也不额外增加自回归解码;推理阶段它被完全移除。 在三种 Qwen backbone 上,MemFold 在 PersonaMem-32K 与 PersonaMem-128K 上取得我们测得的最优准确率,且历史越长优势越大,并可零目标域训练迁移到 PrefEval 与 LongMemEval。消融显示任务增益主要来自奖励项,teacher 信号带来较小的额外增益;记忆干预实验表明 reader 依赖其软记忆的实例特定内容。

论文精读

TL;DR MemFold 将长上下文用户记忆压缩为固定预算连续向量,通过 on-policy 强化学习直接优化任务行为(奖励+置信门控蒸馏),在 PersonaMem 长历史基准上取得最高准确率,且无需目标域训练即可迁移。

问题

问题背景

长时程个性化助手需要根据用户历史信息回答,领域当前关注如何在有限上下文窗口中保留用户偏好、约束及其变更,并据此生成一致响应。

现有方法局限

  • 文本记忆:将历史直接拼接进 prompt,输入长度随交互历史线性增长,推理成本与延迟不可控;
  • 固定预算软记忆:把历史压缩为 K 个 latent vectors 可限制接口大小,但典型训练目标(重构文本、模仿参考回答)的监督信号落在 reader 从未生成的序列上,与推理时实际行为分布脱节;
  • 行为优化缺失:记忆保留与行为利用被当作同一问题优化,导致模型可能“记住”了信息却不会在合适时机调用,或生成与当前偏好不一致的回答。

为什么这个问题难/重要

难点在于:固定预算的连续向量难以被稀疏的行为奖励直接优化;而行为信号又必须通过在策略(on-policy)采样上估计,训练成本远高于普通监督微调。同时,如何保证压缩记忆既保留实例特定内容、又不牺牲泛化能力,仍是开放问题。

业界对 memory-augmented LLM 和长期个性化 agent 的关注持续升温,但多数工作评估记忆保真度而非下游任务成功率,导致部署后出现“记忆准确但行为失效”的落差。将记忆表示的学习直接对齐到任务奖励,是推进实用化的关键一步。

行业类比

类似推荐系统中,仅优化 user embedding 的重构损失可能不如直接优化点击率/转化率等行为目标;MemFold 相当于把记忆的表示学习直接对齐到助手在真实交互中的行为 reward。

核心洞察

  • MemFold 的核心洞察是将固定预算软记忆的优化目标从信息重建转向行为支持,通过 on-policy rollout 评估 reader 自身产生的输出。与常见压缩方法不同,那些方法通常训练软记忆重建原文或模仿参考答案,但评估信号落在 reader 从未生成过的序列上,造成分布偏移。MemFold 让 reader 在自身采样轨迹上接受任务奖励,使记忆优化与最终行为对齐,而非记忆精度本身,这更贴近长期个性化助手的实际需求。
  • MemFold 的奖励与蒸馏信号互补,且蒸馏严格保持 on-policy,避免教师解码带来的训练-推理不一致。group-relative rewards 来自任务结果,提供全局、稀疏的反馈;confidence-gated on-policy distillation 由冻结的文本记忆教师对学生采样 token 重评分,教师从不自回归生成,监督只落在学生当前分布上,推理时完全移除。这种设置不同于常见知识蒸馏或序列级蒸馏,既获得逐 token 指导,又不引入额外计算或分布漂移。
  • 固定预算软记忆在更长历史下优势扩大,且无需目标域训练即可迁移,说明学到的压缩表征具有泛化性。在 PersonaMem-128K 上 MemFold 的领先幅度大于 32K,表明固定 K 个连续向量避免了文本记忆随历史线性增长的输入长度问题;同时在 PrefEval 和 LongMemEval 上的零样本迁移表明,该记忆优化不是针对特定任务过拟合,而是学习到可复用的用户状态表示。

方法

输入与目标

MemFold 面向长程个性化助手:输入是查询相关的文本记忆(来自用户历史交互中抽取的偏好、修正与约束),目标是将这些文本压缩为固定数量 K 个连续向量,作为下游“读者”模型的软记忆接口,避免输入长度随历史线性增长。

关键模块与流程

  1. 软记忆压缩器
    采用 query-conditioned 编码器,将可变长文本记忆映射为固定预算的 K 个 latent vectors。这些向量是读者模型唯一能访问的历史信息载体,推理时不再显式传入原始文本。

  2. 读者模型与 on-policy 训练
    读者以软记忆向量为条件生成回答。训练时不再用传统的重构损失或复制参考答案,而是让读者在自己的 rollouts 上接受两个互补信号:

    • 组相对奖励:针对任务结果设计组内对比奖励,直接优化行为表现。
    • 置信度门控 on-policy 蒸馏(OPD):冻结一个文本记忆教师,对读者采样出的 token 按完整文本记忆重新评分,但教师从不参与采样,因此监督始终落在学生当前分布上,不引入额外自回归解码成本。
  3. 输出与推理
    训练完成后,教师被完全移除,只保留轻量压缩器 + 读者。

与同类方法的差异

对比常见文本压缩方法(重构原文本或模仿参考回答),MemFold 的独特之处在于用任务结果与 on-policy 蒸馏直接优化软记忆所支持的行为,而不是优化与读者实际 rollout 无关的序列评分。

实验

实验设计

评估基于三个 Qwen 骨干模型,在 PersonaMem-32K 与 PersonaMem-128K 上测试长期个性化问答准确率,并零样本迁移至 PrefEval 和 LongMemEval。MemFold 将查询条件化文本记忆压缩为 K 个连续向量,通过在线策略优化结合两种信号:

  • 组内相对奖励:基于任务结果的直接反馈
  • 置信度门控在线策略蒸馏:冻结的文本记忆教师对学生采样 token 重评分,但不提供自回归解码

消融实验分别移除奖励项和教师信号,并通过记忆干预验证软记忆的实例特定内容是否被真正利用。

关键发现

MemFold 在 PersonaMem-32K 和 PersonaMem-128K 上取得最高准确率,且优势随历史长度增加而扩大,说明固定预算软记忆对长上下文更具可扩展性。模型无需目标域训练即能迁移到 PrefEval 和 LongMemEval,体现了行为优化信号的泛化能力。消融表明:

  • 奖励项贡献了大部分任务增益
  • 教师信号提供较小但稳定的额外提升
  • 记忆干预显示读者依赖软记忆中的实例特定内容,而非忽略记忆或仅依赖参数先验

与基线对比的深度解读

传统方法要么保留文本记忆导致输入序列不断增长,要么压缩为潜向量但训练目标通常是重建文本或模仿参考答案,这些监督信号作用在模型从未生成的序列上,造成分布偏斜。MemFold 完全在模型自身 rollout 上优化,教师仅用于重评分,不引入额外的自回归解码,推理时完全移除教师。这种设计让记忆优化直接对齐实际行为结果,避免了重建目标与下游任务之间的割裂,对长期个性化助手场景更具工程实用性。

行业影响

落地场景

MemFold 的固定预算 soft memory 适合需要长期用户上下文的 AI 助手,例如:

  • 电商智能客服:跨会话记忆用户尺码、风格偏好、过敏史,回答“推荐类似的裙子”时无需重复历史。
  • 教育辅导平台:跟踪学习者长期进度与薄弱知识点,提供个性化练习。
  • 金融咨询:记住用户风险偏好与投资约束,跨会话提供一致建议。

商业价值

  • 降本:将增长的用户历史压缩为 K 个连续向量,避免 prompt 长度随历史线性膨胀,显著降低推理 token 成本。
  • 体验提升:通过 on-policy 优化行为而非文本重建,直接提升任务准确率,在 PersonaMem-128K 上相对基线优势扩大,长历史场景收益更高。
  • 部署简化:推理时 teacher 移除,只保留压缩器与 reader,无额外解码开销。

与现有工作流集成

作为 memory 层插件嵌入现有 LLM serving 栈(如 vLLM、TGI):请求进入模型前,用 compressor 将用户历史文本编码为 soft memory 向量,拼接为 prefix;可替换 RAG 的文本检索或长上下文 prompt 拼接。训练阶段采用 on-policy reward + 蒸馏,但推理零额外成本。

具体 use case:内容平台个性化推荐理由生成,基于用户长期阅读/点赞历史,用 soft memory 生成定制化解释,无需每次重复全文历史。

局限

  • - **固定预算软记忆** 的信息容量受限于 K 个连续向量的维度,对于需要精确事实召回或长文本细节的任务,压缩过程可能造成不可逆的信息丢失;论文未与基于检索的显式记忆方法(如 RAG 或长上下文缓存)进行直接对比,因此在知识密集型或需精确引用的场景中,该方法能否替代文本记忆尚不明确。
  • - **在线策略优化** 需要反复采样 rollout,训练计算开销显著高于纯监督微调或离线强化学习;同时,方法涉及组相对奖励、置信度门控蒸馏、软记忆压缩等多个组件,超参数调节与训练稳定性控制复杂,实际部署门槛较高,且论文未充分讨论训练效率与推理时延的权衡。
  • - **实验评估** 仅基于 Qwen 系列三个骨干模型,未验证跨模型架构(如 Llama、Mistral)的泛化能力;基准测试局限于 PersonaMem、PrefEval、LongMemEval 等特定长上下文个性化数据集,对真实世界多会话、多用户、隐私敏感场景的覆盖有限,无法充分说明方法在动态偏好更新或跨领域迁移时的鲁棒性。
论文Jingxuan Wu2026-09-29原文

相关内容