REMORY: 为上下文压缩学习残差记忆
长程 Agent 需要在有限的上下文窗口内持续工作,因此会不断压缩自身历史;但仅靠一段文本摘要,未必能支撑后续的每一个决策。 为此,作者提出 REMORY —— 一种神经记忆网络:在摘要之外,额外补充一段长度受限的 soft memory tokens。给定历史与摘要,该网络学习生成这些 token,帮助一个冻结的 LLM 近似其在完整历史下本应产生的续写。这些 token 以摘要为条件并追加于其后,构成沿序列维度上类似残差连接的类比结构。 实验层面: - 在 SummHay 上,REMORY 在洞见覆盖率几乎不变的前提下提升了来源归因,并仅用 5.2% 的输入位置便逼近完整上下文的联合得分; - 在多个长程 Agent 基准上,Qwen3.8-27B 与 GLM-5.3-Flash 均借助残差记忆取得稳定增益; - 这两个模型在 BrowseComp 与 Terminal-Bench 2.1 上还显著减少了重复的工具输出与工具错误。
论文精读
TL;DR REMORY 在文本摘要后附加可学习的软记忆 token,构成序列维度的残差连接,让冻结 LLM 逼近全上下文效果;仅用 5.2% 输入位置即在 SummHay 上接近全上下文得分,并在多个长时 agent 基准上稳定提升性能、减少工具错误。
问题
问题背景
长程智能体(long-horizon agent)在有限上下文窗口内运行,随着工具输出与观察积累,必须压缩历史以继续任务。当前主流做法是将早期交互替换为文本摘要 ,形成 checkpoint,压缩后继续执行。
现有方法局限
- 文本摘要 只保留主线信息,可能不足以支持所有后续决策。信息相关性随任务展开动态变化,无法预先枚举。
- 摘要过程丢弃细粒度证据与状态细节,导致后续生成时源归属(source attribution)下降,或产生重复工具输出、工具错误。
- 传统压缩方法如截断(truncation)丢失远端关键信息,检索式压缩需要显式 query 且可能召回不相关片段。
- 单纯文本摘要难以保留隐式、语境化的软信息,而这些信息对后续推理和动作选择往往关键。
为什么难且重要
难点在于信息需求不可预知:无法在压缩时判断哪些历史细节将在未来被用到。需要在压缩率和保真度之间做权衡:极端压缩会丢失必要信息,过度保留则违背压缩初衷。业界关注度很高:主流编程智能体(如 Claude Code、Codex CLI)都提供 /compact 功能,但用户常报告压缩后智能体行为退化、重复操作或失败。对实际工程而言,需要一种不依赖显式检索、可学习的压缩表示,在维持低 token 开销的同时保留隐式信息,这正是残差记忆机制要解决的问题。
行业类比
类似于多轮对话助手只保留对话摘要而丢失用户偏好细节,后续回复常偏离需求;需要残差记忆补充摘要,才能维持一致性。
核心洞察
- REMORY 将软记忆 token 设计为对文本摘要的残差补充,在序列维度上形成残差连接。与仅依赖摘要或检索增强的方法不同,它不预先枚举或检索可能缺失的信息,而是以冻结 LLM 的 continuation 为学习目标,端到端地生成可微分 token,编码摘要无法显式表达的上下文依赖,从而在保持有界压缩的同时提升后续决策的 fidelity。
- REMORY 使用固定数量的软 token 实现有界上下文压缩,在长程任务中仅占约 5.2% 的输入位置,即可接近全上下文的联合得分。相比纯文本摘要,软 token 能承载细粒度、非符号化的上下文线索;相比外部记忆或检索,它不增加推理时的额外延迟或模块复杂性。在 BrowseComp 和 Terminal-Bench 2.1 上,该方法还显著减少了重复工具调用和工具错误,表明残差记忆对长程代理行为的稳定性有直接帮助。
方法
输入与问题设定
REMORY 接收长程 agent 的历史交互与对应文本摘要。文本摘要作为压缩检查点,但单一摘要可能无法支撑后续所有决策,且关键信息随任务进展动态变化,预先枚举所需信息并不现实。
关键模块:残差记忆网络
- 记忆网络:一个小型可训练的神经网络,以摘要为条件,生成有界数量的软记忆令牌(soft memory tokens)。
- 残差拼接:生成的软令牌追加在摘要之后,形成沿序列维度的残差连接,即
[summary; memory_tokens],作为压缩后的上下文。 - 冻结 LLM 作为 actor:训练时保持大语言模型参数冻结,仅更新记忆网络。目标是让冻结 LLM 在给定摘要+记忆令牌时产生的延续分布,逼近其看到完整历史时的延续分布(通过分布匹配损失,如 KL 散度)。
- 训练信号:从历史中采样决策点,计算完整历史与压缩上下文下冻结 LLM 输出分布之间的差异作为学习信号。
输出与推理
推理时,给定历史和新摘要,记忆网络生成固定数量软令牌,与摘要拼接后输入冻结 LLM 进行后续决策。相比纯文本摘要,REMORY 在 SummHay 上仅用 5.2% 输入位置接近全上下文联合得分,并在多个 agent 基准上减少重复工具输出与错误。
与纯文本摘要或固定规则压缩等同类方法不同,REMORY 不依赖预先枚举或检索关键信息,而是通过端到端可学习的残差令牌直接优化下游行为逼近,实现更灵活的上下文压缩。
实验
实验设计
在长时程 agent 场景中,REMORY 先用文本摘要压缩历史,再学习生成 soft memory tokens 附加在摘要后;使用 frozen LLM 作为 actor,通过让带压缩记忆的 LLM 逼近全历史下的 continuation 来训练 memory 网络。评估在 SummHay 上进行 source attribution 与 insight coverage 的联合评测,并在 BrowseComp 与 Terminal-Bench 2.1 上测试端到端 agent 表现。
关键发现
REMORY 在 SummHay 上仅用约 5.2% 的输入位置,就能接近 full-context 的 joint score,同时 source attribution 改善且 insight coverage 几乎不变。在 Qwen3.8-27B 和 GLM-5.3-Flash 上均取得 consistent gains,并且在 BrowseComp 和 Terminal-Bench 2.1 上重复工具输出与工具错误显著减少。
与基线对比
传统纯文本 summary 作为 checkpoint,可能丢失后续决策所需的信息;REMORY 通过可学习的 soft tokens 形成沿序列维度的残差连接,在保持上下文窗口有限的前提下,恢复部分被摘要丢弃的信息。相比 baseline(仅摘要),REMORY 在 source attribution 上提升明显,且没有牺牲 insight coverage;同时接近 full-context 的效果,但输入占用大幅降低。
行业影响
落地场景
REMORY 适用于任何长时程 agent 场景,尤其是需要反复压缩上下文的编码助手、自动化客服、多轮工具调用 agent。例如:
- 电商售后客服:处理用户多次咨询、退换货、物流跟踪的长对话,用
summary + soft tokens替代原始历史,避免信息丢失导致重复询问。 - 企业知识库问答:多轮文档检索与推理任务中,压缩早期对话与工具输出,同时保留关键决策依据。
商业价值
- 降本:仅用约 5.2% 的输入位置即可接近全上下文效果,直接减少 LLM 推理的 token 消耗,大幅降低 API 调用成本。
- 体验提升:在 BrowseComp 和 Terminal-Bench 2.1 上显著减少重复工具输出和工具错误,提升任务完成率与用户满意度。
- 增收:更高成功率意味着更多可自动化长流程任务,提高付费转化与留存。
跟现有产品/工作流的接口
REMORY 可作为 compaction 步骤的增强插件 集成进现有 agent 框架:
- 在已有的
/compact或摘要生成逻辑后,插入轻量 memory network(如 1.9B 参数),生成固定数量的 soft tokens 附加在摘要末尾。 - 训练时冻结主 LLM(如 Qwen、GLM),仅训练 memory network,支持离线训练、在线推理,且与主模型版本解耦。
- 部署时可将 memory network 与主 LLM 放在同一推理图或分离服务,兼容现有 vLLM、TGI 等推理栈。
局限
- REMORY 需要额外训练一个神经记忆网络来生成 soft memory tokens,这引入了显著的训练开销与数据需求。训练过程依赖大规模历史-摘要-续写三元组,此类数据需从特定 LLM 的行为中获取,扩展至新模型或新任务时需重新采集与训练,成本较高。推理阶段,记忆网络的前向计算与额外 token 生成会增加延迟,可能抵消部分上下文压缩带来的效率收益,尤其对实时性要求高的 Agent 场景不友好。此外,代理任务与损失函数的设计需要精细调优,进一步增加了工程复杂度。
- 评估范围较窄,仅在 Qwen3.8-27B 与 GLM-5.3-Flash 两个模型以及 SummHay、BrowseComp、Terminal-Bench 2.1 等有限基准上验证,未涵盖更小规模模型、开源/闭源模型多样性以及多模态或长视频等不同模态的任务。soft memory tokens 的收益是否随模型规模变化、是否对特定架构敏感仍不明确,泛化性证据不足。且论文未与近期基于检索或压缩的记忆方法(如 Gist tokens、AutoCompressors)进行系统对比,难以判断相对优势的边界。
- 方法本质是学习一个从摘要到固定长度连续向量的静态映射,无法在推理过程中根据任务进展动态更新记忆内容,可能难以适应长程任务中信息重要性的动态变化。与基于检索或可写外部存储的方法相比,可解释性弱,且 soft tokens 可能过拟合训练分布,在分布外任务上出现性能衰减。论文未提供消融实验分析不同 token 数量、训练数据规模等因素的影响,改进幅度的稳定性与适用条件有待更严谨验证。