论文

RoMeRL: 通过降阶效用状态平衡自进化智能体记忆中的反馈覆盖与记忆-奖励陷阱

RoMeRL: 通过降阶效用状态平衡自进化智能体记忆中的反馈覆盖与记忆-奖励陷阱

面向自进化大语言模型智能体的学习型记忆系统面临两个紧密耦合的挑战。首先,轨迹索引的效用随交互历史增长,导致有限的反馈被分散到不断扩张的状态空间中。其次,由于轨迹级奖励是联合分配给共同检索的记忆的,不相关的经验可能收到误导性的效用更新,从而陷入记忆-奖励陷阱。 为解决这些问题,我们提出 降阶记忆强化学习(RoMeRL),该方法利用按结果极性(memory dynamics)和记忆动态分解的固定维数、按任务划分的记忆状态来表示不断增长的轨迹索引效用空间。RoMeRL 通过一组固定的语义坐标来整合新经验,这些坐标的内容会随时间更新或替换,从而将反馈集中在有界的效用支持集上。理论上,我们证明这种降阶参数化提高了每个效用坐标获得的平均反馈,并在通用坐标转移模型下描述了错误坐标的稳态占用率。 实验上,在 ALFWorld 和 LifelongAgentBench 上,RoMeRL 提升了任务性能,将 Cold-Q 比率降低了 80.0%,将反馈密度提升了约 6.0 倍,将维护的记忆大小减少了 84.4%,并削减了 21.1% 的 LLM 调用。这些结果表明,降阶效用状态支持高效的自进化智能体记忆,同时限制了持续的奖励污染。代码已开源:https://github.com/YOUNG-fnxm/RoMeRL

论文精读

TL;DR RoMeRL 将膨胀的轨迹索引 memory 压缩为固定维度任务状态,通过语义坐标集中反馈,有效避免记忆-奖励陷阱,显著提升自进化 LLM agent 的反馈密度与效率。

问题

问题背景:自进化 LLM agent 依赖从交互历史中学习的记忆系统,以持续提升长序列任务表现。当前研究聚焦于如何高效利用稀疏的轨迹奖励信号来更新记忆效用,避免无关经验污染决策。

现有方法局限:传统方案使用轨迹索引的效用估计(trajectory-indexed utilities),每段交互产生一个记忆条目及其效用值。随着交互次数增加,效用空间线性膨胀,导致反馈信号高度分散,大量记忆几乎收不到有效更新。更严重的是,由于轨迹级奖励被共同分配给同时检索到的多条记忆,不相关经验会被错误地赋予高(或低)效用,形成记忆奖励陷阱(memory-reward trap)—— 噪声记忆获得虚假的正反馈,持续霸占检索槽位,阻塞真正有价值经验的进入。

为什么难/重要:这两重挑战紧密耦合:扩大效用空间维度虽然能容纳更多经验,却加剧反馈稀疏;而压缩维度又可能丢失关键上下文。如何在固定大小的记忆状态中有效浓缩反馈、同时驱逐噪声,是使自进化 agent 在开放世界持续学习的核心瓶颈。该问题关乎 LLM agent 能否在长期部署中保持稳定而不退化,受到学术界和产业界的共同关注。

行业类比:类似推荐系统的 embedding 下线与冷启动 困境 —— 新内容因缺乏反馈难以获得曝光,而陈旧噪声内容却因历史交互积累而长期占据高位,系统需要通过维度归约与效用重分配来打破循环。

核心洞察

  • **RoMeRL 将无限增长的轨迹索引效用空间压至固定维度的降阶状态,从而根本性解决反馈分散与记忆奖励陷阱问题。** 现有学习型记忆(如 MemRL)让每个新轨迹都增加一个效用坐标,导致稀疏反馈在不断扩大空间中稀释,同时 co-retrieved 记忆共享同一个 trajectory-level 奖励,错误地奖励了无关经验。RoMeRL 用有限个语义坐标(按结果极性和记忆动态区分)替代 per-trajectory 坐标,使反馈始终集中在固定支持集上。理论证明每个坐标的平均反馈量上升,且错误坐标占用率可控,这为自进化 agent 提供了稳定、高效的 credit assignment 机制。
  • **通过结果极性因子化与自适应坐标更新,RoMeRL 在无额外监督下实现了记忆的正负分离与动态淘汰。** 不同于以往仅用成功经验重放或遗忘机制,RoMeRL 显式构建正向/负向坐标(PCC+PAC 与 NCC+NAC),并将短期自适应坐标作为新经验的“缓冲区”,仅在持续有用时才固化为长期坐标。这种设计让正面和负面知识在独立通道中积累,避免奖励污染,同时自适应坐标自动淘汰噪声。实验显示 Cold-Q 比降低 80%,反馈密度提升约 6 倍,同时记忆体积缩减 84.4%,证明降阶状态既能提升反馈效率,又能防止错误记忆持久化。

方法

核心思路

RoMeRL 将记忆系统建模为降阶效用状态,以解决轨迹索引式记忆的两个固有问题:(1) 随交互增长的效用空间导致反馈稀疏;(2) 联合分配轨迹级奖励时,无关记忆被错误更新,形成记忆-奖励陷阱。

输入与状态抽象

  • 输入:每步交互产生的经验(动作、观察、结果)。
  • 状态空间降阶:将传统高维轨迹索引效用 $Q(s, a)$ 映射到固定维度的每任务记忆状态,该状态由两个独立轴分解:
    • 结果极性(成功 / 失败)
    • 记忆动态(合并 Consolidated 与自适应 Adaptive)

关键模块:四类语义坐标

RoMeRL 用 4 个固定坐标容器替代动态增长的记忆条目:

  • PCC(正向合并坐标):保存经多次验证、长期有效的成功经验。
  • PAC(正向自适应坐标):暂存最新成功经验,能快速响应分布变化,但会按替换策略更新。
  • NCC(负向合并坐标):储存稳定、普遍适用的失败经验。
  • NAC(负向自适应坐标):保留近期失败经验,动态淘汰过时信息。

每个坐标对应一个语义记忆槽,其内容通过语义相似度匹配更新或替换。新经验进来时,根据极性归入相应坐标;若坐标已满,则按效用或新旧程度进行覆盖。

效用更新与反馈集中

坐标的效用值基于收到的奖励更新(EMA 方式)。因为坐标数量固定,每个坐标平均收到的反馈密度大幅提高(实验显示提升约 6 倍),从而缓解了反馈分散问题。同时,由于记忆不再按轨迹粒度独立存储,无关记忆不会再因共享奖励而被污染,从而打破记忆-奖励陷阱。

输出与推理

决策时,代理从这 4 个坐标中检索与当前情境相似的记忆条目,整合后作为上下文传递给 LLM。由于记忆规模极小(比基线减少 84.4%),检索效率高,LLM 调用次数降低 21.1%。

与同类方法的差异

与 MemRL 等自适应记忆工作不同,RoMeRL 不是通过容量控制或淘汰策略缓解记记膨胀,而是直接从效用参数化层面将记忆压缩为固定坐标,理论上保证了反馈覆盖率与稳态误差坐标占用率的上界。

实验

实验设计

RoMeRL 在 ALFWorld (具身交互) 和 LifelongAgentBench (长程任务) 两个基准上进行评估,涵盖任务完成率、反馈利用效率、内存占用等多个维度。对比基线包括基于工作流的记忆架构与学习型记忆方法 (如 MemRL)。实验进一步通过消融研究验证了负样本整合坐标 (NCC) 与正样本自适应坐标 (PAC) 等组件的贡献,并设计了受控的 MRT 压力测试 以检验记忆-奖励陷阱的缓解效果。

关键发现

  1. 反馈集中:RoMeRL 将反馈密度提升约 6.0 倍,大幅减少稀疏奖励导致的效用更新分散问题。
  2. 陷阱抑制:Cold-Q 比率 (衡量无意义记忆被高估的程度) 降低 80.0%,有效控制记忆-奖励陷阱。
  3. 资源效率:维护的内存向量大小缩减 84.4%,LLM 调用次数下降 21.1%,同时任务成功率提升。
  4. 跨模型迁移:RoMeRL 在更换基底 LLM 后仍能保持记忆效用,无需重新训练。

与基线深度对比

传统轨迹索引式记忆 (如 MemRL) 线性增长状态空间,反馈随交互历史愈发稀疏,且共检索记忆共享奖励导致无关经历遭受虚假更新。RoMeRL 通过 固定维度的任务级记忆状态 与 语义坐标替换/更新机制,将效用更新约束在有限支持集内,从根本上避免了维度爆炸与污染扩散。相比 MemRL 的容量匹配版本,RoMeRL 在同等存储预算下仍能保持更低的 Cold-Q 比率与更高的反馈密度,证明其降阶参数化并非简单压缩,而是结构上的优势。

行业影响

落地场景

RoMeRL 适用于任何基于 LLM 智能体 的交互式自动化系统,尤其是需要长期运行、持续从经验中学习的场景。典型产品包括:

  • 客户服务与对话代理:需记忆用户偏好、历史工单,但交互周期长、累积经验庞大。
  • 自动化业务流程:如 AutoGPT / MetaGPT 等多步骤任务规划,代理需从成功/失败轨迹中学习。
  • 代码助手:记忆过去的代码生成模式、错误修复历史,避免重复错误。
  • 教育辅导:根据学生历史答题表现优化教学策略,但需避免被错误关联误导。
  • 游戏 NPC 与模拟环境:长期交互中积累的记忆需高效压缩与提炼。

商业价值

  • 降本:记忆维护大小 缩减 84.4%,LLM 调用量 减少 21.1%,直接降低 API 成本和存储开销。
  • 增收/体验提升:任务性能显著提高,Cold-Q 比率 下降 80%(错误记忆污染减少),反馈密度提升约 6 倍,意味着智能体更少犯错、更快收敛到有效策略,用户满意度上升,直接推动客服解决率、自动化流程完成率等核心商业指标。
  • 可持续扩展:固定维度的 Per-Task Memory State 使记忆系统不再随交互历史膨胀,为大规模部署长期驻留的智能体提供了可行路径。

与现有产品/工作流的接口

RoMeRL 可作为 Agent 记忆增强插件 嵌入现有 LLM Agent 框架(如 LangChain、Semantic Kernel、AutoGen 等)。其实现方式为在 agent 运行时维护一套固定坐标的记忆状态,通过语义坐标更新/替换来吸纳新经验,因此:

  • 输入侧:接收标准化的“经验摘要”(可由 agent 框架自动提取),无需改动原有工具调用链。
  • 输出侧:提供 Q 值 形式的记忆效用评分,直接用于 agent 的记忆检索决策。
  • 集成成本低:核心逻辑可封装为 Python 库 或 REST API,与现有向量数据库(如 Chroma、Weaviate)并存,作为效用评价层。

具体落地 Use Case

1. 电商平台智能客服
智能体需记忆用户过往咨询(退换货、产品偏好、投诉历史)以提供个性化服务。随着交互量增长,原始轨迹索引式记忆迅速膨胀,且用户的一次投诉可能被错误关联到其他正常咨询的记忆条目(记忆-奖励陷阱)。采用 RoMeRL 后,系统以固定维度的 PCC / PAC / NCC / NAC 坐标组织记忆,仅保留高反馈密度的有效经验,在 降低 84.4% 记忆存储 的同时,提升问题一次解决率,并减少因错误记忆引导的失败响应。

2. DevOps 智能运维 Agent
监控告警、故障排查等场景中,agent 需从历史事件中学习处理策略。错误地将一次有效修复的奖励传播给不相关的告警记忆,会导致下次类似告警采取错误操作。RoMeRL 通过 Outcome Polarity 和 Memory Dynamics 分解的状态空间,严格控制反馈分配边界,避免 reward contamination,降低运维误操作率,并减少不必要的 LLM 调用次数。

局限

  • 固定维度的记忆表示牺牲了细粒度信息:RoMeRL 将记忆状态压缩为固定数量的语义坐标(PCC/PAC/NCC/NAC),虽然提升了反馈密度,但可能无法保留长尾或细节丰富的经验。对于需要长期、多粒度记忆的任务,有限的状态容量会成为瓶颈,丢失的任务相关上下文可能影响后续决策质量。
  • 依赖明确的二元结果极性:方法要求每个任务有成功/失败标签来划分正负坐标,这在奖励稀疏、延迟或连续评分场景下适应性差。对于没有天然二元归属的开放式任务,需要额外设计奖励门控,增加了工程复杂度,可能限制方法在复杂现实世界任务上的直接迁移。
  • 实验环境相对受限,泛化性待验证:主要评估在 ALFWorld 和 LifelongAgentBench 两个仿真环境,这些环境的状态和动作空间相对结构化。未在更复杂的交互式环境(如 WebArena、AppWorld 完整版)或需要多模态记忆的场景中验证,能否在高度开放、噪声环境中保持降阶效用的有效性尚不明确。
论文Yi Yang2026-08-10原文

相关内容