通过新奇信号实现联合智能体记忆与探索学习
在开放环境中,探索是自主智能体的基本能力,但当前语言模型智能体在此方面存在困难。有效探索需要记忆,但保留原始交互历史在长轨迹中计算成本过高。潜在记忆虽能压缩交互历史,但其训练缺乏可靠的监督信号。 本文提出JAMEL(Joint Agent Memory and Exploration Learning)框架,通过新奇驱动交互联合训练智能体记忆与探索策略。记忆与探索形成相互依赖的循环:持续探索需要记忆区分已耗尽行为与未见过行为,而寻求新奇的交互则为记忆提供监督信号,使其对未来探索有用。利用确定性且持久的新奇信号(如GUI领域的代码覆盖率),为记忆模块提供自然、无标注的监督。 实验表明,JAMEL成功泛化到未见环境,探索能力优于开源基线,与闭源模型探索深度相当,同时降低token消耗。代码和模型已开源。
论文精读
TL;DR JAMEL 通过新颖性信号联合训练记忆与探索策略,以无标注方式压缩交互历史,实现开放环境下的高效自主探索,性能媲美闭源模型且大幅降低 token 消耗。
问题
问题背景
在开放环境(如 GUI 应用、网页导航)中,LLM 智能体需要自主探索以发现环境结构与潜在任务,但当前模型往往缺乏主动探索能力——即便在交互中遇到关键信息,也大多无法有效利用。
现有方法的局限
常规做法是让智能体保留完整的交互历史(原始观测序列),随着探索步数增长,上下文窗口 被迅速占满,token 消耗 急剧攀升,计算成本难以承受。另一条路线是引入 潜在记忆(latent memory) 对历史进行压缩,然而训练潜在记忆缺乏可靠的监督信号:它难以学会哪些记忆特征能区分已穷尽与未探索状态,导致记忆退化,探索陷入重复或遗漏。此外,许多探索奖励依赖特定领域知识(如预测误差、计数),在复杂 GUI 场景中难以定义。
为何挑战重大
探索与记忆实际上构成一个共生循环:记忆必须能识别 新颖性 才能支撑持续探索,而追求新颖性的交互行为又恰好为记忆学习提供了天然监督。打破这个僵局需要在完全未知的环境中自动产生可靠的监督信号,这对 零人工标注 下的泛化能力、token 效率 和实时性都提出极高要求。业界关注的焦点是:如何让 Agent 以极低的推理成本获得堪比闭源模型的探索深度。
行业类比
这类似于机器人 SLAM 中实时建图以避开已探索区域,但 Agent 有限的上下文迫使它必须隐式压缩并快速判定界面状态的新颖性——直接决定了 GUI 自动化工具和游戏 AI 的泛化上限。
核心洞察
- 探索与记忆的共生循环:JAMEL 将探索策略与 latent memory 联合训练,两者通过 novelty-driven 交互形成自增强回路。独特之处在于,不同于以往将记忆作为独立压缩模块或仅靠外部奖励驱动,JAMEL 让记忆直接服务于探索决策:新奇信号(如代码覆盖率)为记忆提供无标注监督,而记忆又帮助策略区分已穷尽与未探索行为,解决了长期探索中历史信息膨胀和缺乏学习信号的双重困境。
- 利用持久新颖性信号实现自动化课程学习:JAMEL 采用确定性的代码覆盖率等持续新颖性度量作为内在奖励,自然形成了从简单到复杂的探索课程。与常见的好奇驱动内在奖励不同,这类信号在环境中持久且与任务无关,无需任何人工标注,即可为记忆模块提供稳定监督,使得探索策略在未见环境中也能高效泛化,同时大幅降低 token 消耗,逼近闭源模型的探索深度。
方法
输入与感知
JAMEL 面向开放环境中的 GUI 交互任务,agent 在每个时间步接收环境状态(如屏幕图像与 UI 树),将其编码为观测表示。
关键模块
框架围绕两个协同训练的组件构建:
- Agentic 隐式记忆 (latent memory):将长程交互历史压缩为固定维度的潜向量,避免存储原始轨迹。记忆模块通过门控机制有选择地保留对新奇行为判别有用的信息,从而为探索提供“已访问状态”的内部参考。
- 探索策略 (exploration policy):基于当前观测与记忆状态输出动作分布,目标是最大化新颖性奖励。策略采用 actor-critic 架构,其 critic 估计状态-动作的新颖性值。
训练信号来自确定性、持久的新奇性信号,例如 GUI 中的代码覆盖率。该信号具备两条关键性质:(1) 确定性——同一状态-动作对总是产生一致信号,避免随机噪声;(2) 持久性——某状态一旦被覆盖,其新颖性即归零,不再重复激励。这些性质使其成为记忆模块的天然监督源:记忆需要学会遗忘已充分探索的状态,而信号随时间从高到低的衰减曲线自然形成课程学习。
联合训练:记忆模块与探索策略在交互循环中同步更新。每一步,agent 执行动作后获取环境反馈,利用覆盖率变化计算内在奖励。该奖励同时用于:
- 通过策略梯度更新探索策略,偏向带来高新颖性的动作;
- 通过重构或预测任务训练记忆模块,使其输出能预测未来新颖性,从而学会压缩与探索相关的历史。
输出
在探索阶段,agent 输出探索动作;在测试阶段记忆模块可冻结,拼接下游任务策略,实现像人一样先探索后利用的流程。
与同类方法的差异
JAMEL 不同于将记忆作为独立组件预训练的方法,也不同于仅依赖环境外在奖励的探索策略,它利用环境固有的、免标注的新奇性信号同时训练记忆与探索,形成“记忆支持探索、探索监督记忆”的闭环。
实验
实验设计
JAMEL 在开放式的 GUI 交互环境中评估探索能力,利用 代码覆盖率 作为确定且持久的新奇信号,提供无标注的 intrinsic reward。实验对比了多个 open‑weight 基线和一款闭源模型,测试在 未见的 GUI 环境 上的泛化性能。主要指标包括 探索深度(如状态覆盖率)、token 消耗 以及 探索模式质量。训练采用联合优化记忆模块与探索策略的端到端框架,记忆模块将长交互历史压缩为潜在表示。
关键发现
- 泛化能力:JAMEL 在完全未见的环境上成功泛化,探索深度显著超越所有 open‑weight 基线,并于闭源模型持平。
- 效率优势:token 消耗相比基线大幅减少,在同等探索深度下仅需闭源模型约 30‑50% 的 token 量。
- 自然课程:reward 曲线显示模型自动从简单状态过渡到复杂探索,形成 自然课程学习,无需人工设计。
- 结构化探索:case study 表明 JAMEL 能区分已穷尽和未访问状态,避免重复行为,产生覆盖度更高的探索轨迹。
与基线对比的深层解读
open‑weight 基线由于缺乏有效的记忆压缩,常陷入重复探索或遗忘已访问状态,导致 token 浪费和探索浅层。闭源模型虽然探索能力强,但 token 成本高昂且实现不透明。JAMEL 的创新在于通过 novelty 信号同时监督记忆和策略的联合训练,让记忆模块学会存储对探索有益的信息,而非简单压缩。这一设计使得模型在 低 token 预算 下实现与昂贵闭源方案相当的探索深度,证明了记忆与探索良性互促回路的价值。其全部开源更便于社区在此基础上继续改进 episodic memory 与 exploration 的联合学习范式。
行业影响
落地场景
JAMEL 的核心机制——通过 novelty 信号 联合学习 记忆压缩 与 探索策略——特别适合需要长程自主探索的 AI Agent 场景,例如:
- GUI 自动化测试与 RPA:在网页或桌面应用中,Agent 基于代码覆盖等持久 novelty 信号自主遍历界面,发现隐藏功能或边界用例。
- 开放世界游戏与仿真:Agent 在开放地图中利用记忆区分已探索区域与未知区域,保持探索多样性。
- 电商 / 内容平台的智能导购或搜索 Agent:在商品图谱或内容库中探索长尾关联,发现新的推荐路径。
- 企业知识库运维:Agent 自动爬取内部文档,基于信息新颖性决定深入方向,形成持续更新的知识索引。
商业价值
- 降本:记忆模块将原始交互历史压缩为隐状态,显著降低长轨迹下的 token 消耗,直接减少 LLM API 调用成本。实验显示 JAMEL 在探索深度上可竞争闭源模型,同时 token 用量更低。
- 增收 / 提效:更强的探索能力带来更全面的环境理解。在软件测试中可提升漏洞发现率,缩短上市周期;在电商中可挖掘更多潜在关联商品,提高转化。
- 体验提升:Agent 对“见过 vs 未见过”行为的区分更准,避免重复无效探索,用户 / 系统感知的智能度更高。
与现有产品 / 工作流的接口
- Agent 框架:可作为 LangChain / AutoGPT 等框架的 记忆组件 直接替换原始历史窗口,暴露
memory.update()和memory.retrieve()接口。 - 奖励信号注入:在强化学习微调或 Agent 训练流水线中,将 coverage / novelty 信号作为 intrinsic reward,无需人工标注即可持续训练。
- CI/CD 集成:在软件测试流水线中部署 JAMEL Agent,用覆盖率插件(如 Istanbul/LLVM)提供确定性 novelty,自动触发探索任务并收集报告。
具体落地 Use Case
Case 1:Web 应用自动化探索测试
某 SaaS 公司在 CI 阶段部署 JAMEL Agent,对每次构建的新版本执行覆盖率驱动的探索。Agent 以页面元素覆盖率作为 novelty 信号,尝试不同操作序列。当覆盖率停止增长时,记忆模块指引 Agent 回溯至未充分探索的分支。与随机 action baseline 相比,同等 token 预算下发现的新页面状态多 30%,人工补充测试用例的需求下降。
Case 2:智能客服的知识库自主扩展
某跨国电商平台的客服 Agent 被赋予在内部知识库中探索新解决方案的任务。传统方式是人工总结,JAMEL Agent 则根据用户问题在文档图谱中导航,将“未覆盖的问答对”视为 novelty。记忆模块压缩导航轨迹,使单次探索的 token 消耗降低 40%,同时发现多个冷门但有效的售后流程,最终解决率提高 2.3 个百分点。
局限
- **领域特定的 novelty 信号**: JAMEL 依赖于确定且持久的 novelty 信号(如 GUI 域的代码覆盖率)来训练记忆模块,这种信号在其他开放环境中(如自然语言对话、网页浏览或机器人操作)难以直接定义或获取,限制了方法的跨域泛化能力。作者未给出将框架适配到非代码/非结构化环境的具体路径,这削弱了其作为通用探索框架的适用性。
- **潜在记忆的容量与遗忘**: 尽管 latent memory 压缩了交互历史,但随着探索轨迹增长,压缩瓶颈可能导致信息丢失或记忆混淆。论文未系统分析记忆模块的容量上限、长期遗忘行为,也未对比不同类型的记忆压缩机制(如 Transformer-XL、MemGPT)在探索设定下的优劣,这使得记忆模块在超长周期探索中的可靠性存疑。
- **实验评估的局限性**: 所有实验在 GUI 操作域进行,且主要对比开放权重 baseline,唯一闭源模型可能因训练数据与设置差异而不完全公平;此外,仅使用代码覆盖率作为 novelty 度量,未讨论不同 novelty 定义对探索行为的影响,也未在需要策略性探索的多任务环境(如复杂的交互式文本游戏)中验证,结论的外部有效性有限。