Connect the Dots:通过强化学习训练 LLM 用于跨域泛化的长生命周期智能体
本文提出一个通用框架,用于训练大型语言模型(LLM)具备 Connect the Dots(CoD) 元能力——长生命周期智能体的核心:部署后,基于 LLM 的 AI 智能体需连续执行长序列任务,同时持续探索环境、从自身经验学习,并迭代更新上下文,从而在未来任务中依据更新后的上下文逐步提升表现。 CoD 框架的主要组件包括:(1) 算法设计与基础设施,实现 端到端强化学习(RL),其长 rollout 序列交织 solve-task 与 update-context 轮次;(2) 任务与环境,旨在训练中激励与引出目标元能力,并在评估中忠实测量进展。本文提供了 CoD 框架的初步实现,包括 GRPO 风格 RL 算法 与 细粒度信用分配,以及专为此元能力定制的任务与环境(而非领域特定的 LLM 能力或标准逐任务 RL)。 实证结果验证了 CoD 设置中端到端 RL 训练的有效性,并展示了所引出元能力的 分布外泛化 潜力——包括训练域内、跨域,以及从 CoD 到 Ralph-loop 设置。本研究连接了多项前期工作,为推进 LLM 与 AI 智能体开辟了新机遇。为促进后续研究与应用,我们在 https://github.com/agentscope-ai/Trinity-RFT/tree/research/cod/examples/researchcod 开放了实现代码。
论文精读
TL;DR 通过端到端强化学习训练 LLM 成为“连接点”的长生命周期 Agent,在任务序列中自主探索、积累经验并更新上下文,实现持续自我演进与跨域泛化。
问题
问题背景
当前基于 LLM 的 AI Agent 研究多聚焦于单轮或短序列任务(如 Tool Use、指代消解),而长期部署的长生命周期智能体需要具备一种元能力:在动态环境中持续探索、从自身经验学习并迭代更新上下文,使得未来任务的表现随经验积累而逐步提升。
现有方法局限
现有 LLM Agent 训练范式存在明显缺口:
- 静态数据与固定策略:多数 LLM 通过离线数据集微调,无法在部署后利用交互经验进行自我改进;即使引入记忆,也只是追加历史信息,缺乏主动探索与上下文更新的闭环学习机制。
- 标准 RL 的短视性:主流 RLHF 或任务级 RL 往往针对孤立的单步或短序列决策优化,既难以处理长达数十步的探索-利用-更新 session,又无法激励模型生成有益于长远收益的探索行为。
- 环境设计忽略元学习:现有 benchmark 侧重任务成功率,缺少对环境状态持续内化、跨任务泛化的评测,导致训练出的模型在面对未见领域或 Ralph-loop 场景时适应性差。
技术挑战与重要性
训练具备 CoD 元能力的 LLM 面临双重技术难点:
- 超长 rollout 的信用分配:模型需要在上百步的交互中建立“探索行为→上下文更新→后续任务增益”的因果链,传统优势估计(如 GAE)误差随步长指数放大。
- 跨域泛化与自演化:模型不仅要解决当前任务,还要学会如何学习环境的隐含规则,这要求 RL 目标设计能区分“领域专有技能”和“通用的上下文化适应能力”。 业界对可自主演进的 AI 助手、自动驾驶、科学发现 Agent 的强烈需求,使得该问题成为 Agent 规模化落地的核心卡点。
类比
类似自动驾驶系统在长尾场景中持续收集 corner case、在线更新感知模型,通过长期交互积累隐式知识来提升安全性与泛化性。
核心洞察
- **元能力习得**:CoD 通过端到端 RL 训练 LLM 获得“持续从环境经验中学习并更新内部上下文”的元能力,而非针对单一任务优化。与传统任务级 RL 不同,它构建长 rollout 序列交错求解与上下文更新两个阶段,迫使模型学会在动态环境中的元学习策略,而不是记住固定任务分布,从而在分布外环境与 Ralph-loop 设定中展现泛化潜力。
- **细粒度信用分配**:在长达数千 token 的 rollout 中,将奖励信号精确归因于每个探索或更新动作是训练成功的关键。CoD 设计的 GRPO 风格 RL 算法与细粒度信用分配机制,超越了传统按轨迹整体奖励的做法,能区分有效的信息收集与冗余动作,显著提升训练效率和最终元能力的稳健性,为长序列 RL 训练提供了可复用的算法思路。
方法
输入
CoD 框架 的输入包括:
- 一个预训练 LLM 策略(policy LLM),作为智能体的决策核心;
- 动态 环境(environment),按序提供任务流,并允许智能体在任务间进行探索与交互;
- 历史交互记录(观察、动作、奖励、自生成上下文),用于 conditoning 后续决策。
关键模块
1. 交错式长 rollout 生成
训练时,每个完整 rollout 由多个 solve-task 和 update-context 片段(episode)交替构成:
- solve-task 片段:智能体基于当前上下文执行具体任务,获得环境奖励;
- update-context 片段:智能体根据任务结果和探索信息,通过生成自然语言摘要或结构化信息更新内部上下文。
这种设计直接将“学习如何更新上下文”的行为纳入 rollout 序列,形成端到端可优化的轨迹。
2. GRPO 风格 RL 与细粒度信用分配
采用 GRPO (Group Relative Policy Optimization) 风格的在线强化学习算法,核心改进在于 细粒度信用分配(fine-grained credit assignment):
- 不再将整个 rollout 的奖励简单归因于序列末尾,而是借助优势函数将奖励信号分解到每个 token 级别的动作上;
- 具体实现中,通过对 rollout 内不同片段(solve-task vs update-context)的奖励进行差异化计算,使模型能区分“执行任务”与“更新上下文”两类行为的价值,从而引导 LLM 学会何时以及如何调整自己的上下文。
3. 元能力导向的任务与环境设计
为激发和衡量目标 元能力(meta-capability),任务和环境特意设计为:
- 非单一领域技能,而是要求跨任务持续适应;
- 环境状态部分可观测,依赖智能体通过探索主动获取信息;
- 奖励设计鼓励渐进式性能提升,而非孤立任务正确率。 这些设计迫使 LLM 必须依靠上下文更新来改进后续决策,而不是死记硬背域内知识。
输出
训练收敛后,LLM 策略获得 长生命周期的自适应元能力:
- 面对未见域,能自主通过探索、试错和上下文迭代优化表现;
- 在 Ralph-loop 等变体设定中也展现出跨范式泛化,验证了能力本身的迁移性。
与同类方法的差异:标准 RL 微调 LLM 往往按单任务优化,或依赖固定提示模板;CoD 则通过 RL 直接优化“如何自我更新上下文以跨越长任务序列”这一元过程,使 LLM 从任务求解器转变为能够自我进化的长期智能体。
实验
实验设计
本文设计了一套专用任务与环境来训练并评估 Connect the Dots (CoD) 元能力,而非孤立地测试单个任务或领域能力。训练采用端到端的 GRPO 风格 RL 算法,在长程 rollout 中交错 solve-task 回合(模型在更新后的上下文下解决任务)和 update-context 回合(模型探索环境、总结经验并更新记忆),并引入细粒度信用分配来应对长序列奖励稀疏问题。评估覆盖三个层面:训练域内泛化、跨域泛化,以及从 CoD 到 Ralph-loop 设置的能力迁移。
关键发现
实验证实,经过 CoD 框架训练的 LLM 能学会持续利用过往经验提升后续任务表现,形成一条随序列推进而单调上升的性能曲线。在训练域内,模型展现出明显的上下文适应增益;更关键的是,这种元能力在未见过的不同领域任务中依然保持,验证了分布外泛化的可能性。当将模型置于 Ralph-loop 式交互中(仅通过环境反馈调整行为而无显式规划时),CoD 训练同样带来了显著的性能提升,表明所学策略超越特定循环范型。
与基线对比的解读
论文并未给出与具体外部基线的数值对比,而是在不同设计维度上进行了隔离实验:基于 CoD 的 RL 训练 vs 标准逐任务 RL,以及不同信用分配方式的消融。结果表明,标准逐任务 RL 无法诱发稳定的长周期性能成长,而 CoD 的交替式 rollout 与细粒度奖励分配是实现该效果的关键。从工程视角看,这一结果提示若要将 LLM 部署为持续运作的自治代理,训练范式需要从静态数据集转向与环境交互的动态 RL 范式,且必须显式建模“探索-总结-应用”的循环,而非依赖模型隐式涌现这类行为。
行业影响
落地场景
CoD 框架训练的长期生命周期 Agent 适用于需要持续探索、学习与自适应能力的业务场景。典型用例包括:
- 电商推荐系统:Agent 作为推荐策略控制器,根据用户实时反馈与商品趋势,长期自我更新上下文,在多个周期中不断优化召回与排序,实现跨品类泛化。
- 内容平台个性化:在社交媒体或视频平台,Agent 持续观察用户兴趣漂移,动态调整内容分发策略,即使在全新内容域也能快速适配。
其他场景如自动驾驶的场景理解、金融风控的动态规则进化、企业客服的多轮问题解决等同样具备落地潜力。
商业价值
直接面向降本增效与体验提升两条线:
- 降本:通过端到端 RL 训练,Agent 在部署后无需频繁人工重训或规则维护,自动从环境交互中学习,显著降低专家调参与数据标注成本。
- 增效:随着上下文累积,Agent 在新任务上性能持续提高,加速冷启动,尤其适合长尾场景。
- 体验提升:个性化与自适应能力带来更实时的服务优化,用户留存与转化指标有望改善。
此外,跨域泛化能力使一套模型能够覆盖多条业务线,减少为每个垂直领域单独开发维护模型的重复投入。
与现有产品/工作流的接口
CoD 可作为后训练阶段的增强模块接入现有 LLM 技术栈:
- RL 基础设施:复用 GRPO 风格的 RL 算法,配合细粒度信用分配,仅需调整 rollout 序列结构(交错 solve-task 和 update-context 片段)即可迁移。
- 任务与环境:可将已有任务数据集改造为具有探索-学习-更新循环的训练环境,训练完成后模型可直接部署到生产环境,与现有 API 调用或 agent 框架(如 AgentScope)集成。
- 多领域训练:通过在多个领域环境上混合训练,获得跨域泛化能力,便于后续快速接入新业务场景,无需对新增场景从零训练。
具体地,以电商推荐为例,可将商品池、用户行为日志封装为环境,定义一系列推荐任务,训练出的 Agent 模型直接替换现有推荐策略模块,通过持续交互完成在线学习与参数自更新,显著提升长期收益。
局限
- - **概念验证阶段,任务与环境规模有限**:当前 CoD 框架的实现仍处于 proof-of-concept,训练任务和评测环境(如 Setting A/B)相对简化,尚未在真实世界复杂应用(如长期自主操作、动态交互式服务)中得到验证。这限制了结论的泛化性和可靠性。
- - **端到端 RL 训练的实际开销与稳定性挑战**:方法依赖超长的 rollout 序列(交替 solve-task 和 update-context episode),并使用定制化的 GRPO-style RL 算法做细粒度信用分配,计算成本和训练不稳定性可能比标准指令微调或标准 RLHF 更高,且对超参数敏感,大规模部署时工程门槛较高。
- - **跨领域泛化能力的边界不明**:论文展示了训练领域内和跨领域的 OOD 泛化潜力,但实验仅覆盖有限的领域对,尚不清楚在面对语义鸿沟巨大的全新领域或上下文结构剧烈变化时,模型能否保持鲁棒性;此外,从 CoD 到 Ralph-loop 设置的迁移仍需要额外适配验证。