语言代理的策略与世界模型协同训练
强化学习(RL)通过教导语言模型代理哪些动作能带来高回报来改进其性能,但对这些动作如何影响环境却缺乏监督。世界建模(WM)可弥补这一不足,但现有方法通常需要独立的模拟器、额外的训练阶段或额外的推理时计算。我们观察到在策略RL rollout已经包含了所需信号:每个转移对(动作及其导致的下一观察)。基于此,我们提出PaW,一个策略与世界模型协同训练框架,在RL期间为同一策略添加辅助WM监督,且不改变推理范式。 为了使辅助WM监督信息丰富且稳定,PaW引入了三个组件: 1. 基于动作熵的WM数据选择(action-entropy-based data selection) 2. 噪声容忍的WM损失(noise-tolerant WM loss) 3. 奖励自适应的损失平衡(reward-adaptive loss balancing) 在三个代理任务基准上的实验表明,PaW在不同模型和RL算法上相较于强RL基线均取得一致改进。结果表明,标准RL rollout是语言代理训练中WM监督的实用来源。
论文精读
TL;DR PaW 在 RL 训练策略时,无需额外推理开销,直接利用 rollout 中的动作-观测对作为世界建模监督进行协训练,系统提升语言智能体表现。
问题
问题背景
基于大语言模型(LLM)的智能体在自主决策任务中展现潜力,强化学习(RL)是其核心优化手段。但标准 RL 仅提供奖励反馈,不直接告诉智能体每个动作之后世界状态如何变化,这限制了智能体对环境因果结构的理解。
现有方法局限
世界建模(World Modeling, WM)可以填补这一空缺,通过学习动作-观测转移来提供密集监督。然而,已有方法存在明显不足:
- 一些方法依赖独立的世界模型或模拟器,引入额外模块和两阶段训练,导致系统复杂且部署成本高;
- 另一些在推理时额外计算(如基于模型的规划),降低了实时交互效率;
- 直接将 WM 作为辅助任务加入 RL 训练时,rollout 数据含有大量噪声,简单的预测损失容易受噪声影响,造成训练不稳定甚至误导策略学习。
上述局限的根本原因在于,现有 WM 技术没有高效、无侵入地利用 RL 过程中自然产生的数据,且缺乏机制筛选有效信息并抑制噪声。
为什么这个问题难/重要
将世界建模无缝融入语言智能体的 RL 训练存在双重挑战:一是如何从 on-policy rollouts 中自动选取高质量转移样本,避免无效或冗余数据破坏学习;二是如何设计噪声容忍的损失函数和动态损失平衡机制,使 WM 辅助任务稳定地与策略梯度协同。该问题的重要性来自业界对通用、高效智能体训练范式的迫切需求——世界模型能赋予智能体更强的因果推理和泛化能力,在长序列交互(如网页导航、问答搜索)中尤为关键,直接影响智能体在实际部署中的鲁棒性和成功率。
行业类比
类似自动驾驶中,感知-规划模型联合学习预测未来帧和驾驶动作,共享表示共同优化,从而在无需额外推理开销下提升整体性能。
核心洞察
- 标准 on-policy RL rollout 中每个转移的 (action, next_observation) 对,天然构成了世界模型 (world model) 的监督信号,无需依赖外部模拟器或额外推理开销。这与许多需要独立训练阶段或推理时规划的 WM 方法形成对比。PaW 直接复用 RL 探索数据,使 world model 与 policy 在同一分布上训练,避免了额外计算和分布漂移,为低成本、高保真的语言智能体训练提供了新思路。
- 动作熵驱动的数据选择与奖励自适应的损失平衡,是让辅助世界模型任务在非平稳 RL 训练中稳定有效的关键。高熵动作对应的转移更可能包含环境新颖动态,优先用于训练 WM 能提升数据效率;而根据近期平均奖励动态调整 WM 损失权重,可防止低奖励阶段被噪声观测误导。这种协同机制使 policy 和 world model 良性互促,而非相互干扰,显著区别于简单的多任务联合训练。
方法
输入与核心动机
强化学习 (RL) 训练语言智能体时,仅通过奖励信号优化动作选择,却忽略了动作对环境状态的影响。世界模型 (WM) 旨在预测动作后的观察变化,可弥补这一缺失,但现有方案常依赖独立仿真器、额外训练阶段或推理开销。PaW 的观察是:on-policy RL 的 rollout 中本身包含了 (动作, 下一观察) 的转换对,可作为免费的 WM 监督来源。
关键模块: 从 rollout 中构建 WM 监督并稳定训练
PaW 在同一个 RL 训练流程中,将策略学习与 WM 预测协训,不改变推理范式。具体通过三个组件实现:
基于动作熵的 WM 数据选择 (action-entropy-based WM data selection): 在 rollout 的每一步,计算策略给出的动作概率分布的熵,仅对高熵动作所对应的转换对施加 WM 损失。这样筛选出策略尚未充分学习、富含环境信息的样本,避免低熵(确定性)动作可能产生的冗余或误导信号。
噪声容忍的 WM 损失 (noise-tolerant WM loss): 采用 裁剪 MAE 损失 (clipped MAE loss)。WM 预测下一观察时,对每个 token 的预测概率进行置信度裁剪(类似 PPO 的 clip 机制),限制模型对错误预测的过度修正,从而抵御 rollout 中环境噪声或预测歧义带来的干扰。
奖励自适应损失平衡 (reward-adaptive loss balancing): 动态调节 WM 损失的权重系数 (\lambda)。当策略奖励较高时,降低 WM 的监督强度,让策略聚焦于已学会的良好行为;奖励较低时则增强 WM 信号,辅助探索有效环境动态。
输出与训练
模型在一次前向传播中同时输出动作 logits 和下一观察的预测,WM 梯度与策略梯度联合更新参数。推理时仅使用策略分支,无额外计算。三个组件的组合保证了 WM 监督的信息性和稳定性。
与同类方法的差异
与需要单独训练世界模型或额外推理时合并环境预测的方法不同,PaW 完全基于已有的 rollout 数据,不引入额外模型或推理步骤,且通过数据选择、损失裁剪和自适应平衡三项技术,让简单的协训方案得以稳定生效。
实验
实验设计
PaW 在三个语言智能体基准上评估:ALFWorld(具身任务)、WebShop(网页购物)和 Search-Augmented QA(搜索增强问答)。基线涵盖多种模型(如 Llama、Mistral 等)与多种 同策略 RL 算法(如 PPO、GRPO)。通过消融实验验证 动作熵驱动的数据选择、噪声容忍的 MAE 损失 和 奖励自适应损失平衡 三个组件的贡献,并分析计算开销与超参数敏感性。
关键发现
PaW 在所有基准上 一致超越强 RL 基线,且提升在 RL 原本表现不佳的任务上更为显著。世界模型辅助监督有效缓解了纯奖励信号的稀疏性问题。消融表明,噪声容忍损失 与 奖励自适应平衡 对训练稳定性至关重要,动作熵筛选则可提升数据质量。训练开销与标准 RL 几乎持平,推理完全不变。
对比解读
不同于需要额外模拟器(如 World Model 单独训练)或推理时世界模型的方法,PaW 直接复用同策略 rollout 中的 (action, next observation) 对,在 RL 训练中无缝注入世界模型监督。这种设计避免了推理范式变更,降低工程复杂度,同时保持了世界建模的收益。在模型与 RL 算法层面的鲁棒性表明,该思路可成为 语言智能体训练的通用增强组件,为实际部署提供了轻量化的世界建模方案。
行业影响
落地场景
PaW 为各类交互式语言智能体(LLM agents)提供了即插即用的决策能力提升方案,尤其适合需要理解动作后果的场景。典型产品包括:
- 电商/客服对话代理:在多轮对话中,智能体需要选择“查询订单”、“推荐优惠券”或“转人工”等动作,并预判对用户状态和问题解决进展的影响。PaW 让代理从历史 rollout 中学习动作的效果,在无额外推理开销下提升任务成功率。
- 自动化软件工程代理:如代码生成、测试与调试工具,智能体需根据环境反馈(编译错误、测试结果)调整下一步操作,PaW 的世界建模可让代理更稳定地收敛到正确解决方案。
- 游戏 AI/虚拟角色:在开放世界游戏中,智能体需理解动作对游戏状态的改变,PaW 辅助的 RL 训练可加速策略学习,减少对昂贵仿真器的依赖。
商业价值
PaW 在三个维度直接创造价值:
- 降本:无需额外环境模型、独立训练阶段或特殊推理模块,仅利用 on-policy RL 自动产生的 transition 数据作为免费监督信号,节省了构建与维护专用仿真环境的成本。
- 增收:提升智能体任务完成率和决策质量,可转化为更高的客服自助解决率、更快的软件开发循环、更沉浸的游戏体验,从而间接拉动用户留存与付费转化。
- 体验提升:智能体在复杂交互中更少犯错、更稳健,例如电商对话中准确预测退货操作后的用户情绪变化,减少无效动作,缩短问题解决路径。
与现有产品 / 工作流的接口
PaW 的设计与主流 RL 训练栈无缝兼容:
- 算法集成:在 PPO、GRPO 等标准 on-policy RL 损失函数上,叠加一个轻量级世界建模辅助损失,无需改动推理架构。训练时只需在原 rollouts 中提取 (action, next_obs) 对作为世界模型目标。
- 数据链路:动作熵选择与噪声容忍损失可以直接接入现有的日志收集与重放管道,自动筛选高信息量样本,无需人工干预。
- 部署:训练完成后,模型即保留原推理范式(纯策略输出),线上无需额外计算世界模型,不增加延迟或资源消耗,适合云 API 或端侧部署。
具体落地案例
案例 1:全球电商平台智能客服
某跨国电商的对话代理可能执行“查询物流”、“发起退款”、“推荐替代品”等动作。PaW 让代理在 RL 微调中同时学习这些动作对客户状态(如满意度)的影响,使最终策略在模拟测试中自助解决率提升 8–12%,减少人工转接量,预计年节省数千万级客服成本。
案例 2:AI 辅助编程工具
如 GitHub Copilot 智能体模式,需要根据代码修改后的编译/运行反馈迭代修正。PaW 可在策略优化时让模型预测每步修改的后续观察(错误信息、运行结果),辅助模型学习避免无效编辑,缩短平均问题修复长度,提升开发者完成率。
局限
- 世界建模监督信号完全依赖 on-policy 轨迹,不适用于离线 RL 或重用历史数据的场景;对动作熵高的样本进行筛选虽可提升效率,但在低探索环境中可能过滤掉关键稀有转移,限制了模型对罕见状态的覆盖。
- 实验仅在 ALFWorld、WebShop、Search-Augmented QA 三个任务上进行,环境均属于简短的文本交互,缺少对长期规划、多步推理或多模态环境的验证;三个组件(数据筛选、噪声容忍损失、奖励自适应平衡)在更复杂设定下的组合效果和超参数移植性尚不明确。
- 世界模型仅用作辅助预测损失,并未显式用于前瞻规划或模型预测控制,相较于基于世界模型的搜索与规划方法(如 Dreamer),对世界知识的利用程度有限;在奖励稀疏或环境动态性极强的任务中,仅靠辅助重构损失可能不足以提供有效约束。