论文

环境即支架:丰富反馈以引导长时程任务中的自演化智能体

环境即支架:丰富反馈以引导长时程任务中的自演化智能体

大语言模型 在静态推理中表现优异,但通过 强化学习(RL) 将其训练为长时程任务的自主智能体时,常受奖励稀疏问题严重制约。传统的智能体侧预热(如 SFT 监督微调)虽可缓解该问题,却受限于数据稀缺与探索受限。 为此,我们提出从智能体侧转向环境侧适配的范式转变,构建 反馈增强环境(Feedback-Enriched Environments, FEEs)。通过一项先导研究,我们确立了反馈设计策略:在单回合内探索与跨回合演化的后期阶段,将环境改造的重点从动作指导转为观测增强。 我们在 SciWorld 与 BFCL 基准上,结合多种规模的 Qwen3 模型以及 GRPO、GSPO、DAPO 等 RL 算法开展大规模实验,结果显示 FEEs 相比标准设置能持续带来性能提升。 进一步分析表明,使用 FEEs 训练可以: 1. 降低熵波动,从而稳定训练动态; 2. 促进困难任务中的主动状态空间探索; 3. 确保环境指导被内化到策略权重中,而非仅作为推理时的先验; 4. 揭示组内反馈一致性是稳定优化的关键边界。

论文精读

TL;DR 提出 Feedback-Enriched Environments (FEEs),将长程任务 RL 从 agent 侧预热转向环境侧适应,在探索后期由动作引导过渡到观察丰富化,缓解奖励稀疏,在 SciWorld 和 BFCL 上多种 RL 算法与模型规模下稳定提升性能,并揭示训练稳定性机制。

问题

问题背景

当前 LLM 在静态推理任务中表现优异,研究重心正向自主智能体 转移。这类智能体需在长程任务 中通过 RL 学习多步决策,如终端操作、网页导航等。

现有方法局限

传统做法是 agent 侧预热,先用监督微调(SFT)赋予策略基本行为,再进入 RL。但该方法存在两个瓶颈:

  • 数据稀缺:高质量轨迹标注成本高,且难以覆盖环境多样性。
  • 探索受限:SFT 固化了特定行为模式,降低 RL 阶段探索空间,策略难以发现更优路径。

此外,纯 RL 从零开始训练常因奖励稀疏,导致有效梯度极少,训练不稳定。

为什么这个问题难/重要

长程任务中,成功信号往往仅在任务完成时给出,中间步骤缺乏反馈,导致梯度估计方差大、优化困难。环境本身是丰富的反馈源,但现有 RL 框架默认使用标准环境,未系统设计环境侧反馈。核心挑战在于:如何在不改变任务本质的前提下,向环境注入合理引导,同时避免策略过度依赖人工先验——这直接影响训练稳定性和泛化能力。业界对 RL 训练智能体的关注持续上升,上述难题是通用瓶颈。

行业类比

类似机器人操作训练中,仿真环境通过课程学习 或奖励塑形 逐步引导策略,而非仅依赖最终成功奖励;本文提出的 FEEs 相当于为智能体构建“渐进式环境脚手架”。

核心洞察

  • 环境端富化反馈(Feedback-Enriched Environments)将解决 reward sparsity 的焦点从 agent 侧转向环境侧。与常规 SFT 预热或奖励塑形不同,FEE 直接在环境 observation 中注入渐进式指导,使策略在 RL 训练中自然习得探索能力,而不是依赖静态的监督信号。这种范式迁移避免了数据稀缺与探索受限的双重瓶颈,为长程任务提供了可扩展的自举接口。
  • 反馈设计策略强调从 action guidance 到 observation enrichment 的动态过渡,且同步发生在 intra-episode 和 inter-episode 两个时间尺度。相比固定模式的辅助奖励或提示,该策略根据训练阶段自适应调整信息粒度,后期减少行动级提示、增强状态级上下文。实验表明这能显著降低熵波动,促进困难任务中的主动性状态空间探索,揭示了环境脚手架与策略演化协同的关键机制。

方法

方法概览

FEEs 针对长程任务 RL 中奖励稀疏问题,将改造重点从 智能体侧 转移到 环境侧。输入为任务环境(SciWorld / BFCL)与初始 LLM 策略。

关键模块

  1. 反馈设计策略:通过 pilot study 确定,在单轮探索(intra-episode)和跨轮演化(inter-episode)的 后期阶段,将环境反馈从 动作引导(action guidance)切换为 观察丰富化(observation enrichment)。动作引导在早期降低探索难度;观察丰富化在后期提供更高维度的状态信息,使奖励信号更密集。
  2. 环境改造:按上述策略构建 Feedback-Enriched Environments (FEEs),在原环境的状态空间中注入额外观察信息,而非直接修改奖励函数。
  3. RL 训练:在 FEEs 上使用 GRPO、GSPO、DAPO 等算法训练 Qwen3 系列策略模型,训练过程中监控熵波动和状态空间覆盖。

输出

训练后的策略在标准环境上评估,获得稳定性能提升;同时策略权重内化了环境引导,而非仅作为推理时先验。

与同类方法的差异:传统方法依赖智能体侧 SFT 预热或奖励塑形,FEEs 通过环境侧动态反馈切换,实现引导的逐步退火,最终内化到策略权重中。

实验

实验设计

论文在 SciWorld 和 BFCL 两个长时程 agent 基准上,使用不同规模的 Qwen3 模型以及 GRPO / GSPO / DAPO 三种 RL 算法,验证 Feedback-Enriched Environments (FEEs) 的效果。先通过 pilot study 确定反馈设计策略:在 episode 内探索和跨 episode 演化的后期阶段,从 action guidance 过渡到 observation enrichment。FEEs 在环境侧重构任务,使其提供更丰富的观测信号,而非直接告诉 agent 下一步动作。

关键发现

FEEs 在所有测试配置下均带来一致的性能提升,表明方法对模型规模和 RL 算法不敏感。训练动力学分析显示:FEEs 降低 entropy volatility,使优化过程更稳定;在困难任务上,FEEs 促进 主动 state-space exploration,agent 不再只依赖随机扰动来发现可行路径;进一步实验证明环境 guidance 被 internalize 到策略权重 中,而不仅仅是推理时的先验偏置;此外,intra-group feedback consistency 被识别为稳定优化的边界条件——同一 rollout 组内反馈不一致会破坏训练。

与基线对比

相比常用的 agent-side SFT warm-up,FEEs 从 环境侧 入手,绕开了 SFT 数据稀缺和探索受限的问题。SFT warm-up 往往只能提供有限的动作分布先验,而 FEEs 通过调整观测内容持续引导 agent,且这种引导能随着训练进程动态切换。实验覆盖三种主流 RL 算法(GRPO/GSPO/DAPO),说明 FEEs 是一种算法无关的训练增强手段,可直接嵌入现有 RL 流程,无需修改 policy 或 reward 结构。

行业影响

落地场景

FEEs 适用于长时程、奖励稀疏的自主 Agent 任务,典型产品场景包括:

  • 自动化 Web 操作:网页导航、表单填写、多页面数据抓取,例如电商比价 Agent 在多个商品页面间跳转并提取结构化信息。
  • 软件测试与 RPA:终端操作、GUI 自动化,让 Agent 在模拟环境中执行长步骤操作序列。
  • 企业服务:客服工单自动化处理(退款、物流查询等多步骤流程)。
  • 游戏 AI:需要长线策略的游戏 Agent,如开放世界探索、资源管理。

商业价值

  • 降本:减少 SFT 数据标注和人工环境奖励设计成本;RL 训练稳定性提升,降低试错算力开销。
  • 增收/体验:Agent 任务成功率提高,可替代更多人工流程;用户等待时间缩短,体验改善。
  • 加速迭代:无需频繁调整 Agent 侧策略,只需修改环境反馈,加快模型更新周期。

与现有产品/工作流集成

FEEs 可作为一个轻量环境包装层(wrapper)接入现有强化学习训练栈:

  1. 在 Gymnasium、OpenAI Gym 或自定义环境中,修改 step() 返回的 observation,加入领域反馈。
  2. 无需改动 RL 算法(GRPO、GSPO、DAPO 等)或模型架构,直接沿用现有训练循环(如 verl、TRL)。
  3. 采用课程式部署:训练初期保留 action guidance,后期逐渐过渡到 observation enrichment,与现有 SFT warm-up 管道兼容。

具体 use case:电商场景,训练一个商品比价 Agent。在模拟购物环境中,环境反馈从初期给出“点击搜索框”这类动作提示,逐步变为在观察中提供“当前页面有 3 个候选商品,价格区间已缩小”这类观察级信息,促使 Agent 自主规划点击与筛选路径。在企业服务中,训练工单处理 Agent,环境反馈从“选择退款按钮”过渡到“订单状态异常,需核对物流信息”,提升 Agent 对异常分支的泛化能力。

局限

  • FEEs 的反馈富集策略需要针对特定任务环境进行手工设计,例如在 SciWorld 和 BFCL 中分别定义 action guidance 与 observation enrichment 的具体规则。论文未提供自动化生成或学习反馈的机制,这意味着扩展到新的长程任务时需要领域专家深度介入,增加了部署成本。与 agent-side 的 SFT 数据自动收集相比,环境侧改造的人工依赖更为明显,可能限制其在大规模通用环境中的快速推广。
  • 实验仅在 SciWorld 和 BFCL 两个文本交互基准上验证,且均属于相对受限的模拟环境。虽然使用了多种 Qwen3 模型规模和 RL 算法(GRPO/GSPO/DAPO),但未涉及更复杂的多模态环境、具身智能或真实世界 web 导航等场景。此外,模型仅测试了 Qwen3 系列,缺乏对其他主流开源/闭源 LLM 的对比,因此 FEEs 在不同架构和更大规模模型上的泛化性尚不明确。
  • 论文指出 intra-group feedback consistency 是稳定优化的关键边界,但未提出自适应调节该一致性的方法。实际应用中,组内样本的反馈质量可能因任务难度或随机性而波动,若一致性不足可能导致训练不稳定。目前 FEEs 的反馈设计需要预先调参以保证一致性,缺乏动态校准机制,这会影响其在开放环境下的鲁棒性。
论文Hongbang Yuan2026-09-08原文

相关内容