Agent-G^2: 智能体强化学习的高斯引导
提示式强化学习通过在每个 rollout 前保留专家轨迹前缀,来解决长时程智能体任务中的奖励稀疏问题,从而让策略从更接近成功的状态开始探索。其有效性取决于引导深度——即保留轨迹的长度。现有方法将深度视为确定性标量:调度方法在样本间共享一个值,忽略了任务间的差异;逐样本探测则分别估计每个样本,代价是额外的 rollout。 我们提出 Agent-G^2,一种高斯引导框架。它将每个任务的深度从高斯分布中采样,该分布的中心和散布基于策略优化已收集的 rollout 在线估计,无需探测 rollout 或学习深度预测器。中心结合了全局基线与每簇难度,散布则跟踪簇内方差。 在 ALFWorld 和 WebShop 上,基于 Qwen2.5-1.5B / 7B-Instruct 的评估表明,Agent-G^2 在 ALFWorld 上的性能比最强的提示式、无提示式和 Aux-RL 基线分别高出 2.3 / 3.9 / 7.4 分,而 rollout 成本不到逐样本探测的三分之一。
论文精读
TL;DR Agent-G² 将 hint 引导深度建模为在线估计的高斯分布,从已有 rollout 采样,无需额外探测,在长程智能体任务中以更低成本显著提升 RL 性能。
问题
问题背景
Hint-based reinforcement learning 通过保留专家轨迹前缀作为引导,缓解长程智能体任务中的奖励稀疏问题。当前该方向的核心关注点在于如何平衡引导强度与策略探索自由度。
现有方法局限
现有方法将引导深度视为确定性标量。Shared-depth scheduling 为所有任务分配同一个深度值,完全忽略任务间的难度差异,导致简单任务被过度引导、困难任务引导不足。Per-sample probing 为每个任务单独估计深度,虽能适配异质性,但需要额外 rollouts 进行探测,显著增加采样成本,在 rollout 成本高昂的智能体环境中不可接受。此外,两种方法均假设存在单一最优深度,忽略了实际中“有用引导”占据一个深度区间而非单点的观察。
为什么这个问题难/重要
技术挑战在于:如何在不增加额外 rollout 的前提下,为每个任务在线估计合适的引导深度分布。业界关注度来源于长程智能体任务的奖励稀疏性是普遍痛点,而专家轨迹前缀引导已被证明有效,但深度调参成本高、泛化差。若能利用策略优化中已收集的 rollouts 同时估计深度分布,即可将引导调度与训练过程解耦,降低工程实施门槛。该问题本质上是在资源受限条件下进行任务级自适应探索调度,对提升多任务智能体训练效率有直接价值。
行业类比
这类似于 LLM agent 的 adaptive few-shot selection:与其为所有 query 固定示例数量或为每个 query 单独搜索最优示例集,不如根据任务难度动态采样示例规模,在推理成本与效果之间取得平衡。
核心洞察
- 将 hint depth 从确定性标量重构为高斯分布,捕捉“有用指导占据一个深度带且信息量近似高斯”的规律。与共享深度调度忽略任务异质性、逐样本探测以额外 rollout 为代价不同,这种概率化视角同时刻画深度选择的不确定性与任务间差异,无需精确预测单一最优点。
- 高斯参数完全从策略优化已收集的 rollouts 中在线估计,无需额外 probe rollouts 或深度预测器。这打破了调度与训练分离的惯例,使指导深度自适应与策略学习共享同一批数据,在保持性能的同时将 rollout 成本降至 per-sample probing 的三分之一以下,实现低成本、高适应性的联合优化。
- 采用“全局基线 + 每簇难度”作为高斯中心,簇内方差作为扩散的分层结构,在全局一致性与局部个性化之间取得平衡。相比单一共享调度过于粗粒度、完全逐样本探测过于昂贵,这种聚类分层方式既考虑了任务簇间的难度差异,又保留了簇内的随机探索空间,更适合长程多任务智能体场景。
方法
输入与问题建模
Agent-G^2 接收多任务 agentic 环境(如 ALFWorld / WebShop),每个任务带有一条专家轨迹。Hint-based RL 需要为每条轨迹选择保留前缀长度(guidance depth)。该方法将该深度视为随机变量,先验为高斯分布。
关键模块:在线高斯调度器
- 全局基线:跨所有任务维护一个基础深度估计,反映整体任务难度。
- 每簇难度中心:对任务依据嵌入或初始状态进行在线聚类,每个簇学习一个难度偏移,加到全局基线上构成该簇高斯中心。
- 簇内方差作为 spread:利用同一簇内任务的成功/有效深度统计,估计深度分布的方差,从而捕获任务异质性。
- 无额外开销估计:上述统计量直接从策略优化已有的 rollout 中提取(例如成功 episode 中使用的深度、回报信号等),不引入探针 rollout 或额外网络预测。
输出与训练流程
- 对每个新任务,从其所属簇的高斯分布中采样
guidance depth。 - 保留专家轨迹对应前缀,作为起始状态或提示。
- 执行 rollout 收集数据,用于策略的强化学习更新,同时更新上述高斯参数(中心与 spread)。
- 随训练进行,调度器逐渐收敛到对每簇任务的有效深度分布。
与同类方法的差异
Agent-G^2 用在线估计的高斯分布 替代确定性标量调度(忽略异构性)和逐样本探测(额外 rollout 成本),在零额外采样开销下刻画每任务最优深度带。
实验
实验设计
Agent-G^2 在 ALFWorld 和 WebShop 两个长程 agentic 基准上评估,基座模型涵盖 Qwen2.5-1.5B 与 Qwen2.5-7B-Instruct。对比三类最强基线:hint-based、hint-free、Aux-RL。评估指标为任务成功率及 rollout 成本,重点关注无需额外 probe rollout 的在线高斯调度。
关键发现
- 在 ALFWorld 上,Agent-G^2 相对最强 hint-based 基线提升 +2.3 点,相对 hint-free 提升 +3.9 点,相对 Aux-RL 提升 +7.4 点。
- 提升的同时,rollout 成本不到 per-sample probing 的 1/3。
- 所提出的高斯调度能从策略优化已有 rollout 中在线估计中心与展宽,无需独立深度预测器或探测 rollout,实现按任务难度自适应采样深度。
与基线对比解读
共享深度调度忽略任务异质性,per-sample probing 虽能准确估计但额外 rollout 开销大。Agent-G^2 通过 全局 baseline + 聚类难度中心 + 簇内方差展宽 的构造,在不增加推理预算的情况下捕获每个任务的适用深度带,精度接近 probing,成本大幅下降。这为 agentic RL 中的 hint guidance 提供了更实用的在线自适应方案。
行业影响
落地场景
Agent-G² 适用于需要大量交互数据的长程智能体任务,如电商购物代理(WebShop 类)、软件操作代理(GUI agents)、客服对话机器人以及自动化测试场景。在这些产品中,智能体通常需要多步决策才能获得稀疏奖励,hint-based RL 是常用的训练范式,但 guidance depth 的选择直接影响探索效率。Agent-G² 通过在线估计的高斯分布动态采样深度,能自动适配不同任务难度,无需额外 probe rollouts,适合部署在数据吞吐量大、对训练成本敏感的业务线。
商业价值
核心降本点在于训练效率:论文显示 Agent-G² 在 ALFWorld 上以不到 per-sample probing 三分之一的 rollout 成本超越最强基线,显著减少环境交互次数,降低算力与人工标注开销。同时成功率提升(ALFWorld 最高 +7.4 点)直接改善任务完成率,减少用户流失和人工兜底。在电商场景中,更稳定的购物代理可提升转化率;在企业服务中,更可靠的软件操作代理能降低错误率,带来体验与效率的双重收益。
跟现有产品/工作流的接口
Agent-G² 是一个调度器模块,可无缝集成进现有 agentic RL 训练栈(如 verl、trl 或自研训练循环)。只需替换 hint depth 的采样逻辑:将原先的固定标量或 per-sample probing 改为 GaussianSampler,并从策略优化已有的 rollouts 中提取特征(cluster difficulty、within-cluster variance)来更新高斯参数。不改变模型架构、奖励函数或优化器,因此可以最小改动接入现有 pipeline,快速验证收益。
具体 use case:
- 电商购物代理:训练 WebShop 类代理时,用 Agent-G² 动态调整专家前缀保留长度,在不同商品类别和查询复杂度上自动平衡模仿与探索,减少过度依赖专家轨迹,提升冷启动效率。
- 企业软件操作代理:在自动填写 CRM 表单、操作内部系统的场景中,任务难度差异大,Agent-G² 的 per-cluster 难度自适应能提供更精准的引导深度,减少无效尝试,降低执行延迟。
局限
- **方法假设的适用范围有限**:论文将 guidance depth 的有用区间建模为高斯分布,该假设在两个文本基准(ALFWorld、WebShop)上验证有效,但尚未证明能推广到连续控制、多模态或真实机器人等场景。若真实 depth-profiling 呈多峰或偏态,高斯拟合会引入系统性偏差,影响采样质量。此外,实验仅基于 Qwen2.5-1.5B/7B-Instruct,模型规模和架构多样性不足,结论向更大模型或不同 RL 算法(如 PPO 变体)迁移时可能不成立。
- **在线估计的鲁棒性与超参敏感性**:Agent-G² 的 Gaussian 参数通过聚类统计在线更新,依赖聚类数量、特征表示等预定义超参。训练早期 rollout 数据稀少,聚类边界与方差估计可能不稳定,导致采样深度分布漂移,甚至采样到无效或过浅的深度。论文未讨论聚类失效或数据分布 shift 时的应对策略,实际部署需要额外的诊断与调参成本。
- **与 per-sample probing 的精度权衡**:相比 per-sample probing,Agent-G² 节省了额外的 probe rollouts,但也牺牲了对每个任务最优深度的精确估计。对于需要细粒度深度控制的任务(例如某些关键状态仅出现在极窄深度窗口),高斯采样可能频繁命中非最优深度,降低训练效率。此外,方法未学习显式的深度预测模型,难以利用任务文本之外的上下文信号,在高度非平稳或个性化任务分布上可能弱于基于学习的 probing 方法。