论文

面向智能体强化学习的单 rollout 异步优化

面向智能体强化学习的单 rollout 异步优化

强化学习(RL)在大语言模型(LLM)的后训练阶段日益重要。以往的LLM-RL流程多为同步批处理,在长程智能体任务中效率低下。近期,异步RL通过随rollout到达更新模型,成为更高效的替代方案。然而,现有异步RL系统往往侧重吞吐量,对训练稳定性和任务有效性关注不足。例如,广泛使用的GRPO框架中的组级采样难以自然适配异步智能体训练。 本文提出单rollout异步优化(SAO),以解决异步RL中的稳定性和off-policy挑战。为减少off-policy效应并提高泛化,我们将组级采样替换为单rollout采样,即每个提示仅用一个rollout。我们还通过实用的价值模型训练设计改进了该策略。为提升优化稳定性,引入了严格的双端token级裁剪。 SAO可稳定训练上千步,并在SWE-Bench Verified、BeyondAIME和IMOAnswerBench等智能体编码与推理基准上持续优于GRPO及其变体。此外,单rollout RL在模拟在线学习场景中尤为有效,模型需适应不断变化的环境。目前,SAO已成功部署于GLM-5.2(750B-A40B)模型的智能体RL训练管线。

论文精读

TL;DR 用单 rollout 替代组采样的异步 RL 方法 SAO,通过双端 token 级裁剪提升训练稳定性,在智能体编码与推理任务上显著优于 GRPO,并成功用于训练 GLM-5.2 模型。

问题

问题背景

大语言模型(LLM)的后训练阶段,强化学习(RL)正成为提升模型在复杂交互任务中智能体能力的关键范式,尤其是针对需要长序列决策的 agentic 任务

现有方法局限

  • 同步 RL 效率低:传统 RL 管线(如 PPO)采用同步批量更新,必须等待所有 rollout 完成后才能计算梯度,在长时程 agentic 任务中延迟极高,硬件利用率不足。
  • 异步 RL 忽略稳定性:近期异步 RL 方案虽提高了吞吐量,但大多只关注系统效率,对 训练稳定性off-policy 效应 缺乏深入设计。模型更新时,行为策略与目标策略不一致会导致策略退化。
  • GRPO 组采样本不适配异步场景:广泛使用的 GRPO 依赖同一 prompt 下的多条 rollout 计算组内相对优势,这种组采样模式在 rollout 逐个到达的异步流中难以实现,且容易放大 off-policy 偏差。

为什么这个问题难且重要

  • 技术挑战:异步训练中策略漂移严重,梯度估计方差大;agentic 任务的奖励稀疏,且环境可能随时间变化,要求算法同时具备稳定性和快速适应能力。
  • 业界关注度:LLM 正向智能体方向演进,稳定高效的 RL 后训练是解锁其在代码生成(如 SWE-Bench)、数学推理(如 BeyondAIME)等真实场景能力的关键。缺少稳定性保障,大规模分布式训练将难以收敛。

行业类比

好比在线推荐系统需要从实时用户反馈中学习而不破坏现有体验,SAO 的单次 rollout 异步优化为 LLM 在动态交互环境中的持续进化提供了稳定基础。

核心洞察

  • 异步强化学习中的训练稳定性被长期低估,而 SAO 通过严格的双端 token 级裁剪直接解决了 off-policy 带来的方差问题。与之前异步 RL 系统单纯追求吞吐量不同,SAO 将稳定性与有效性放在首位,其双端裁剪策略同时在策略概率比和值函数误差上进行约束,这种设计在 LLM 智能体训练中首次被验证可支持数千步的稳定训练,显著区别于 GRPO 等依赖组内归一化的方法在实践中容易发散的情况。
  • 单次 rollout 采样替代组内采样,不仅缓解了异步场景下的 off-policy 分布偏移,还意外提升了模型在动态环境中的泛化能力。原有 GRPO 等组对比方法需要同一 prompt 的多个完整 rollout 才能计算优势函数,这在异步并行中难以高效实现且加剧倚赖组内同质性。SAO 证明,每 prompt 仅采一个 rollout 配合值模型训练,可以在保持计算效率和训练稳定性的同时,让模型更专注于从自身行为分布中学习,避免了组内因多个 rollout 质量差异过大导致的优化信号混杂。

方法

方法概述

SAO 面向异步 agentic RL 的训练流程,核心设计围绕单次 rollout 采样双侧重要性采样裁剪 两大模块,解决异步场景下的训练不稳定与严重 off-policy 偏差。

  • 输入:每个 prompt 仅生成一条完整 rollout,而非 GRPO 常用的组内多条采样。这天然适配流式到达的样本,避免因模型实时更新导致同 prompt 下新旧轨迹混合造成的 off-policy 漂移。

  • 关键模块

    • 单次 rollout 策略:每 prompt 一轨迹,杜绝组内对比冗余,大幅减少 off-policy 误差。为弥补对比信号缺失,引入价值模型(value model)进行 token 级优势估计,并配套特殊的价值模型训练设计以稳定学习。
    • 直接双侧重要性采样裁剪(Direct Double-Sided Importance Sampling, DIS):这是稳定性核心。在 token 级别对策略比率同时施加上界与下界裁剪,严格约束每次更新幅度,防止异步训练中策略发生剧烈振荡。与 PPO 的单侧裁剪不同,DIS 的双侧机制更适配极端非平稳的 agentic 任务。
  • 输出:经过异步 RL 优化的 LLM 策略,可直接用于复杂 coding/reasoning agent 任务,如 SWE-Bench Verified、BeyondAIME 等,表现出高于 GRPO 及其变体的性能。

与同类方法的差异:现有异步 RL 系统(如 APO)侧重吞吐量,往往牺牲稳定性;SAO 则在保持异步效率的前提下,用单 rollout 配合双侧裁剪显著提升训练稳定性和最终任务效果,尤其适用于长程 agentic RL。

实验

实验设计

SAO 在纯异步 RL 环境下评估,将 GRPO 的组采样替换为单 rollout 采样(每个 prompt 仅生成一条轨迹),并引入严格的双边 token 级重要性采样裁剪(DIS)值模型辅助回归。主要基准包括:SWE-Bench Verified(代码修复任务)、BeyondAIMEIMOAnswerBench(数学推理)。训练持续约 1000 步以检验异步稳定性;消融实验分析单 rollout 策略与裁剪强度的影响;另设在线学习模拟,评估模型在动态变化环境中的适应能力。实验基于 GLM-5.2 (750B-A40B) 大规模模型,证明方案的实际可部署性。

关键发现

  • 单 rollout 有效缓解 off-policy 偏移:相比 GRPO 的组采样需等待多个样本计算组内相对优势,SAO 直接用当前策略的单个样本更新,避免了旧策略样本混杂,异步场景下数据利用更及时、训练更稳定。
  • 双重裁剪保障优化平稳:严格的双边 token 级裁剪严格约束重要性采样比率,使策略更新幅度受控,实现超 1000 步无崩溃训练,突破了以往异步 RL 的不稳定瓶颈。
  • 跨基准全面超越:SAO 在 SWE-Bench Verified、BeyondAIME、IMOAnswerBench 三大 agentic 基准上一致优于 GRPO 及其常见变体,尤其在需要长程规划的 SWE-Bench Verified 上解决率提升显著,证明方法论对不同任务类型的泛化能力。
  • 动态环境适应性强:在线学习模拟中,SAO 比同步方法更快适应环境变化,显示出在持续学习与部署中的潜力。

与基线对比的深度解读

与基于组采样的 GRPO 变体相比,SAO 的核心结构变化是取消组内互比,转而依赖单 rollout 的绝对奖励和值模型基线。这一改变在异步场景下解决了组内样本到达时间不一致导致的优势估计偏差,消除了对 batch 同步的刚性需求。尽管单 rollout 丢失了组内相对比较提供的低方差优势,但通过值模型回归保守的 token 级策略更新(双重裁剪)弥补了方差问题,最终在三个基准上均获得更高得分。尤其在 SWE-Bench Verified 这类需要与环境进行多轮交互的长任务中,SAO 的异步单 rollout 范式避免了因等待组内慢样本造成的资源闲置,使训练吞吐与最终效果同步提升,证实了在 agentic RL 中以单 rollout 异步化替代组采样是更优的扩展方向

行业影响

落地场景

SAO 异步 RL 框架 解决了长周期 agentic 任务(如代码修复、数学推理、多步决策)的高效训练问题。主要落地场景包括:

  • 自动化编程助手:针对 SWE-Bench 级别的复杂程序修复与生成,可直接用于 AI 代码审查、自动提交补丁的产品。
  • 多轮对话与推理服务:需要模型在长上下文中进行复杂推理的客服或教育对话系统。
  • 持续学习的在线环境:金融交易、游戏 AI、自动驾驶仿真等需要模型不断适应动态变化的任务。

商业价值

  • 降本增效:异步训练无需等待全局 batch,大幅提升 GPU 利用率,对于需要数千步训练的大型模型(如 GLM-5.2 750B)能显著降低训练时间和算力成本。
  • 业务效果提升:在 BeyondAIME、IMOAnswerBench 等严苛推理基准上稳定超越 GRPO 等方法,直接带来产品竞争力提升。
  • 扩展性:SAO 的 单 rollout 采样双侧 token 级裁剪 保证了训练稳定性,使 RL 训练能扩展到千步以上,这对于需要精细调优的企业级 LLM 部署至关重要。

与现有产品/工作流的集成

SAO 可无缝集成到现有 RLHF/PPO/GRPO 流水线中,仅需替换以下组件:

  • 采样模式:从组采样改为单 rollout 采样,简化数据生成与经验缓冲管理。
  • 价值模型训练:补充了实用的价值模型训练设计,可用于引导策略更新。
  • 优化器裁剪:引入双侧 token 级裁剪模块,可直接融入任何 actor-critic 风格的异步 RL 系统。

具体落地用例

  1. 代码托管平台的自动修复机器人:例如在 GitLab 或 GitHub Actions 中,集成基于 SAO 训练的模型,当检测到 CI 失败时自动生成补丁并提交 PR,通过 RL 持续优化修复成功率。模型在 SWE-Bench Verified 上的提升直接映射为生产环境中缺陷修复的自动化率提升。
  2. 在线教育个性化解题助手:针对数学竞赛级题目(如 IMOAnswerBench 场景),系统可异步更新模型以适应不同学生的薄弱环节,单 rollout 策略让模型在动态用户反馈中保持泛化能力,避免过拟合到特定题目的组内模式。

局限

  • **任务泛化性未验证**:SAO 在 SWE-Bench Verified、BeyondAIME 等 agentic coding 和推理基准上表现出色,但论文未评估其在通用对话、安全对齐或数学之外的长程决策任务上的有效性。单 rollout 策略和双侧裁剪可能依赖于环境反馈的稀疏程度,对于密集奖励或不同交互模式的任务,方法是否仍能稳定收敛尚不明确。
  • **单 rollout 采样对 prompt 多样性敏感**:用单条 rollout 代替 GRPO 的组采样,虽减少了 off-policy 偏差,却可能降低单次更新的信号丰富度。如果 prompt 池不够大或存在重复,模型容易对特定 prompt 过拟合,训练方差增大。论文未系统分析 prompt 多样性对 SAO 性能的影响,也未提供 prompt 构造策略的建议。
  • **额外超参与工程复杂度**:双侧 token 级裁剪引入至少一个裁剪阈值,与异步更新频率、价值模型学习率等构成耦合超参,调优成本高。此外,SAO 需要训练一个价值模型来辅助 off-policy 校正,这增加了训练开销和架构复杂度,限制了其在资源受限场景下的应用。论文仅在内部 GLM-5.2 流水线上验证,缺少与主流异步 RL 框架(如 OpenRLHF、APO)在同等条件下的稳定性对比。
论文Zhenyu Hou2026-07-08原文

相关内容