论文

Stale but Stable: 用于稳定异步强化学习的陈旧自适应信任区域

Stale but Stable: 用于稳定异步强化学习的陈旧自适应信任区域

异步强化学习通过解耦轨迹生成与优化提升了吞吐量,但陈旧性(staleness)是不可避免的副产品,它由策略滞后、引擎延迟和混合专家路由共同加剧。从信任区域角度看,这种不匹配至关重要:训练-推理差异控制着有限时域界中的近似误差,而 PPO 裁剪仅门控采样的向外更新,作为采样替代而非完整策略约束。结果,在陈旧轨迹影响最大的异步机制中,高陈旧性更新仍受弱控制。 我们提出陈旧自适应信任区域 (SAT) ,将分离的采样对数比作为实用的陈旧性代理,通过基于陈旧性的核缩放识别每个批次内的高不匹配尾部,并仅收缩标称 PPO 区间的符号选择端点。这保持了普通 token 上的基线行为,同时在新拦截的向外频带上实施更保守的更新。我们证明了相对于 PPO 的局部区间包含性和逐点悲观性,展示了自适应规则如何重塑异构陈旧性下的更新几何。 我们在基于 Qwen3-30B-A3B-Base 的解耦异步 RL 设置中评估 SAT,使用 SGLang 作为推理引擎,Megatron 进行训练。在此设置中,SAT-GSPO w/ R3 达到最佳观测的 AIME24 avg@8,在 lag 1 时为 35.83,lag 8 时为 34.79,而 SAT-GSPO 在 lag 1 时达到 34.17。自适应裁剪和路由重放作为互补稳定器,分别针对不匹配尾部和路由不一致。总体而言,将裁剪区间与陈旧性异质性对齐有效稳定了异步 RL。

论文精读

TL;DR SAT 引入基于陈旧度的自适应信任区域,取代 PPO 固定裁剪,约束异步 RL 中陈旧样本的高偏差更新,在 Qwen3-30B-A3B 模型上显著提升训练稳定性与数学推理得分。

问题

异步强化学习的staleness困境

异步强化学习 (Asynchronous RL) 中,rollout 生成与策略优化解耦能显著提升吞吐,但由此引入的 staleness (陈旧性) 成为瓶颈。随着模型规模增长(如 MoE 架构),策略滞后、推理引擎延迟和路由不一致等问题交织,使训练-推理 divergence 加剧,影响策略更新的稳定性和效率。

现有方法主要依赖 PPO clipping,它仅对采样动作的向外更新进行裁剪,本质上是一种 sampled surrogate,而非完整的策略约束。在高 staleness 场景下,陈旧 rollout 产生的梯度容易超出信赖域,导致有害更新,而 PPO 无法进行自适应的区间收缩或放宽。从 trust-region 视角看,这导致有限时域下的近似误差失控,尤其当 staleness 分布异质时,统一的裁剪区间会过度限制低 staleness 更新,而未能充分保护高 staleness 更新。

该问题的挑战在于:

  • staleness 度量困难:缺乏轻量、可导的 staleness 代理信号,难以实时调整更新幅度。
  • 异质性处理:同一 batch 内不同 token 的 staleness 差异巨大,需逐 token 自适应,而非全局固定策略。
  • 与路由机制的交互:在 MoE 模型中,路由不一致还会进一步扭曲 value 估计,需要稳定化的 replay 策略。

业界对大规模异步 RL 的训练稳定性关注度持续上升,如 DeepSeek-R1Kimi k1.5 等工作均涉及异步分布式训练的高效稳定方案。该问题的解决直接关系到 大模型 RL 微调的工业落地可行性。

类比:这与 异步 SGD 中的延迟补偿类似——当梯度因通信延迟变得陈旧时,需要自适应缩放或动量修正来保持收敛,而 SAT 正是为策略更新提供了这样一个 staleness 感知的信赖域调节器。

核心洞察

  • 异步 RL 中陈旧的样本打破了 PPO 的信任区域约束,需要自适应机制。传统 PPO 的 clip 仅约束采样的动作概率比,未考虑策略滞后导致的分布偏移,在高陈旧度下约束失效。SAT 将 staleness 作为信任区域调整的信号,通过 staleness 核缩放识别高不匹配尾部,并理论证明了相对于 PPO 的点态悲观性,从而在异步环境中实现稳定更新,弥补了标准 PPO 的设计缺陷。
  • SAT 通过钳制 PPO 区间的符号选择端点实现选择性保守,避免过度约束。与整体缩放更新幅度的方案不同,SAT 只收缩优势函数符号方向的端点:对低陈旧度 token 保留 PPO 原始行为,保持探索;对高陈旧度 token 施加更小 clip 区间,抑制危险更新。这种 token 级自适应兼顾了学习效率与稳定,防止因保守策略导致性能下降,是实现异步 RL 稳定化的关键设计。
  • 在大规模 MoE 模型的异步 RL 中,SAT 与路由回放形成互补稳定器,分别解决陈旧分布和路由不一致问题。SAT 处理因陈旧导致的高 log-ratio 尾部,路由回放重播历史路由决策,两者组合在 Qwen3-30B-A3B-Base 上取得最优 AIME24 分数。这暗示实际工程中,异步 RL 的稳定性不能依赖单一技术,需要针对不同异质性源头设计多层次干预,为异步 RL 系统落地提供了完整范式。

方法

方法概览

SAT 是一种用于异步强化学习的自适应信任域方法,旨在缓解因策略延迟、引擎延迟和 MoE 路由等因素导致的 staleness 问题。其核心思想是:在标准 PPO 裁剪目标的基础上,根据每个 token 的 staleness 程度自适应地缩小信任域,以更稳健地处理高偏差样本。

输入与 Staleness 代理

  • 输入:来自异步 rollout workers 的批量 token 数据,包含状态、动作、优势估计以及记录 rollout 时使用的旧策略 π_old 的 log 概率。
  • Staleness 代理:使用 detached sampled log-ratio,即当前策略与旧策略在采样动作上的 log 概率比值(但不参与梯度计算),作为 staleness 的量化指标。该比值越大,表明 rollout 策略与当前策略的偏差越大,staleness 越严重。

关键模块

  1. Staleness 感知的尾部识别
    在每批数据内,通过基于 staleness 代理的核缩放(kernel scaling)技术,对样本的重要性进行重加权,从而自动聚焦于 log-ratio 分布中高不匹配的尾部样本。这些尾部样本对应着潜在有害的大幅策略更新。
  2. 自适应信任域收缩
    针对 PPO 的 clipped objective,SAT 仅对符号选择的端点(sign-selected endpoint)进行收缩调整。具体地,对于优势为正的 token,原本的裁剪区间 [1-ε, 1+ε] 中上界 1+ε 会被进一步压低为 1 + ε_adaptiveε_adaptive < ε);类似地,对于优势为负的 token,下界 1-ε 被抬高。这种设计保留了大部分 token 上的标准 PPO 行为,仅对可能产生向外更新的高 staleness token 施加更保守的约束。调整量由 staleness 代理和尾部权重共同决定,实现了逐点悲观主义(pointwise pessimism)。

输出与效果

  • 最终策略更新在异步环境下更加稳定,避免因过时数据导致的策略剧烈波动。
  • 实验表明,SAT 结合 GSPO 算法,在 Qwen3-30B-A3B-Base 模型上,使用 SGLang 推理和 Megatron 训练,于 AIME24 avg@8 指标上,当 lag=1 时达到 35.83,lag=8 时仍保持 34.79,显著优于基线。

与同类方法的差异

与标准 PPO 的固定裁剪区间相比,SAT 通过 staleness 代理将信任域调整为随样本 staleness 自适应变化,提供了 PPO 所缺乏的针对高 staleness 数据的细粒度控制,从而在异步训练中更好地平衡采样效率与策略稳定性。

实验

实验设计

实验基于 Qwen3-30B-A3B-Base 构建解耦异步 RL 框架:推理引擎使用 SGLang,训练引擎使用 Megatron。评估采用数学推理基准 AIME24,指标为 avg@8(8 次采样平均准确率)。主要考察不同 staleness lag(1 与 8)下,SAT-GSPO 及其结合 R3(路由重放) 的变体 SAT-GSPO w/ R3 的性能。对比基线包括标准 PPO 的固定裁剪策略,以及仅 SAT 或无路由重放的消融版本。

关键发现

  • SAT-GSPO w/ R3 取得最优结果:lag=1 时 AIME24 avg@8 达 35.83,lag=8 时仍保持 34.79,显示对高延迟的强鲁棒性。
  • SAT-GSPO 自身也显著提升:lag=1 时达到 34.17,证明基于 staleness 的自适应信任区域有效缓解异步训练中的策略发散。
  • 自适应截断+路由重放形成互补:裁剪机制抑制高失配样本的过激更新,路由重放修正 MoE 的路由不一致,两者联合稳定了训练。

对比解读

标准 PPO 的全局固定裁剪不同,SAT 利用 detached sampled log-ratio 作为 staleness 代理,按样本尾部失配程度动态收缩裁剪区间——只对需要约束的“外向更新”施加更保守的步长,保留普通 token 的原始行为。这使得异步 RL 在吞吐量提升的同时,训练-推理发散得到显式控制。实验趋势表明:随着 staleness 增加,SAT 的性能衰减远小于无自适应方案,而加入路由重放进一步抵消了 MoE 引起的额外偏差。整体而言,将裁剪区间与 staleness 异质性对齐 是异步 RL 稳定化的关键设计,为未来大规模解耦 RL 框架提供了可扩展的工程指导。

行业影响

落地场景

异步 RL 在 大语言模型对齐 (RLHF)推荐系统游戏 AI 中主流,但策略陈旧性 (staleness) 易致训练发散。SAT 自适应信任域能控制陈旧更新,适合:

  • LLM 后训练管线 : 解耦推演与优化的 RLHF 框架,如使用 SGLang + Megatron 的异步训练。
  • 实时推荐系统 : 在线日志回放存在延迟,SAT 稳定增量更新。
  • 自动驾驶仿真 : 分布式仿真数据抵达滞后,需要稳健的策略改进。

商业价值

  • 降本 : 避免发散重启节省算力,支持更高异步度 (lag 8 性能仅微降) 提升资源利用率。
  • 体验/收益 : 更稳定收敛加速模型迭代;在 RLHF 中提升对齐质量;在推荐中减少在线指标抖动。
  • 扩展性 : 允许跨区域数据中心更松的同步,降低系统设计复杂度。

与现有产品/工作流集成

  • 推理引擎 : 与 SGLang、vLLM 等兼容,记录 staleness 代理 (推演延迟) 无额外开销。
  • 训练框架 : 作为 PyTorch 损失函数修改,替换标准 PPO clip,可直接插入 Megatron/DeepSpeed 训练循环。
  • 互补技术 : 结合路由重放 (routing replay),分别处理陈旧尾部和路由不一致,可共同部署。

具体 Use Case

  1. LLM 提供商的 RLHF 训练: 某公司使用 SGLang 集群生成数据,Megatron 进行 PPO 训练。推理负载波动造成数十秒延迟,策略过时。SAT 后训练稳定性提升,AIME24@8 达 35.83 (lag 1),且无需降低学习率或回滚。
  2. 电商推荐在线学习: 每小时更新策略,数据管道滞后。SAT 约束更新幅度,平稳改善线上 CTR 和 GMV。

局限

  • **依赖随机策略与 log-ratio 代理**:SAT 使用 detached sampled log-ratio 作为 staleness 的实用代理,并基于 PPO 的 clip 区间进行收缩,这假设策略是随机的且 log-ratio 能可靠反映训练-推理分布偏移。在确定性策略或 Q-learning 类算法中,该代理无法直接构造,限制了方法的适用范围。此外,极端 staleness 导致 log-ratio 退化为噪声时,kernel scaling 可能无法正确识别高风险样本,保守性收缩可能过低效。
  • **实验场景相对单一**:验证仅在 Qwen3-30B-A3B-Base 模型与数学推理任务(AIME24)上进行,虽覆盖不同滞后水平,但未展示在通用对话、代码生成等更广泛 LLM 任务上的效果。异步 RL 在多种训练管线(不同模型规模、架构、强化学习目标)中表现可能各异,缺乏与 on-policy 方法在大规模多任务下的系统性对比。
  • **与其他异步 RL 稳定技术的结合待探索**:论文将 SAT 与 GSPO、routing replay 和 adaptive clipping 结合,但未深入分析各组件间的相互影响与消融上限。在极高延迟(lag >> 8)或极度异构 staleness 分布下,仅靠区间收缩可能不足以完全抑制发散,需要与更加主动的同步机制或重要性采样修正结合,目前工作未给出此类混合策略的指导。
论文Junyao Yang2026-07-21原文

相关内容