迈向全流程 FP8 强化学习的大语言模型训练
强化学习(RL)已成为提升大语言模型(LLM)推理与智能体能力的关键技术。虽然 FP8 量化 能加速 RL 训练,但在整个 FP8 RL 流程中保持稳定性仍然困难。此前工作多聚焦于用 TIS 等校正技术解决训练-推理不一致问题,而我们发现全流程 FP8 RL 仍存在严重的训练不稳定现象,表现为训练中期出现异常的熵激增与输出乱码。 我们将这一不稳定归因于一个此前被忽视的原因:复合 FP8 量化噪声 扭曲了重要性比率,使负优势 token 被过度推出信任域,其梯度被错误置零。于是病态输出得不到应有惩罚,并在训练过程中不断累积。 针对该问题,我们提出 Calibrated Clipping:一种动态方法,通过匹配下界裁剪分位数并相应重新平衡上界,使 FP8 裁剪边界与高精度 BF16 分布对齐。 我们在 GRPO 与 DAPO 算法、8B 至 32B 的模型规模,以及多种 FP8 缩放粒度上进行了大量实验,结果表明该方法成功消除了熵激增,并恢复到与 BF16 基线相当的性能。
论文精读
TL;DR 针对全流程 FP8 强化学习中的训练不稳定(熵激增、乱码输出),本文揭示其根源为 FP8 量化噪声扭曲重要性比率,并提出 Calibrated Clipping 动态对齐裁剪边界,恢复与 BF16 相当的性能。
问题
RL 已成为提升 LLM 推理与智能体能力的关键技术,训练效率是当前瓶颈。FP8 量化能显著加速,但在 RL 全流水线中维持稳定仍是一大挑战。
以往工作聚焦于训练-推理不一致,使用 TIS (Tensorwise Input Scaling) 等校正技术。然而摘要指出,全流水线 FP8 RL 依然出现严重的训练不稳定,表现为训练中期的熵激增和乱码输出。作者发现真正的诱因是量化噪声累积导致重要性比率 importance ratio 被扭曲:负优势 token 被推出信任域,其梯度被错误清零,病理输出未受到惩罚并逐渐累积。这说明仅对齐推理分布不足以稳定训练,工程上需要关注训练动力学中的数值误差传播。
全流水线 FP8 在前向、反向和优化器状态等环节均有量化,噪声在策略梯度计算中非线性耦合,难以定位和修正。重要性比率对精度高度敏感,微小噪声即可改变梯度符号。业界对低成本 RL 训练需求强烈,FP8 是主流加速手段,但稳定性问题阻碍其落地。该问题与之前的推理精度问题不同,属于训练动力学范畴,需要新的钳制策略。
类似于在自动驾驶感知管线中引入低精度传感器,若噪声在决策环节被放大,系统会持续产生错误动作,事后校准难以根本解决。
核心洞察
- FP8 强化学习训练不稳定的根因并非单纯的 train-inference mismatch,而是复合量化噪声扭曲 importance ratio,将负优势 token 的梯度错误裁剪为零,导致病理输出无法被有效惩罚并逐渐累积,最终引发熵飙升。这一机制比此前通过 TIS 等修正技术解决推理差异的工作更底层,直接指向优化动态层面的病态反馈,解释了为何仅对齐推理分布仍无法消除训练发散。
- Calibrated Clipping 通过匹配 FP8 与 BF16 分布的裁剪分位数来动态调整边界,而非依赖固定缩放或额外矫正项,能在不修改 RL 算法本身的前提下恢复训练稳定性。与静态裁剪或全局缩放相比,该方法对量化噪声的分布偏移更具适应性,且实验证明在 GRPO、DAPO 及 8B 至 32B 模型上均有效,为 FP8 RL 提供了一种低侵入、易部署的工程级稳定化方案。
方法
方法概述
输入:完整 FP8 流水线的强化学习训练,覆盖 GRPO 与 DAPO 算法及 8B–32B 模型。
关键模块:
- 问题定位:分析发现 FP8 累积量化噪声会扭曲
importance ratio,使负优势 token 超出信任域,梯度被错误置零,导致异常输出得不到惩罚而持续累积。 - Calibrated Clipping:动态对齐 FP8 裁剪边界与 BF16 分布。具体做法是匹配下界裁剪分位数,并相应重新平衡上界,让 FP8 的裁剪行为逼近高精度参考。
输出:稳定的 FP8 RL 训练过程,消除训练中期的熵激增与乱码现象,最终性能与 BF16 基线可比。
与同类方法差异:此前工作(如 TIS)主要解决训练 - 推理不匹配,本文则针对训练内部因量化噪声引发的信任域破坏,通过裁剪边界校准而非校正项来恢复稳定性。
实验
实验设计
实验覆盖 GRPO 与 DAPO 两种 RL 算法,模型规模从 8B 到 32B,并测试多种 FP8 scaling granularities (如 per-tensor / per-token 等,原文未列细节)。训练全程使用 FP8,与 BF16 基线对比,重点观察熵值变化、输出可读性与最终推理 / 智能体能力。
关键发现
- 全流程 FP8 RL 出现严重训练不稳定:训练中期 熵突增,模型输出乱码。
- 根因并非 train-inference mismatch,而是 复合 FP8 量化噪声 扭曲 importance ratio:负 advantage token 被推出 trust region,梯度被错误置零,病理输出无法被惩罚并累积。
- 提出的 Calibrated Clipping 通过匹配 BF16 分布的 lower-bound clipping quantile 并重新平衡 upper bound,动态校准 FP8 裁剪边界。
与基线对比
相比仅用 TIS 等校正方法,Calibrated Clipping 消除了熵突,恢复 BF16 同等性能。在 GRPO / DAPO、8B–32B 多配置下验证,说明该方法不依赖特定 RL 算法或 FP8 粒度,具备工程可迁移性。
行业影响
落地场景
FP8 量化 RL 训练可直接加速 LLM 在推理与智能体任务上的迭代,适用于需要强化学习提升逻辑推理、工具调用、多轮交互的产品,如智能客服、代码助手、电商导购机器人、内容审核解释生成等。尤其适合算力预算敏感但需要持续 RL 更新的团队,以及使用 GRPO、DAPO 等算法训练 8B-32B 模型的场景。
商业价值
FP8 将训练吞吐提升约 2 倍,显著降低 RL 阶段 GPU 成本。Calibrated Clipping 消除熵激增与乱码输出,减少训练失败重训带来的浪费,缩短模型上线周期。对依赖 RL 微调开源模型的企业,能更经济地获得接近 BF16 的模型质量,提升产品体验与竞争力。
与现有工作流集成
该方法可作为插件接入现有 FP8 训练栈,无需改变模型结构或 RL 算法。在 TransformerEngine、MS-AMP 等 FP8 框架中,只需在 optimizer 或 loss 计算处增加一个校准模块,根据 BF16 参考分布动态设置 FP8 裁剪上下界。可支持 per-tensor、per-token 等粒度。部署时模型仍是标准权重,无需额外推理修改。
具体落地 use case
- 电商智能客服的 RL 训练:使用 GRPO 优化多轮对话中的商品推荐与问题解决策略,FP8 加速降低大批量用户模拟成本,同时避免训练后期输出乱码,保持负样本惩罚效果。
- 代码生成助手:RL 用于提升代码正确性与测试通过率,FP8 加速迭代,Calibrated Clipping 防止负样本梯度消失,保持对错误输出的有效抑制。
局限
- 论文提出的 Calibrated Clipping 依赖 BF16 参考分布进行动态校准,意味着在实际 FP8 训练中需要额外维护或采样高精度统计信息。摘要未明确校准过程的计算开销和存储成本,但若需在训练中持续跟踪 BF16 分布(如通过维护影子模型或周期性切换精度),可能引入不可忽视的额外负担,削弱 FP8 训练的整体加速收益。此外,该方法的设计主要针对 RL 中重要性比率这一特定环节,对于其他量化敏感模块或非 RL 的 FP8 训练场景,泛化性有待验证。
- 实验覆盖的算法和模型规模有限。论文仅在 GRPO 和 DAPO 两种 RL 算法上验证,模型规模为 8B 至 32B,虽然覆盖了多种 FP8 缩放粒度,但未涉及更大规模(如 70B+)或不同架构(如 MoE、多模态)的 LLM。在更大模型下,FP8 的量化噪声分布可能不同,Calibrated Clipping 的超参数(如 quantile 选择)可能需要重新调整,方法的可扩展性和调参成本尚不明确。
- 与同类工作(如 TIS 等训练-推理不匹配校正技术)相比,本文揭示的复合量化噪声问题是一个新的失败模式,但 Calibrated Clipping 本质上是一种启发式的边界重平衡方法,缺乏严格的理论证明或收敛性保证。它通过匹配分位数来缓解重要性比率扭曲,但并未从根本上消除量化噪声对策略梯度估计的影响,在极端噪声或高训练步数下是否仍能维持稳定仍有待检验。