动态

探讨RL中推理/训练不匹配的工程与算法修复方案

探讨RL中推理/训练不匹配的工程与算法修复方案
Daanish Khazi
(1/5)
新文章:“Mismatch Praxis:Rollout设置与IS修正”。我们对推理/训练不匹配的解决方案进行了压力测试。

现代强化学习框架中的推理/训练不匹配造成了隐藏的离线策略问题。为解决该不匹配,提出了多种工程(如FP16统一、确定性核)和算法(如重要性采样)修复方案。本文研究了rollout设置(温度、top-p和top-k)如何影响不匹配,以及重要性采样修正在实际中的表现。

我们发现,虽然Sequence-TIS在理论上最优,但在长序列场景中可能因灾难性方差而失效。此外,非标准rollout设置会带来微妙的不匹配模式,需要仔细的工程修复。使用默认rollout设置的Token-TIS被证明是长序列训练中最稳健的方案。
动态Daanish Khazi2025-12-03原文

相关内容