介绍SAPO:一种平滑稳定的强化学习方法。
软自适应策略优化(SAPO)——一种平滑、稳定且高效的强化学习方法!
🚀 我们提出软自适应策略优化(SAPO)——一种用于训练大型语言模型的平滑、稳定且高效的强化学习方法。\n\n为什么选择SAPO?\n🔹 硬裁剪很脆弱——梯度易消失或爆炸\n🔹 MoE模型放大方差,使训练更不稳定
🚀 我们提出软自适应策略优化(SAPO)——一种用于训练大型语言模型的平滑、稳定且高效的强化学习方法。\n\n为什么选择SAPO?\n🔹 硬裁剪很脆弱——梯度易消失或爆炸\n🔹 MoE模型放大方差,使训练更不稳定