介绍GSPO RL算法用于Qwen3模型训练
我们正在使用的
自豪地介绍 Group Sequence Policy Optimization (GSPO),这是我们稳定、高效且性能卓越的 RL 算法,为最新 Qwen3 模型(Instruct、Coder、Thinking)的大规模 RL 训练提供动力 🚀
自豪地介绍 Group Sequence Policy Optimization (GSPO),这是我们稳定、高效且性能卓越的 RL 算法,为最新 Qwen3 模型(Instruct、Coder、Thinking)的大规模 RL 训练提供动力 🚀