动态

介绍GSPO RL算法用于Qwen3模型训练

介绍GSPO RL算法用于Qwen3模型训练
Junyang Lin
我们正在使用的
Chujie Zheng
自豪地介绍 Group Sequence Policy Optimization (GSPO),这是我们稳定、高效且性能卓越的 RL 算法,为最新 Qwen3 模型(Instruct、Coder、Thinking)的大规模 RL 训练提供动力 🚀
动态Junyang Lin2025-07-26原文

相关内容