SGLang 和 Miles 推出 R3,稳定 MoE 模型 RL 训练
SGLang + Miles:Rollout Routing Replay (R3) 现已上线!🎉
我们激动地宣布,SGLang 和 Miles 现在支持 Rollout Routing Replay (R3),用于 MoE 模型的稳定强化学习训练!
使用 RL 训练 MoE 模型一直以不稳定著称,常常导致灾难性崩溃。问题在于?推理引擎和训练引擎之间的路由不一致。R3 通过记录推理期间的专家路由决策并在训练期间重放来解决这个问题。
影响显著:通过重用推理路由决策,大幅减少训练-推理差异,防止训练崩溃。R3 完全支持分布式训练,包括 DataParallel Attention 和所有并行策略,支持的模型包括 Qwen3-30B-A3B、deepseek_v2 等。
试试看,告诉我们你的结果!🚀
我们激动地宣布,SGLang 和 Miles 现在支持 Rollout Routing Replay (R3),用于 MoE 模型的稳定强化学习训练!
使用 RL 训练 MoE 模型一直以不稳定著称,常常导致灾难性崩溃。问题在于?推理引擎和训练引擎之间的路由不一致。R3 通过记录推理期间的专家路由决策并在训练期间重放来解决这个问题。
影响显著:通过重用推理路由决策,大幅减少训练-推理差异,防止训练崩溃。R3 完全支持分布式训练,包括 DataParallel Attention 和所有并行策略,支持的模型包括 Qwen3-30B-A3B、deepseek_v2 等。
试试看,告诉我们你的结果!🚀