RLSD: 用自蒸馏和可验证奖励统一策略,解决信息泄露和不稳定性 DailyPapersRLSD: 带自蒸馏的RLVR将对策略自蒸馏与可验证奖励统一,以修复信息泄露和不稳定性——利用令牌级策略差异进行细粒度更新,同时利用环境反馈获得可靠方向。 动态DailyPapers2026-04-06原文 打开互动版