动态

RLSD: 用自蒸馏和可验证奖励统一策略,解决信息泄露和不稳定性

RLSD: 用自蒸馏和可验证奖励统一策略,解决信息泄露和不稳定性
DailyPapers
RLSD: 带自蒸馏的RLVR

将对策略自蒸馏与可验证奖励统一,以修复信息泄露和不稳定性——利用令牌级策略差异进行细粒度更新,同时利用环境反馈获得可靠方向。
动态DailyPapers2026-04-06原文

相关内容