动态

新在线策略蒸馏法:外推 RL 表征残差,让学生模型追平甚至超越教师

新在线策略蒸馏法:外推 RL 表征残差,让学生模型追平甚至超越教师
AK
RT @HuggingPapers:教师是方向,而非终点

新的在线策略蒸馏方法,通过外推 RL 引发的表征残差,让学生在四组模型配对中追平甚至超越教师。代码与 checkpoint 计划发布。https://t.co/GTrcrWcz8o
动态AK2026-10-01原文

相关内容