DOPD方法破解特权幻觉 在线策略蒸馏效果提升
DOPD通过区分特权优势差,避免学生模仿教师“开挂”能力,让蒸馏更有效,值得关注。
在线策略蒸馏用教师模型逐token监督学生,但给教师特权信息反而可能让学生学到“捷径”而非真能力。新加坡国立大学等团队提出DOPD,按token优势差动态调整蒸馏方式,在LLM和VLM上显著提升学生表现。
正文摘录
.jpg)  得益于令人印象深刻的效果, 「在线策略蒸馏」 (On-policy Distillation) 一直是近期的热门话题。这种方式通过使用密集的教师 Token 级信号监督学生采样轨迹,提供卓越的能力转移。为了提供高质量的监督源,从而提升蒸馏的性能,一个直观的方向是将 「特权信息」 (Privileged Information) 注入教师或学生自身。然而,这种 “开外挂” 的方式,不一定能让学生学得更好,反而可能陷入 「特权幻觉」(Privilege Illusion) 的陷阱。