行业新闻

DOPD方法破解特权幻觉 在线策略蒸馏效果提升

DOPD通过区分特权优势差,避免学生模仿教师“开挂”能力,让蒸馏更有效,值得关注。

在线策略蒸馏用教师模型逐token监督学生,但给教师特权信息反而可能让学生学到“捷径”而非真能力。新加坡国立大学等团队提出DOPD,按token优势差动态调整蒸馏方式,在LLM和VLM上显著提升学生表现。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/89f8177d-46d8-45ef-9bfb-d7623768aad4/027(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 得益于令人印象深刻的效果, 「在线策略蒸馏」 (On-policy Distillation) 一直是近期的热门话题。这种方式通过使用密集的教师 Token 级信号监督学生采样轨迹,提供卓越的能力转移。为了提供高质量的监督源,从而提升蒸馏的性能,一个直观的方向是将 「特权信息」 (Privileged Information) 注入教师或学生自身。然而,这种 “开外挂” 的方式,不一定能让学生学得更好,反而可能陷入 「特权幻觉」(Privilege Illusion) 的陷阱。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-08原文

相关内容