行业新闻

清华团队研究:On-Policy Distillation 用 1 道题即可恢复七成全量数据增益

这篇论文证明 OPD 的瓶颈在算法吸收监督的速度,而非训练题目数量,对蒸馏训练的数据成本假设是一次直接挑战。

清华联合多所高校研究 On-Policy Distillation(在线策略蒸馏,用教师模型在学生自己生成的回答上给监督的训练方法):把训练集从 17000 道题删到 1 道,模型仍能连涨几百步。原因是学习单位不是题目而是状态——同一道题反复采样会走到不同局面,1 道题就覆盖了约 71.5% 的状态空间,瓶颈在算法而非数据。

正文摘录

清华团队再探 On-Policy Distillation:数据撑死,算法饿死 ![](https://image.jiqizhixin.com/uploads/article/coverimage/15c439eb-392b-4feb-930a-99ffad3810bb/033(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 本文由清华大学联合中国科学院大学、东北大学、伊利诺伊大学厄巴纳 - 香槟分校、约翰霍普金斯大学等机构研究者合作完成。 把 On-Policy Distillation(在线策略蒸馏,OPD)的训练集从 17000 道题删到 1 道,会发生什么? 按常理,这道题很快就该被榨干。模型翻来覆去做同一道题,学个几十步也就该停了。 实际跑出来是另一回事:它连着涨了几百步没停。数学三个基准的平均分从 59.1 起步,300 步时到 68.5;作为对照,用全部 17000 道题训练,同一时刻是 69.8。一条数据已经恢复了 70% 以上的全数据收益。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-16原文

相关内容