三星联合牛津北大提出 TrOPD:用信任域在策略蒸馏提升端侧模型推理能力
三星等提出 TrOPD,先证明 OPD 训不好不是散度公式选错、而是教师对离群 token 的监督失真,只在教师可信区域学习即可显著提升端侧小模型。
大模型能力还在涨,但推理成本成了它走向手机等终端的主要障碍。三星大模型团队联合牛津大学、北京大学提出 TrOPD(信任域在策略蒸馏,一种让学生模型只学教师模型可信输出的训练方法),在四个基准上比原始 OPD 提升 3.34 到 6.18 分。
正文摘录
.jpg)   - 标题:Trust Region On-Policy Distillation - 文章地址:https://arxiv.org/abs/2606.01249 - 项目地址:https://github.com/Xingrun-Xing2/TrOPD GPT-6 等前沿大模型的能力仍在快速 Scaling,但随之攀升的推理成本,正在成为 AI 进一步规模化普及的关键障碍。当 AI 从云端走向手机、平板、智能家居等终端,模型不仅要 “足够聪明”,还必须塞进有限的内存和算力预算,并满足功耗、时延等严苛约束。