行业新闻

三星联合牛津北大提出 TrOPD:用信任域在策略蒸馏提升端侧模型推理能力

三星等提出 TrOPD,先证明 OPD 训不好不是散度公式选错、而是教师对离群 token 的监督失真,只在教师可信区域学习即可显著提升端侧小模型。

大模型能力还在涨,但推理成本成了它走向手机等终端的主要障碍。三星大模型团队联合牛津大学、北京大学提出 TrOPD(信任域在策略蒸馏,一种让学生模型只学教师模型可信输出的训练方法),在四个基准上比原始 OPD 提升 3.34 到 6.18 分。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/b5d14e3b-5128-4be0-97ac-c182e7a89c6e/052(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) ![图片](https://mmbiz.qpic.cn/mmbizpng/5L8bhP5dIqGJYSEib3tLp8y2ibUv5FbW5aqVq1fCCvDvn7H8poCGPZR9AAAXjHoQVLA27MkMAicsickdofsUbHZ7ov87V960wLcvwhJbJc5sicKg/640?wxfmt=png&from=appmsgimgIndex=1) - 标题:Trust Region On-Policy Distillation - 文章地址:https://arxiv.org/abs/2606.01249 - 项目地址:https://github.com/Xingrun-Xing2/TrOPD GPT-6 等前沿大模型的能力仍在快速 Scaling,但随之攀升的推理成本,正在成为 AI 进一步规模化普及的关键障碍。当 AI 从云端走向手机、平板、智能家居等终端,模型不仅要 “足够聪明”,还必须塞进有限的内存和算力预算,并满足功耗、时延等严苛约束。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-18原文

相关内容