亚马逊与杜克大学研究:后训练只保留万分之一 token 梯度即可提升推理能力
研究发现后训练不需要密集 token 监督:每条推理轨迹只留万分之一 token 的梯度就能提升推理能力,挑战了业界对密集信号的默认假设。
后训练通常依赖上亿 token 的密集梯度信号。亚马逊与杜克大学的研究在 OPD(在线策略蒸馏,学生模型生成推理轨迹、教师模型逐 token 给反馈)中只随机保留每条 rollout 一个 token 的梯度,mask 掉其余全部信号,学生模型推理能力仍显著提升,部分配置下仅监督 1-2 个分歧最大的 token 就能追平甚至超过全信号训练。
正文摘录
.jpg)   - 论文标题:Extremely Sparse Supervision Incentivizes Reasoning Ability - 论文链接:https://arxiv.org/abs/2609.04565 - X Post:https://x.com/iampanxu/status/2099151119658475880?s=20 - image ![图片](https://mmbiz.qpic.cn/mmbizpng/5L8bhP5dIqFwrOO8KuTcFR7IE8cKEYkicnjPSgyrJproHRAOl4uPhnbJX75hh1MANsxzqSvj9Zo5cYDTqxOd6Rk8iaviazv7T6RDlC…