行业新闻

亚马逊与杜克大学研究:后训练只保留万分之一 token 梯度即可提升推理能力

研究发现后训练不需要密集 token 监督:每条推理轨迹只留万分之一 token 的梯度就能提升推理能力,挑战了业界对密集信号的默认假设。

后训练通常依赖上亿 token 的密集梯度信号。亚马逊与杜克大学的研究在 OPD(在线策略蒸馏,学生模型生成推理轨迹、教师模型逐 token 给反馈)中只随机保留每条 rollout 一个 token 的梯度,mask 掉其余全部信号,学生模型推理能力仍显著提升,部分配置下仅监督 1-2 个分歧最大的 token 就能追平甚至超过全信号训练。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/c915df39-aa9d-4de2-b940-cfad9ce8c588/041(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqEXkvpQvicgCSSaH6ZnibbXFAhhBn1cl7sxN7XONviceRWIem7Qp0qPlFeSGXqzx7bfYGZN3UUH7f2Zsn0icqZTkVKA6Y26pMc2RyE/640?wxfmt=png&from=appmsgimgIndex=1) - 论文标题:Extremely Sparse Supervision Incentivizes Reasoning Ability - 论文链接:https://arxiv.org/abs/2609.04565 - X Post:https://x.com/iampanxu/status/2099151119658475880?s=20 - image ![图片](https://mmbiz.qpic.cn/mmbizpng/5L8bhP5dIqFwrOO8KuTcFR7IE8cKEYkicnjPSgyrJproHRAOl4uPhnbJX75hh1MANsxzqSvj9Zo5cYDTqxOd6Rk8iaviazv7T6RDlC…

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-10-03原文

相关内容