重新审视后训练中的完整推理轨迹
大型语言模型(LLMs)常通过预先收集的推理轨迹进行后训练以提升推理能力。这些轨迹因路径复杂交织而往往很长,其中还包含通向答案过程中的弯路。然而,LLMs 在后训练(如 监督微调(SFT))中是否真的能从学习完整轨迹中获益,一直缺乏深入探究。 我们从初步研究出发,发现完整轨迹带来的收益有限,而部分轨迹即使在重度截断下依然有效。我们通过基于注意力的分析和受控的 token 移除实验,对推理轨迹中的冗余性进行了剖析,二者均表明中间 token 对最终推理质量的贡献极小。这表明,避免冗余信息可能让 LLMs 在已知轨迹端点的情况下,从内部知识中推断出缺失步骤,从而在内部构造出连贯的替代路径。 此外,我们展示出使用端点训练 LLMs 会带来推理行为上的一致变化,并且对基于强化学习 或 同策略蒸馏 的后训练方法同样有益。这些发现凸显了重新审视完整推理轨迹的必要性。代码见 https://github.com/naver-ai/revisiting-trace。
论文精读
TL;DR 本研究发现 LLM 后训练使用的完整推理轨迹存在大量冗余,仅利用截断后的端点 token 即可在 SFT / RL 等任务中保持甚至提升性能,挑战了完整轨迹必要的假设。
问题
问题背景
当前 LLM 后训练(如 SFT / RLHF)依赖预收集的推理轨迹提升复杂推理能力。完整轨迹被视为标准训练信号。
现有方法局限
- 完整轨迹通常很长,包含交织路径与偏离答案的绕路步骤。
- 完整轨迹训练收益有限:初步研究表明,完全轨迹相比部分轨迹(甚至重度截断)优势不明显。
- 中间 token 对最终推理质量贡献极小,冗余信息反而可能干扰模型关注关键步骤,增加训练成本与样本噪声。
- 现有方法缺乏对轨迹内部冗余的量化分析,默认整段轨迹均需学习。
为什么这个问题难/重要
- 技术上,如何自动识别并去除冗余 token 涉及注意力模式分析与受控 token 删除实验,可解释性与优化目标难以统一。
- 推理轨迹的价值可能主要体现在端点(问题与答案),模型可借助内部知识推断缺失步骤,但这一机制尚未完全理解。
- 业界关注提高数据效率:若端点训练即可达到相近效果,可大幅降低推理数据采集、清洗与存储成本,并简化 RL 与蒸馏流程。
行业类比
类似代码生成任务中,仅提供函数签名与测试用例(端点)即可让模型自推断算法实现,免去人工编写完整参考代码。
核心洞察
- 完整推理轨迹中的中间 token 对最终推理质量贡献极小,使用端点(问题与最终答案)进行训练即可获得与完整轨迹接近甚至更好的效果。这一发现挑战了传统后训练中依赖完整 chain-of-thought 数据的假设,提示数据构造可以大幅丢弃冗余步骤,从而降低采集与存储成本。
- 模型在已知轨迹端点的情况下能够利用内部知识自行推断缺失的中间推理步骤,这意味着后训练不必显式教授完整推理路径。相比已有工作聚焦于压缩或蒸馏完整轨迹,本文从冗余分析出发,验证了直接使用端点训练的可行性,并证明该方法对监督微调、强化学习和 on-policy distillation 均有增益,为推理数据高效利用提供了新范式。
方法
输入与目标
方法挑战“完整推理轨迹有益”的假设,输入从完整推理轨迹简化为 端点对(query 与 final answer),或经过大幅截断的部分轨迹。训练目标是让模型从已知端点出发,利用内部知识隐式推断中间步骤。
关键模块:冗余分析与训练策略
- 冗余分析:通过注意力机制分析中间 token 对最终答案的贡献,并进行受控 token 移除实验,证明中间 token 的注意力权重和移除影响都很小,即推理轨迹中存在大量冗余。
- 端点驱动的 SFT:在监督微调中,仅使用端点作为监督信号,损失函数只作用于答案部分(或使用特殊标记促使模型直接生成答案),模型需在缺乏显式中间步骤的情况下完成推理。这迫使模型调用预训练阶段学到的知识,自行填补推理链。
- 扩展至 RL 与 on-policy distillation:在强化学习中,奖励信号只基于最终答案正确性,不奖励过程;在 on-policy distillation 中,教师模型也仅提供端点信息,从而减少学生对冗余过程的模仿。
输出与效果
模型在数学、常识等推理任务上保持或提升准确率,同时训练序列长度大幅缩短,推理行为更简洁。对实际工程而言,可显著降低数据标注与训练计算开销。
与同类方法的差异点:不同于依赖完整推理轨迹的 SFT / RL 方法,本方法通过去除冗余中间 token,让模型从端点隐式学习推理,而非显式模仿过长路径。
实验
实验设计
作者以预收集的推理轨迹为切入口,通过 监督微调(SFT) 与 强化学习(RL) 两条主线对比 完整轨迹 与 端点截断轨迹 的训练效果。先在多个数学推理基准上进行 pilot study,比较全轨迹与部分轨迹的性能;随后用 注意力分析 和受控 token 移除 实验量化中间 token 对最终推理质量的影响;最后在 RL 和 on-policy distillation 框架下验证仅用端点(问题-答案)训练的效果。具体数据集与算力未在摘要中披露,代码见 revisiting-trace。
关键发现
- 完整轨迹收益有限:即便完整保留推理过程,模型最终推理质量的提升幅度并不显著。
- 部分轨迹在重度截断下仍有效:截断至仅保留问题与最终答案(端点)时,模型依然可以借助内部知识补全缺失步骤,得出合理中间推理。
- 中间 token 冗余度高:注意力模式与逐 token 移除实验表明,轨迹中大量 token 对最终输出贡献极小。
- 端点训练改变推理行为:使用端点训练后,模型生成的推理链长度与风格发生系统性变化,同时提升 RL 与 on-policy distillation 的效果。
与基线对比解读
相较于传统 SFT 直接学习完整推理轨迹,本工作指出一条更低成本、更抗噪声的训练路径:以 端点(问题-答案对) 替代完整 trace,可减少序列长度、降低冗余 token 的干扰,并让模型利用预训练知识进行隐式推断。对实际工程的启示包括:
- 数据侧可优先清洗/压缩长推理轨迹,保留首尾关键信息;
- 训练侧在 RL 或蒸馏流程中引入 endpoint-only 样本,可降低 token 预算;
- 评估侧需关注模型是否在缺失中间步骤时仍能保持可解释性。
这一思路与部分“跳过冗余推理步骤”的方法有相似动机,但更系统地论证了端点在多种 post-training 范式下的普适性。
行业影响
落地场景
LLM 后训练中 完整推理轨迹 往往包含大量冗余中间步骤。本文发现仅用 轨迹端点(问题与最终答案)做 SFT 即可接近甚至达到完整轨迹的效果,这直接适用于需要多步推理的工业场景:
- 电商智能客服:订单纠纷、退换货政策判断等需要逐步推理,但无需暴露中间推导。用端点训练可简化数据标注,模型推理时输出更简洁的答案。
- 在线教育解题:数学题分步讲解可保留关键步骤,但训练时不必要求每步 token 完整,端点监督可降低数据采集成本。
商业价值
- 降本:减少推理轨迹的标注与存储成本,训练数据可从数万条完整链式思维缩减为
(query, answer)二元组。 - 增效:模型生成时跳过冗余中间 token,降低首字延迟与每请求 token 成本,提升吞吐。
- 体验:在需要确定答案而非展示过程的场景(如客服自动应答),直接输出结论可提高用户满意度,同时保持推理准确率。
与现有工作流接口
该结论可无缝嵌入主流 SFT → RLHF/DPO 管道:
- 数据侧:将现有完整轨迹数据按问题-答案端点抽取,生成轻量 SFT 数据集;保留少量完整轨迹用于需要逐步解释的场景。
- 训练侧:端点监督 SFT 可作为 强化学习 或 on-policy distillation 的初始化策略,减少策略探索中的冗余 token。
- 推理侧:部署时可以通过系统提示或解码约束引导模型跳过中间推理,直接输出最终答案,官方实现见 GitHub。
局限
- 论文的实验主要基于数学或逻辑推理类数据集,端点定义清晰(问题-答案对),但对于需要多步推理且中间步骤有独立价值的任务(如代码生成、多跳问答),直接训练模型仅从端点学习可能损失关键中间状态,泛化性有待验证。此外,端点训练在复杂推理任务上可能受到任务格式限制,需要额外的提示工程或结构设计。
- 虽然注意力分析和 token 移除研究显示中间 token 贡献小,但这可能是模型规模或训练数据分布导致的偏置;当模型容量更大或推理链更长时,中间 token 可能承担隐式计算或状态维护角色,而当前分析未充分覆盖。与完整轨迹训练相比,仅用端点训练可能削弱模型的可解释性和错误定位能力,因为模型在推理过程中不再显式生成中间步骤,人类难以检查推理正确性;在需要逐步验证或交互式推理的场景中,该方法实用性受限。
- 论文在 RL 和 on-policy distillation 上的改进幅度可能有限,且未与更广泛的轨迹压缩方法(如跳过步骤、使用摘要等)进行系统对比;此外,代码 stars 较少(2),说明社区尚未充分验证其有效性与可复现性。实验可能受限于特定基座模型或训练规模,结论是否适用于不同架构(如 MoE、超长上下文模型)仍需后续工作确认。