ThoughtFold: 通过内省偏好学习折叠推理链
大型推理模型(LRMs)得益于基于可验证奖励的强化学习(RLVR)在思维链(CoTs)上的应用取得了显著进展。然而,由于长CoT自然包含试错过程,而主流RLVR方法选择结果正确的CoT轨迹进行记忆,长CoT中的冗余探索不可避免地被强化,导致LRMs的过度思考问题。 为解决此问题,先前尝试主要给予更短轨迹更高优势,但其学习信号仍基于结果,无法减少长CoT中冗余探索的记忆。为此,我们提出ThoughtFold框架,通过细粒度偏好学习来缓解冗余探索,实现高效推理。ThoughtFold采用内省策略识别每个正确轨迹中的冗余,生成一系列候选子轨迹。基于此谱系,我们引入掩码偏好优化目标,显式惩罚冗余探索,并鼓励模型直接桥接关键推理片段,从而将推理链折叠为更简洁的路径。 大量实验表明,ThoughtFold显著提升了效率。它将DeepSeek-R1-Distill-Qwen-7B的token使用量减少约56%,同时保持最先进的准确性。
论文精读
TL;DR ThoughtFold 通过内省式偏好学习识别并剪除推理链中的冗余探索,将长链“折叠”为简洁路径,在保持准确率的同时减少约 56% 的 token 消耗。
问题
问题背景
大型推理模型 (LRMs) 借助 RLVR 在长链式思维 (CoTs) 上取得显著进展,但长 CoT 中天然包含试错与冗余探索,而主流 RLVR 偏好选择输出正确的完整 CoT 轨迹进行记忆,导致模型在推理时产生大量无效 token,即过思考 (over-thinking) 问题。
现有方法局限
已有工作尝试通过赋予更短轨迹更高学习优势来抑制冗余,但这类信号仍基于最终结果正确性,无法对轨迹内部片段进行精细化评估。关键局限在于:
- 奖励信号只能区分整条 CoT 的对错,无法定位哪部分探索步骤是冗余的
- 即使最终正确答案,模型仍会模仿长轨迹中的无用试探,导致推理膨胀
- 没有机制显式惩罚冗余片段,使得短 CoT 的优势容易被噪声淹没
为什么这个问题难且重要
技术挑战:冗余探索内嵌在正样本内部,缺乏显式标注。要从一条正确但冗长的 CoT 中自动识别哪些步骤是多余的,需要模型具备对自身推理过程的元认知能力,这本质上是一个细粒度偏好学习问题,而非简单的轨迹级奖励赋值。
业界关注度:随着推理模型在数学、代码等场景广泛应用,token 成本与延迟成为部署瓶颈。例如,DeepSeek-R1 系列模型虽强,但单次推理常消耗数千 token,其中大量是自我修正与重复验证。若能裁剪冗余而不损精度,将直接提升 API 经济性和用户体验。
行业类比
该问题类似于代码补全工具中,模型生成包含大量中途调试打印、无效分支的长代码,最终虽能运行但可读性与效率极差;ThoughtFold 相当于一种自动重构工具,将代码折叠为最简逻辑路径。
核心洞察
- 核心洞察:将结果级奖励重构为过程级偏好学习,直接惩罚冗余推理片段,而非简单偏好短答案。传统 RLVR 仅在最终正确与否层面给予强化,导致模型依然记忆包含试错的长链;ThoughtFold 通过内省策略在同一正确轨迹中自动生成冗余度不同的候选子轨迹,并利用掩码偏好优化强制模型跳过冗余步骤、直连关键推理节点,从而主动“折叠”思维链,避免了短答案偏好可能带来的准确率损失。
- 核心洞察:无需外部标注的内省式冗余识别使偏好数据构建可扩展。以往工作或依赖人工标注推理步骤优劣,或需额外错误采样构造对比对,成本高且难以泛化。ThoughtFold 提出在单个正确长链内部,基于注意力或 perplexity 等内在信号自动定位冗余片段,生成从完整到精简的谱系,形成天然偏好对。这种自监督的细粒度信号使模型学会区分必要与多余探索,为高效推理提供了新的数据生成范式。
方法
ThoughtFold 旨在缓解大推理模型 (LRMs) 因 RLVR 训练导致的长 CoT 过度思考问题。其核心思路是:不依赖结果级偏好,而是通过 内省式冗余识别 与 掩码偏好优化 对推理链进行“折叠”,去除冗余探索,保留必要推理步骤。
输入
经过 RLVR 训练得到的 正确但冗长的 CoT 轨迹,这些轨迹包含试错、重复验证等冗余片段,但最终产出正确答案。
关键模块
内省式冗余识别
对于每条正确轨迹,ThoughtFold 分析其内部推理步骤——例如利用注意力权重、token 重要性或局部连贯性——自动标记冗余部分。它并不依赖人工规则,而是为每条轨迹生成一个 候选子轨迹谱系,即从完整长链到不同精简程度的一系列子轨迹,每个子轨迹都保留核心推理逻辑。掩码偏好优化
利用谱系构造偏好对(如较长轨迹 vs. 折叠后的简短轨迹),然后引入 掩码偏好优化目标。该目标在计算损失时,对冗余片段施加 负向偏好信号,同时正增强化直接衔接关键推理段的行为。具体而言,优化过程会“遮盖”冗余 token 区域的偏好权重,使模型被显式惩罚在推理时重复此类内容,从而学会将推理链折叠为更直接、少跳步的路径。
输出
训练后,模型生成的 CoT 显著缩短(在 DeepSeek-R1-Distill-Qwen-7B 上 token 用量降低约 56%),且准确率保持 SOTA。本质上,模型被训练为直接“桥接”必要推理段,而不再低效地重复试错。
与同类方法的差异
与以往仅给予短轨迹更高奖励(但仍基于结果反馈)的方法不同,ThoughtFold 在 轨迹内部进行细粒度偏好干预,能明确识别和抑制冗余记忆,而非仅依靠长度信号间接推动简洁性,因此更有效地缓解过度思考问题。
实验
实验设计
ThoughtFold 在 DeepSeek-R1-Distill-Qwen-7B 上验证,该模型是典型的长链推理模型。实验沿用主流 RLVR 框架,但引入内省式冗余识别:对每条正确的长 CoT 轨迹,自动生成从完整到极简的候选子轨迹谱系,通过掩码偏好优化 (Masked Preference Optimization) 显式惩罚冗余探索片段,鼓励模型直接连接关键推理环节。训练仍基于可验证奖励信号,但优化目标从结果正确转向过程高效。
关键发现
- ThoughtFold 将推理 token 消耗降低约 56%,同时保持与 state-of-the-art 相当的准确率。
- 相较于以往仅通过给短轨迹更高优势值的 outcome-based 方法,ThoughtFold 从根本上抑制了冗余探索的记忆,避免了长链中“试错-纠正”模式的过度强化。
- 折叠后的推理链更紧凑,但保留了必要推理步骤,未出现明显性能退化,证明内省式偏好学习能有效区分必要推理与冗余探索。
与基线对比
传统 RLVR 鼓励模型复现所有 outcome-correct 的 CoT,包括其中大量无效的试错分支,导致“过度思考”。而 ThoughtFold 通过构建同一轨迹的多种精简版本,让模型学习到从起始状态直接跃迁至关键推理节点的能力,而非机械记忆完整探索过程。这种细粒度偏好信号显著优于单纯按长度加权的 outcome 奖励,从根源上解决了长链推理模型的效率瓶颈。
行业影响
落地场景
ThoughtFold 通过识别和折叠冗余推理步骤,大幅降低长 CoT 的 token 消耗,其对推理效率的提升可直接赋能以下业务线:
- 智能客服与对话系统:在需要多步逻辑推理的复杂问题解答(如金融产品推荐、技术故障排查)中,模型可更快给出结论,降低延迟与计算成本。
- 自动化代码审查与生成:长链推理往往包含大量试错,折叠后能直接输出精简的推理路径,适合集成到 CI/CD 代码辅助工具。
- 教育与考试评估:自动评分或解题助手在保持高准确率的同时,显著减少生成内容长度,提升交互响应速度。
商业价值
核心价值在于 成本控制 与 体验优化 的双重提升:
- 降本:实验表明在 DeepSeek-R1-Distill-Qwen-7B 上 token 用量减少约 56%,同等准确率下,调用大模型的推理成本近乎减半,对 API 输出计费模式意味着直接成本节省。
- 提高吞吐与用户体验:更短的推理链缩短了首 token 延迟和端到端响应时间,在实时交互场景中可支撑更高并发,改善用户留存。
- 环保与合规:降低算力消耗符合企业 ESG 目标,也让资源受限的边缘部署成为可能。
与现有产品/工作流的接口
ThoughtFold 可作为 训练后优化插件 无缝接入现有 RLVR 流程:
- 在已有 RLVR 训练出的 CoT 数据上,引入 自省式冗余识别 与 Masked Preference Optimization,对同一正确轨迹生成多个候选子轨迹偏好对,无需额外人工标注。
- 训练目标可与现有 DPO 或 PPO 式对齐阶段结合,只需在偏好建模步骤注入折叠信号,不影响原有验证奖励框架。
- 推理时无需额外结构变动,直接产生更紧凑的链式输出,与任何标准 LLM 引擎兼容。
具体落地用例
- 在线教育平台的自动解题服务:数学或编程题常常需要分步推理。应用 ThoughtFold 后,解题过程保留关键推导,跳过试错,学生可即时获得精准讲解,平台则因 token 减少降低 API 开销,在保证准确率的同时支撑更大规模用户请求。
- 云服务商的 LLM API 产品:将 ThoughtFold 作为内置效率优化选项,提供给客户更经济的“精简推理”模式,吸引价格敏感开发者,同时凭借同精度下 56% 的 token 降幅在市场竞争中建立差异化优势。
局限
- **自省策略依赖正确轨迹**:ThoughtFold 通过自省识别冗余,要求每个训练样本先有一个正确的完整推理链。当模型在复杂任务上大多输出错误时,可用训练数据急剧减少;且自省过程中对冗余片段的判定可能引入偏差,若模型本身对“必要步骤”理解不准,生成的偏好对会误导优化。
- **计算开销与可扩展性未充分验证**:构建偏好谱系需要从每个正确 CoT 中枚举子轨迹并比较,训练前期涉及大量模型前向或启发式搜索,论文未给出该方法在更大规模模型(如 70B+)或更长推理链上的计算成本分析,实际落地时训练吞吐可能下降明显。
- **任务与模型覆盖有限**:实验主要在 DeepSeek-R1-Distill-Qwen-7B 单一模型上进行,未在其它基座模型(如 Llama 系列、Gemma)或不同推理范式(如 tool-use、多模态 CoT)上验证,且未明确说明使用的推理基准是否涵盖多样化领域(数学、代码、常识等),泛化性存疑。