论文

ThoughtFold: 通过内省偏好学习折叠推理链

ThoughtFold: 通过内省偏好学习折叠推理链

大型推理模型(LRMs)得益于基于可验证奖励的强化学习(RLVR)在思维链(CoTs)上的应用取得了显著进展。然而,由于长CoT自然包含试错过程,而主流RLVR方法选择结果正确的CoT轨迹进行记忆,长CoT中的冗余探索不可避免地被强化,导致LRMs的过度思考问题。 为解决此问题,先前尝试主要给予更短轨迹更高优势,但其学习信号仍基于结果,无法减少长CoT中冗余探索的记忆。为此,我们提出ThoughtFold框架,通过细粒度偏好学习来缓解冗余探索,实现高效推理。ThoughtFold采用内省策略识别每个正确轨迹中的冗余,生成一系列候选子轨迹。基于此谱系,我们引入掩码偏好优化目标,显式惩罚冗余探索,并鼓励模型直接桥接关键推理片段,从而将推理链折叠为更简洁的路径。 大量实验表明,ThoughtFold显著提升了效率。它将DeepSeek-R1-Distill-Qwen-7B的token使用量减少约56%,同时保持最先进的准确性。

论文精读

TL;DR ThoughtFold 通过内省式偏好学习识别并剪除推理链中的冗余探索,将长链“折叠”为简洁路径,在保持准确率的同时减少约 56% 的 token 消耗。

问题

问题背景

大型推理模型 (LRMs) 借助 RLVR 在长链式思维 (CoTs) 上取得显著进展,但长 CoT 中天然包含试错与冗余探索,而主流 RLVR 偏好选择输出正确的完整 CoT 轨迹进行记忆,导致模型在推理时产生大量无效 token,即过思考 (over-thinking) 问题。

现有方法局限

已有工作尝试通过赋予更短轨迹更高学习优势来抑制冗余,但这类信号仍基于最终结果正确性,无法对轨迹内部片段进行精细化评估。关键局限在于:

  • 奖励信号只能区分整条 CoT 的对错,无法定位哪部分探索步骤是冗余的
  • 即使最终正确答案,模型仍会模仿长轨迹中的无用试探,导致推理膨胀
  • 没有机制显式惩罚冗余片段,使得短 CoT 的优势容易被噪声淹没

为什么这个问题难且重要

技术挑战:冗余探索内嵌在正样本内部,缺乏显式标注。要从一条正确但冗长的 CoT 中自动识别哪些步骤是多余的,需要模型具备对自身推理过程的元认知能力,这本质上是一个细粒度偏好学习问题,而非简单的轨迹级奖励赋值。

业界关注度:随着推理模型在数学、代码等场景广泛应用,token 成本与延迟成为部署瓶颈。例如,DeepSeek-R1 系列模型虽强,但单次推理常消耗数千 token,其中大量是自我修正与重复验证。若能裁剪冗余而不损精度,将直接提升 API 经济性和用户体验。

行业类比

该问题类似于代码补全工具中,模型生成包含大量中途调试打印、无效分支的长代码,最终虽能运行但可读性与效率极差;ThoughtFold 相当于一种自动重构工具,将代码折叠为最简逻辑路径。

核心洞察

  • 核心洞察:将结果级奖励重构为过程级偏好学习,直接惩罚冗余推理片段,而非简单偏好短答案。传统 RLVR 仅在最终正确与否层面给予强化,导致模型依然记忆包含试错的长链;ThoughtFold 通过内省策略在同一正确轨迹中自动生成冗余度不同的候选子轨迹,并利用掩码偏好优化强制模型跳过冗余步骤、直连关键推理节点,从而主动“折叠”思维链,避免了短答案偏好可能带来的准确率损失。
  • 核心洞察:无需外部标注的内省式冗余识别使偏好数据构建可扩展。以往工作或依赖人工标注推理步骤优劣,或需额外错误采样构造对比对,成本高且难以泛化。ThoughtFold 提出在单个正确长链内部,基于注意力或 perplexity 等内在信号自动定位冗余片段,生成从完整到精简的谱系,形成天然偏好对。这种自监督的细粒度信号使模型学会区分必要与多余探索,为高效推理提供了新的数据生成范式。

方法

ThoughtFold 旨在缓解大推理模型 (LRMs) 因 RLVR 训练导致的长 CoT 过度思考问题。其核心思路是:不依赖结果级偏好,而是通过 内省式冗余识别掩码偏好优化 对推理链进行“折叠”,去除冗余探索,保留必要推理步骤。

输入

经过 RLVR 训练得到的 正确但冗长的 CoT 轨迹,这些轨迹包含试错、重复验证等冗余片段,但最终产出正确答案。

关键模块

  1. 内省式冗余识别
    对于每条正确轨迹,ThoughtFold 分析其内部推理步骤——例如利用注意力权重、token 重要性或局部连贯性——自动标记冗余部分。它并不依赖人工规则,而是为每条轨迹生成一个 候选子轨迹谱系,即从完整长链到不同精简程度的一系列子轨迹,每个子轨迹都保留核心推理逻辑。

  2. 掩码偏好优化
    利用谱系构造偏好对(如较长轨迹 vs. 折叠后的简短轨迹),然后引入 掩码偏好优化目标。该目标在计算损失时,对冗余片段施加 负向偏好信号,同时正增强化直接衔接关键推理段的行为。具体而言,优化过程会“遮盖”冗余 token 区域的偏好权重,使模型被显式惩罚在推理时重复此类内容,从而学会将推理链折叠为更直接、少跳步的路径。

输出

训练后,模型生成的 CoT 显著缩短(在 DeepSeek-R1-Distill-Qwen-7B 上 token 用量降低约 56%),且准确率保持 SOTA。本质上,模型被训练为直接“桥接”必要推理段,而不再低效地重复试错。

与同类方法的差异

与以往仅给予短轨迹更高奖励(但仍基于结果反馈)的方法不同,ThoughtFold 在 轨迹内部进行细粒度偏好干预,能明确识别和抑制冗余记忆,而非仅依靠长度信号间接推动简洁性,因此更有效地缓解过度思考问题。

实验

实验设计

ThoughtFold 在 DeepSeek-R1-Distill-Qwen-7B 上验证,该模型是典型的长链推理模型。实验沿用主流 RLVR 框架,但引入内省式冗余识别:对每条正确的长 CoT 轨迹,自动生成从完整到极简的候选子轨迹谱系,通过掩码偏好优化 (Masked Preference Optimization) 显式惩罚冗余探索片段,鼓励模型直接连接关键推理环节。训练仍基于可验证奖励信号,但优化目标从结果正确转向过程高效。

关键发现

  • ThoughtFold 将推理 token 消耗降低约 56%,同时保持与 state-of-the-art 相当的准确率。
  • 相较于以往仅通过给短轨迹更高优势值的 outcome-based 方法,ThoughtFold 从根本上抑制了冗余探索的记忆,避免了长链中“试错-纠正”模式的过度强化。
  • 折叠后的推理链更紧凑,但保留了必要推理步骤,未出现明显性能退化,证明内省式偏好学习能有效区分必要推理与冗余探索。

与基线对比

传统 RLVR 鼓励模型复现所有 outcome-correct 的 CoT,包括其中大量无效的试错分支,导致“过度思考”。而 ThoughtFold 通过构建同一轨迹的多种精简版本,让模型学习到从起始状态直接跃迁至关键推理节点的能力,而非机械记忆完整探索过程。这种细粒度偏好信号显著优于单纯按长度加权的 outcome 奖励,从根源上解决了长链推理模型的效率瓶颈。

行业影响

落地场景

ThoughtFold 通过识别和折叠冗余推理步骤,大幅降低长 CoT 的 token 消耗,其对推理效率的提升可直接赋能以下业务线:

  • 智能客服与对话系统:在需要多步逻辑推理的复杂问题解答(如金融产品推荐、技术故障排查)中,模型可更快给出结论,降低延迟与计算成本。
  • 自动化代码审查与生成:长链推理往往包含大量试错,折叠后能直接输出精简的推理路径,适合集成到 CI/CD 代码辅助工具。
  • 教育与考试评估:自动评分或解题助手在保持高准确率的同时,显著减少生成内容长度,提升交互响应速度。

商业价值

核心价值在于 成本控制体验优化 的双重提升:

  • 降本:实验表明在 DeepSeek-R1-Distill-Qwen-7B 上 token 用量减少约 56%,同等准确率下,调用大模型的推理成本近乎减半,对 API 输出计费模式意味着直接成本节省。
  • 提高吞吐与用户体验:更短的推理链缩短了首 token 延迟和端到端响应时间,在实时交互场景中可支撑更高并发,改善用户留存。
  • 环保与合规:降低算力消耗符合企业 ESG 目标,也让资源受限的边缘部署成为可能。

与现有产品/工作流的接口

ThoughtFold 可作为 训练后优化插件 无缝接入现有 RLVR 流程:

  • 在已有 RLVR 训练出的 CoT 数据上,引入 自省式冗余识别Masked Preference Optimization,对同一正确轨迹生成多个候选子轨迹偏好对,无需额外人工标注。
  • 训练目标可与现有 DPO 或 PPO 式对齐阶段结合,只需在偏好建模步骤注入折叠信号,不影响原有验证奖励框架。
  • 推理时无需额外结构变动,直接产生更紧凑的链式输出,与任何标准 LLM 引擎兼容。

具体落地用例

  • 在线教育平台的自动解题服务:数学或编程题常常需要分步推理。应用 ThoughtFold 后,解题过程保留关键推导,跳过试错,学生可即时获得精准讲解,平台则因 token 减少降低 API 开销,在保证准确率的同时支撑更大规模用户请求。
  • 云服务商的 LLM API 产品:将 ThoughtFold 作为内置效率优化选项,提供给客户更经济的“精简推理”模式,吸引价格敏感开发者,同时凭借同精度下 56% 的 token 降幅在市场竞争中建立差异化优势。

局限

  • **自省策略依赖正确轨迹**:ThoughtFold 通过自省识别冗余,要求每个训练样本先有一个正确的完整推理链。当模型在复杂任务上大多输出错误时,可用训练数据急剧减少;且自省过程中对冗余片段的判定可能引入偏差,若模型本身对“必要步骤”理解不准,生成的偏好对会误导优化。
  • **计算开销与可扩展性未充分验证**:构建偏好谱系需要从每个正确 CoT 中枚举子轨迹并比较,训练前期涉及大量模型前向或启发式搜索,论文未给出该方法在更大规模模型(如 70B+)或更长推理链上的计算成本分析,实际落地时训练吞吐可能下降明显。
  • **任务与模型覆盖有限**:实验主要在 DeepSeek-R1-Distill-Qwen-7B 单一模型上进行,未在其它基座模型(如 Llama 系列、Gemma)或不同推理范式(如 tool-use、多模态 CoT)上验证,且未明确说明使用的推理基准是否涵盖多样化领域(数学、代码、常识等),泛化性存疑。
论文Ziyan Liu2026-06-02原文

相关内容