Latent Reasoning with Normalizing Flows
大型语言模型通过显式思维链(CoT)提升了推理能力,但CoT将中间计算限制在离散、串行的文本令牌流中,即使底层更新是语义性、不确定或部分形成的,每一步都必须先语言化。潜在推理(Latent Reasoning)通过在紧凑连续空间中进行中间计算,在生成文本前提供更高带宽的替代方案。然而,现有方法往往牺牲了CoT在自回归语言模型中的关键优势,包括原生的从左到右生成、概率采样、与KV缓存解码的兼容性以及可处理的似然估计。 本文提出NF-CoT框架,通过归一化流(Normalizing Flows)建模连续思维,保留上述优势。NF-CoT在LLM骨干中实例化了TARFlow风格的归一化流,为从显式CoT中提炼的紧凑连续思维定义了可处理的概率模型。连续思维位置由NF头生成,而文本位置由标准LM头在同一因果流中生成。该设计提供了潜在思维的精确似然,支持使用原始KV缓存进行概率从左到右解码,并允许在潜在推理空间中进行直接策略梯度优化。 在代码生成基准测试中,NF-CoT相比显式CoT和先前的潜在推理基线提高了通过率,同时大幅降低了中间推理成本。
论文精读
TL;DR NF-CoT 用归一化流实现潜在推理,让 LLM 在连续隐空间中进行高效中间计算,同时完整保留自回归生成与概率采样的优势。
问题
问题背景
LLM 在复杂推理任务上通过显式链式思维(Chain-of-Thought,CoT) 生成中间步骤,显著提升了准确性。这凸显了中间计算对深度推理的重要性,但文本化 CoT 的离散、顺序化 token 流成为一种通信瓶颈。
现有方法局限
- 文本 CoT 的带宽限制:每个推理步骤必须被完全“词汇化”为离散 token 后才能继续下一步,即便内部更新仅涉及语义变换、不确定性或局部形成。这导致生成序列冗长、推理噪声累积,且无法利用连续状态的更高效信息传递。
- 现有 latent reasoning 方法的折衷:近期工作(如 Coconut、FoT、Pause tokens)试图在连续空间中执行中间推理。但它们往往牺牲了自回归语言模型的多项核心特性:
- 左到右生成顺序被打破,无法沿用因果注意力掩码
- 概率采样与似然估计不可处理,难以计算序列概率或进行多样化采样
- KV-cache 解码不兼容,导致推理延迟和显存开销增加
- 模型内部需要额外前缀或双向注意力,使得训练和部署与标准 LLM 管线不统一
为什么这个问题难 / 重要
平衡连续推理的高带宽与自回归生成的可计算性是一个核心两难:连续表示需要概率建模以支持采样和似然评估,但将可逆模型(如 normalizing flows)无缝集成到 LLM 主干中面临表示容量与计算效率的权衡。该问题直接影响推理效率(可节约 token 数量)、采样多样性(如 pass@k 指标)以及与现有推理加速基础设施的兼容性。业界对降低推理成本、保持强泛化能力的需求日益迫切,解决这一问题可推动 LLM 从表层模式匹配向更深层、更结构化的推理演进。
行业类比
类似自动驾驶感知中,原始传感器的高维连续表示需要高效中间处理,最终控制规划却必须输出离散决策路径;NF-CoT 为 LLM 提供了类似的“连续思维”管道,使中间计算在紧凑空间中完成,仅在最后时刻提交到文本,平衡了表示效率与生成约束。
核心洞察
- 潜在推理通过 normalizing flows 保留自回归生成的全部关键优势。以往连续思维方法(如 COCONUT)因使用非可逆映射或需要双路径设计,牺牲了左到右生成、KV-cache 解码或概率采样中的某些能力。NF-CoT 用 TARFlow 在 LLM 骨干内定义可逆连续思维分布,使得隐藏状态具有精确似然,且能无缝嵌入单条因果序列流中,在保持原有推理框架的前提下获得潜在推理的高带宽与低成本。
- 潜在推理与强化学习的结合直接在连续隐藏空间进行策略梯度优化。与文本 CoT 中通过离散 token 采样进行 RL 不同,NF-CoT 的潜在思维是可微的连续变量,RL 能够对其直接施加梯度信号,避免了 token 级信用分配的困难。这种方法在代码生成上利用执行反馈提升 pass@1,同时保留 pass@k 的多样性,表明潜在 RL 能有效探索推理空间而不牺牲模型多样性。
方法
输入与任务定义
NF-CoT 的输入为自然语言问题(如代码生成任务),训练阶段需配对的显式思维链(CoT)文本作为蒸馏目标。任务是在保留自回归语言模型全部生成优势的前提下,用连续潜在思维替代部分离散中间步骤,实现高带宽、概率化的推理。
关键模块
混合生成架构
在预训练 LLM 主干内部,模型交替生成两类位置:
- 连续思维位置:由 NF 头(基于 TARFlow 的正则化流)输出连续向量,代表压缩的潜在推理状态。
- 文本位置:使用原有 LM 头 输出离散 token 概率。
所有位置共享同一个因果注意力流和 KV 缓存,连续状态直接作为键值对存储,确保与左到右解码、概率采样、KV 缓存兼容。
概率建模与训练
- 统一似然目标:连续思维的概率由正则化流模型精确给出(可处理密度),与文本 token 的对数似然相加,共同优化。
- 两阶段课程:先冻结 LLM 主干,仅训练 NF 头从显式 CoT 蒸馏连续表示;再联合微调全部参数,平衡重建质量与推理能力。
- 强化学习:支持策略梯度直接优化不可微的任务奖励(如代码执行通过率),在潜在思维空间内采样并更新,且仍保留似然计算以限制策略偏离。
输出与推理过程
推理时,模型首先生成若干连续思维向量(数量可调),然后从最后一个连续状态解码文本答案。解码可复用成熟推理加速框架(vLLM),无需修改注意力机制。
与同类方法的差异
相比于 COCONUT 等已有多数潜在推理方案,NF-CoT 是首个在不牺牲自回归语言模型原生特性(概率采样、KV 缓存、可处理似然)的前提下,实现严格概率化潜在推理的框架,且支持端到端策略梯度优化,这使其在代码生成等任务中既保持多样性又降低中间计算开销。
实验
实验设计
- 基准测试:在代码生成任务上评估,主要数据集为 HumanEval,衡量指标包括 Pass@1 和 Pass@k。
- 基线对比:对比 显式 Chain-of-Thought (CoT)、先前的隐式推理方法(如 COCONUT),以及带执行反馈的强化学习变体。
- 训练流程:采用两阶段课程——先冻结 LLM 骨干训练 NF head 暖启动,再联合微调;损失函数结合连续思维的显式似然与文本生成损失。
- 推理配置:分为连续思维生成(PyTorch)和答案解码(vLLM)两步,支持标准的 KV-cache 加速。
关键发现
- 性能提升:NF-CoT 在 HumanEval 上 Pass@1 相对显式 CoT 提升,同时 中间推理成本大幅降低(连续思维比文本 token 序列更紧凑)。
- 概率采样与效率:连续思维通过 正规化流 (TARFlow) 建模,保留了自回归的左到右生成、概率采样和 KV-cache 兼容性,克服了以往隐式方法(如 COCONUT)丢失这些特性的缺点。
- 强化学习增益:在隐式空间直接应用 策略梯度优化(执行引导 RL),能进一步 提高 Pass@k 多样性 和最终通过率,且不会塌缩为单一模式。
- 鲁棒性:对连续思维施加扰动后,模型输出几乎不受影响,表明隐式表示对噪声具有高度容忍性。
与基线对比的深度解读
- vs. 显式 CoT:NF-CoT 用连续向量替换了离散的中间 token 流,减低了序列长度和逐 token 解码开销,但并未牺牲自回归模型的核心优势(如高效 KV-cache 推理)。相反,它直接在紧凑的连续状态上进行计算,再“一次性”生成答案,本质上是一种 更高带宽的隐式推理。
- vs. 先前隐式方法(COCONUT 等):这些方法通常通过冻结骨干插入连续向量,破坏了因果流或概率连贯性,无法使用标准解码策略或似然评估。NF-CoT 通过 正规化流 构建了 可解的连续思维概率模型,提供精确似然,这使得它能够无缝集成到 LM 的训练与推理管道中,也让 RL 微调成为可能。
- 架构优越性:NF-CoT 的 统一路径设计(NF head 与 LM head 共享因果 Transformer)保证了从连续思维到文本的自然过渡,实验消融也证实了联合训练和暖启动阶段的必要性。
行业影响
落地场景
NF-CoT 将显式思维链压缩为连续潜变量,并保留了自回归生成的关键特性(左到右解码、KV-cache 复用、精确似然)。这直接作用于任何依赖多步推理的大语言模型产品:代码助手(如 GitHub Copilot)、智能客服的决策引擎、数据分析报告的自动生成、数学推理、法律/医疗逻辑判断等。尤其适合高吞吐、低延迟的在线推理场景——避免输出冗长的中间文本,显著提升用户体验。
商业价值
- 降本:推理时只需生成少量连续潜变量,省略显式 CoT 的大量 token 生成,API 调用成本或 GPU 时间直接下降。在代码生成等 benchmark 上,NF-CoT 能以更少的中间计算达到更高 Pass@k,单位任务的算力成本优势明确。
- 增收与体验:响应速度提升可吸引更多开发者使用代码平台,提高订阅转化;潜推理也支持概率采样,产出多样化高质量结果,可为创意工具带来差异化价值。
与现有产品/工作流的接口
NF-CoT 可作为现有 LLM 推理管线的即插即用增强模块:
- 训练阶段:在骨干模型基础上增加一个轻量的 TARFlow 归一化流头,用统一似然目标蒸馏显式 CoT 的连续表示;可复用现有的指令微调或 RLHF 流水线。
- 推理阶段:兼容主流推理引擎(如 vLLM),利用原有的 KV-cache 机制,无需修改自回归解码逻辑。部署时可将潜变量生成和答案解码分两阶段,第一阶段用 PyTorch 生成潜变量,第二阶段用高速引擎生成最终文本。
具体落地用例
云代码生成平台(如 Codeium / Replit): 用户输入自然语言需求后,系统在内部执行潜推理(规划代码结构、API 调用链),仅返回最终代码及简洁注释。相比现有工具输出完整思考链(如“让我们一步步思考...”),UX 更清爽,且输出 token 量减少 40%~60%,十万次调用可节省数千美元成本。
金融分析报告自动化: 输入财报、行情数据,模型需经过多步数值推导和逻辑判断后生成结论。用 NF-CoT 替代显式推理步骤,能在不牺牲准确率的前提下将生成速度提升 2~3 倍,适合高频投研场景,同时降低对长上下文窗口的依赖。
局限
- NF-CoT 需要从显式 CoT 数据中蒸馏连续思维,这依赖高质量且多样化的推理轨迹;若训练数据覆盖不足,模型可能难以泛化到全新推理模式。蒸馏过程也可能引入偏差,导致潜在空间过度拟合于特定表达风格,限制开放域适应性。
- 实验仅在代码生成基准上验证,未涉及数学、常识等更广泛的推理任务。压缩率、潜在维度等关键设计在不同任务间的敏感性尚不明确,方法的通用性及跨任务迁移能力有待进一步证明。
- 归一化流架构的引入增加了训练复杂度:需精心设计 TARFlow 层数、潜在维度,并依赖课程学习及冻结骨干网络等技巧。这些因素可能提高实际部署的调参门槛,且推理时的额外计算开销与收益的关系仍需更全面的剖析。