论文

Transformer 过早停止思考,一个微型 LoRA 即可修复

Transformer 过早停止思考,一个微型 LoRA 即可修复

预训练 Transformer 在上下文中追踪引用时,只用到自身深度的极小部分。13 个 base 模型 只能稳定跟随 1.4–3.6 行,额外增加预训练循环也几乎无增益。 方法上,冻结全部模型权重,仅在某一早期层训练一个 rank-8 的任务 LoRA,即可扩展这一计算。 实验中,Qwen3-8B 在 24 行链上从 15.5% 提升到 99% 精确准确率;训练更久的 LoRA 可达 50 行。Ouro-1.4B 在四轮循环后达 60 行,八轮后至少 160 行。该 LoRA 启动了一场「接力」:程序行通过一小段中间层传递自身的链身份,冻结的 head 逐级向上读取更远的行;移除 parent-line 注意力 则接力中断。冻结模型测量可在四个留出模型中的三个里,于容差内定位最后一个有效干预层。任务专用 LoRA 同样能提升 MuSiQue。 因此,默认答案低估了通过一次微小编辑即可获得的计算能力。代码与交互 demo 见 https://lunamos.github.io/stop-thinking-too-early/

论文精读

TL;DR 预训练 Transformer 在上下文引用链任务中只利用浅层计算就过早停止,但一个秩-8 LoRA 在早期层介入即可解锁深层连续推理能力,使 Qwen3-8B 从 15.5% 提升至 99% 准确率,揭示模型默认低估了可通过微小编辑获得的计算能力。

问题

问题背景

当前 LLM 在长上下文、多跳推理与引用跟随任务上的表现仍受限于有效计算深度。Transformer 虽然在结构上具有多层,但实际信息流常未充分贯穿全部深度。

现有方法局限

默认预训练 Transformer 在参考链任务中只使用了很小一部分深度。论文测量 13 个基础模型 仅能可靠跟随 1.4–3.6 行 引用链,即使增加预训练循环,有效深度也几乎不提升。传统方案如加深网络、全参数微调或重复输入,要么计算增益低,要么成本高且易遗忘。瓶颈在于模型没有在正确中间层形成 链身份接力,导致早期层读完指针后,深层无法继续展开递归计算。

为什么这个问题难/重要

难点在于定位并激活正确的计算位置:需要判断哪一层是瓶颈,再用最小干预让中间表示传递到更远层,这涉及注意力模式、表示可读性与循环时机,很难仅靠提示工程解决。与此同时,业界高度关注低秩适配是否能用极少参数解锁隐藏推理能力,以及在推理阶段通过重复某些层来提升多跳问答准确率,而不必重训大模型。

行业类比

类似在 RAG 或多跳问答系统中,当检索引用链很长时,模型若只读前几个链接就下结论,准确率会急剧下降;一个微小的 LoRA 适配器 可以让模型“多想几步”,且几乎不增加部署成本。

核心洞察

  • 预训练 transformer 在引用链任务上默认只执行极浅层的指针读取,而一个插入在早期层的 rank-8 LoRA 就能激活深层接力计算,将 24 行链准确率从 15.5% 提升到 99%。这揭示模型拥有完成长程依赖的潜在容量,但默认前向路径过早终止,并非缺乏能力。与常规全参数微调或增加深度不同,该 LoRA 只修改单层 8 个秩,冻结其余所有权重,说明瓶颈在计算流程而非参数储备。
  • 冻结模型的内部测量可以预测 LoRA 的最佳插入位置,在四个留出模型中的三个上成功定位到容差范围内的最后一个有效干预层。这个发现把干预从经验试错变成可诊断的工程步骤:先测量各层携带的链身份信息衰减,再在信息尚存的最后层之前放置轻量适配器。与随机搜索或逐层扫描相比,该方法降低计算成本,并提示未来可对更多任务建立类似的“层敏感度地图”。

方法

输入与任务

模型接收一段包含多层引用链的上下文,每行形如 name: value,其中 value 可能是另一个 name 或最终标量。查询要求追踪链尾,例如给定 a: 1, b: a, c: b,问 c = ?。评测指标为 exact match 准确率。

关键模块

  1. 冻结的基座模型:使用任意预训练 Transformer,全部原始权重保持冻结。
  2. 早期层 LoRA 注入:在某一选定的早期层(如第 3 层)旁路插入秩为 8 的 LoRA 适配器,仅训练该适配器的低秩矩阵。
  3. 训练目标:在参考链任务上最小化最终答案 token 的交叉熵损失,仅更新 LoRA 参数,使模型学会在内部传递链身份信息。
  4. 可选推理循环:将同一 LoRA 层的输出重新输入到该层,重复若干次,可进一步延伸有效计算深度(例如 Qwen3-8B 从 24 行提升到 50 行)。

输出与机制

模型生成查询对应的最终值。机制上,LoRA 启动了一个中继:链上的每一行在少数几层内将自身链身份向前传递,冻结的注意力头逐步读取更远的祖先信息,移除父行注意力会中断该中继。

与其他方法差异

不同于思维链提示或全参数微调,本方法仅用一个秩为 8 的 LoRA 适配器在冻结模型内部激活原本未充分利用的浅层计算,以极低参数成本将有效推理深度扩展数倍。

实验

实验设计

  • 构建参考链任务(reference chains):由逐行指向前文的指针组成,让模型从链尾解析到链头并提取答案。
  • 对 13 个基础模型进行零样本测量,计算每个模型能可靠跟踪的链长。
  • 在单个早期层插入 rank-8 LoRA,冻结全部预训练权重,训练模型在 24 行链上作答,并逐步扩展链长。
  • 对 Ouro-1.4B 进行循环(loop)实验:重复执行相同的中间层计算,测试循环次数对链长的影响。
  • 利用冻结模型测量预测最佳干预层位置,并在 MuSiQue 多跳问答上验证迁移性。

关键发现

  • 基础模型普遍过早停止思考:13 个模型只能可靠跟踪 1.4–3.6 行,增加深度或预训练循环几乎无帮助。
  • 一个 rank-8 LoRA 在早期层插入后,Qwen3-8B 在 24 行链上的准确率从 15.5% 跃升至 99%;更长训练的 LoRA 能处理 50 行。
  • Ouro-1.4B 通过循环扩展计算:4 次循环达到 60 行,8 次循环至少 160 行。
  • LoRA 启动了一个中继机制:链身份在中间层短区间内传递,注意力随中继推进而读取更远的祖先节点;移除父行注意力会中断中继。
  • 冻结模型测量能够在四个留出模型中的三个,定位出容忍范围内的最后有效干预层。
  • 任务特定 LoRA 同样提升 MuSiQue 多跳问答性能。

基线对比与解读

  • 默认答案严重低估了模型可访问的计算能力:仅改动一个 8 rank 的低秩矩阵,即可解锁远超基础表现的深层推理,这表明大规模预训练模型中存在未被利用的可复用电路,而非能力缺失。
  • 与依赖增加模型深度或微调全部参数的方法相比,本文方案冻结全部权重,只需在单层插入 LoRA 或循环重算若干中间层,训练和推理成本极低;这为在资源受限环境下提升长程推理提供了新路径。
  • 与同类工作(如 scratchpad、chain-of-thought 等通过提示引导推理)不同,该 LoRA 干预直接修改内部计算,不消耗额外上下文长度,且能通过测量定位自动找到最佳干预层。

行业影响

落地场景

论文表明,预训练 Transformer 在长上下文引用追踪中仅使用少量深度,而一个 rank-8 LoRA 放置在早期层即可大幅解锁后续层的计算,使模型能追踪更长的引用链(Qwen3-8B 从 15.5% 提升到 99% 准确率)。这直接适用于多跳问答、复杂指令跟随、RAG 多文档关联等需要长距离依赖建模的任务。

典型落地场景:

  • 企业知识库问答:用户问“根据合同 A 的条款 B,关联的子公司 C 的合规风险是什么?”模型需要连续跳跃多个引用,LoRA 修复可显著提升准确率。
  • 电商智能客服:订单查询涉及订单→商品→库存→物流的多跳链接,传统模型可能截断在前几步,加 LoRA 后可连续追踪。

商业价值

  • 降本:LoRA 参数量远小于全量微调,训练和存储成本极低;无需重新预训练或大模型重训。
  • 增收:高准确率使复杂任务自动化成为可能,减少人工审核,提升高价值业务吞吐;例如金融合规审查中,可自动完成多实体关联分析。
  • 体验提升:模型回答更可靠,降低错误率,增强用户信任。

与现有接口

现有推理框架(vLLM / TGI / SGLang)已支持多 LoRA 热插拔,可将任务特定 LoRA 作为适配器挂载到冻结基础模型上,按请求路由。部署时只需在模型早期层插入低秩适配器,推理图改动小,性能损耗低。论文提供的 frozen-model 测量方法可辅助选择最佳插入层,减少调参成本。

具体集成路径:1. 选定基础模型并冻结权重;2. 按论文方法训练 rank-8 LoRA;3. 部署至支持 LoRA 的服务框架;4. 按任务类型动态加载。监控系统可根据输入长度和任务类型决定是否启用 LoRA。

局限

  • **任务泛化性有限**:主要结论基于合成引用链任务,虽然作者在 MuSiQue 上验证了任务特定 LoRA 的改善,但提升幅度不及合成场景。真实世界多跳推理涉及更复杂的指代消解、背景知识和噪声,LoRA 是否能在不重新训练的情况下迁移到任意推理任务尚未验证。此外,训练 LoRA 需要特定任务的监督数据,无法做到零样本或即插即用,限制了其在通用模型部署中的直接应用。
  • **推理效率与额外计算**:为达到更长链的准确率,方法依赖多次前向循环(如 Ouro-1.4B 需 4 次循环达 60 行,8 次循环达 160 行),这增加了推理延迟和计算开销。虽然单次前向中 LoRA 本身开销很小,但循环机制使总体成本线性增长。与一次性深层推理相比,循环可能破坏并行性,在实时应用中不具吸引力。作者未提供与直接增加模型深度或使用其他循环架构(如 universal transformer)的严格效率对比。
  • **干预层定位的可靠性不足**:论文提出的冻结模型测量方法在四个保留模型中有三个成功定位最后一个有用干预层,但有一个失败,说明定位策略并非始终稳健。实际部署时若定位错误,LoRA 可能无效甚至损害原模型性能。作者未给出失败案例的详细分析,也未提出自动校准或回退机制。此外,该方法目前仅针对 decoder-only 架构验证,对 encoder-decoder 或混合架构的适用性未知。
论文Zehao Jin2026-09-29原文

相关内容