论文

Label-free steering: Compressing test-time reinforcement learning into bias-only subspaces

Label-free steering: Compressing test-time reinforcement learning into bias-only subspaces

Test-time reinforcement learning (TTRL) enables models to improve their reasoning without relying on labeled training data, but existing approaches typically optimize a large fraction of the model parameters. This raises a natural question: can effective test-time adaptation emerge when both the reward signal and the optimization space are severely restricted? We answer this question with label-free bias-only TTRL, which uses majority-vote pseudolabels as rewards and optimizes only 100K bias parameters while keeping the pretrained backbone frozen. On MATH-500, our approach reaches 76.67% accuracy with Qwen2.5-7B, slightly exceeding our own labeled bias-steering reproduction while optimizing 76,000x fewer parameters than full-parameter TTRL. The same training procedure improves performance across vision-language and audio reasoning tasks, including MathVista, AI2D, LogicVista, and MMAU. We further show that the learned steering vectors transfer to 4,500 held-out MATH problems, indicating that the adaptation is not limited to the problems used during test-time optimization. Finally, we analyze why this highly restricted adaptation can work, showing that majority-vote reliability improves with rollout consensus and that bias subspaces with greater accessible gradient energy exhibit stronger downstream trainability. These results demonstrate that substantial test-time adaptation can emerge from optimizing a tiny bias-only subspace using entirely label-free rewards.

论文精读

TL;DR 用无标签多数投票伪标签作奖励,仅优化约100K偏置参数,冻结骨干网络,在MATH-500上以Qwen2.5-7B达到76.67%,超越自复现的带标签偏置操控,参数效率提升76,000倍。

问题

问题背景: 当前推理模型(如 Qwen 系列)在数学、视觉-语言、音频等复杂推理任务上,测试时强化学习(TTRL)成为无需标注数据即可提升表现的活跃方向。

现有方法局限: 主流的 TTRL 方案通常依赖全参数或低秩适配,需优化数百万到数十亿参数,测试时计算和显存开销高,部署困难。奖励信号方面,多数工作使用标注标签或精心设计的奖励模型,无法完全脱离监督。此外,优化空间大往往导致过拟合于特定测试样本,泛化性存疑。这些因素限制了 TTRL 在实际推理服务中的可行性。

为什么难/重要: 当奖励信号仅来自多数投票伪标签(无任何 labels),且优化空间被压缩到仅 ~100K 个 bias 参数时,模型获得的梯度信息极为有限,容易陷入噪声或停滞。但若能在如此严格的约束下实现有效适应,就能将测试时优化成本降低数个数量级(相比全参数 TTRL 少 76,000 倍参数),同时保持骨干网络冻结,这对于需要快速、低成本推理增强的在线服务具有重要价值。业界关注点在于如何在不引入额外标注和庞大计算的前提下,稳定提取可迁移的推理能力。

行业类比: 类似在移动端或边缘推理场景中,仅调节模型偏置参数即可完成特定任务适配,避免更新全量权重的昂贵开销。

核心洞察

  • 测试时强化学习可以压缩到仅优化约 100K 个 bias 参数,且完全不依赖标注奖励。与常见的全参数 TTRL 不同,本文证明在 Qwen2.5-7B 上冻结整个骨干网络、只优化 bias 子空间,配合多数投票伪标签作为 reward,即可在 MATH-500 达到 76.67%,参数量比全参数 TTRL 少 76,000 倍。这颠覆了“更多可调参数≈更强适应能力”的默认假设,为低资源、低延迟的测试时自适应提供了可行路径。
  • 多数投票伪标签的可靠性随 rollout 共识提高,使得无标签 reward 在采样足够一致时近似真实标签信号。该工作不同于依赖外部标注或精确 reward 模型的 TTRL,揭示了 consensus 质量是决定无监督测试时学习能否成功的关键变量。当模型对答案的多数投票一致时,伪标签接近 ground truth,bias-only 优化因此能获得有效梯度。这为设计无监督 RL reward 提供了新准则:与其追求单一模型输出置信度,不如利用采样共识作为免费且自适应的监督信号。
  • 学习到的 bias steering vectors 可迁移到大规模 held-out 问题上,表明测试时优化并未过拟合当前样本,而是捕获了可泛化的推理行为调整。与大多数 test-time adaptation 方法只能针对当前分布或单一样本做临时修复不同,本文在 4,500 个 held-out MATH 问题上保持提升,说明 bias 子空间的低维度本身构成了一种强正则,促使优化方向落在与任务相关的公共子空间。这为在线持续学习或跨任务迁移提供了实验证据,也解释了为何看似受限的优化反而产生更通用的策略。

方法

输入与初始化

  • 输入:无标签的测试问题(如 MATH-500、MathVista 等),一个预训练模型(如 Qwen2.5-7B),参数完全冻结,只保留所有 bias 项为可训练(约 100K 参数)。
  • 初始化:bias 参数保持预训练值,不引入新参数。

关键模块

候选生成与伪标签构造 对每个问题采样多个 rollout(如 8/16 个),获取不同推理路径答案。使用多数投票(self-consistency)得到伪标签,将其视为正确性信号。多数投票的可靠性随 rollout 一致性提高,能提供高质量奖励。

奖励计算 将每个 rollout 与伪标签比较,正确得 1,错误得 0,构成组内相对奖励,供 GRPO 使用。GRPO 通过组内 baseline 归一化优势,更新策略。

bias-only 优化空间 仅更新所有线性层、归一化层等的 bias 参数(~100K),所有权重矩阵保持冻结。在测试时对每个问题执行少量梯度步骤,不更新 backbone。

输出与迁移

学习到的 bias 参数变化(steering vector)可应用于同一批测试问题,也可直接迁移到其他 held-out 问题(如 4,500 个 MATH 问题),证明适应不是过拟合测试集。

跟同类方法的差异点:与全参数 TTRL 或需标签的 bias-steering 不同,本方法将测试时 RL 优化空间压缩到 bias 子空间,且完全依赖无标签的多数投票伪奖励,仍能达到或超过有标签方法。

实验

实验设计

采用 label-free bias-only TTRL 方法:以 majority-vote pseudolabels 作为奖励信号,仅优化约 100K 偏置参数,冻结预训练主干网络(Qwen2.5-7B)。在 MATH-500 上测试数学推理,并在 MathVista、AI2D、LogicVista、MMAU 上评估视觉语言与音频推理。此外,将学到的 steering vectors 迁移到 4,500 个留出 MATH 问题,检验泛化性。

关键发现

  • 在 MATH-500 上达到 76.67% 准确率,略高于作者自己复现的 labeled bias-steering,且优化参数比 full-parameter TTRL 少 76,000×。
  • 同一训练流程在多个多模态推理基准上带来一致提升,证明方法跨任务通用。
  • 学到的 steering vectors 可迁移到留出问题,表明适应并非仅针对测试时优化所用的问题。
  • 分析显示:majority-vote 伪标签可靠性随 rollout consensus 提高;偏置子空间中可达梯度能量越大,下游可训练性越强。

与基线对比的深度解读

与 labeled bias-steering 相比,本方法仅用伪标签就达到甚至略高准确率,消除了对人工标注的依赖。与 full-parameter TTRL 相比,仅优化 100K 参数即获得大部分收益,说明模型推理能力可以被极低维子空间内的偏置调整有效激发。这对实际工程意义重大:测试时适应不再需要大规模参数更新,算力与存储成本可降低数个数量级。未来可进一步探索更低维子空间或更高效的伪标签生成策略。

行业影响

落地场景

该技术适用于推理密集型产品,如数学解题助手、多模态问答系统(视觉推理、音频推理)、代码生成与调试工具。在部署后的推理服务中,面对新领域或非分布数据,可实时优化极小参数量(~100K bias 项)提升准确率,无需重新训练整个模型。典型用例:

  • 在线教育平台:自动批改数学证明题,利用测试时强化学习适应新型题型。
  • 电商智能客服:处理复杂订单咨询,结合多模态商品图与用户问题,动态提升回答质量。

商业价值

主要降本增效:

  • 标注成本归零:使用多数投票伪标签,无需人工标签,特别适合长尾场景。
  • 算力成本大幅下降:仅优化 bias 参数,训练开销比全参数 TTRL 低 76,000 倍,可在单卡或 CPU 上完成,适合成本敏感的中小团队或边缘设备。
  • 体验提升:在 MATH-500 上达到 76.67%,超越有标签的全参数方法,表明这种受限优化不仅省钱,还更有效。

与现有工作流集成

作为轻量级后训练适配层,可无缝嵌入现有推理栈:

  1. 在推理引擎(如 vLLM、TGI)中增加一个“测试时适配”步骤,先跑多个 rollout 生成伪标签,再优化 bias 参数,最后用优化后的模型生成最终答案。
  2. 与参数高效微调(PEFT)库(如 Hugging Face PEFT、ReFT)兼容,bias-only 子空间可视为一种新的适配器。
  3. 因参数量小,可热更新或按用户/任务缓存多个 steering vectors,支持多租户差异化管理。

局限

  • 对 **majority-vote 伪标签** 的依赖限制了方法在弱基座模型上的适用性:当初始模型准确率较低时,投票结果噪声大,伪标签不可靠,可能误导 bias 优化方向。论文仅在 **Qwen2.5-7B** 这一较强模型上验证,且多模态任务提升幅度可能有限(如摘要未给出具体数值)。此外,生成 rollout 需要多次采样导致推理开销增大,虽然训练参数极少,但整体测试时计算成本仍高于常规推理,影响实际部署的效率。
  • **bias-only 子空间** 容量仅约 100K 参数,可能难以适应需要大幅改变模型内部表示或复杂推理策略的任务。与 full-parameter TTRL 或 LoRA 等参数高效方法相比,优化空间极度受限,在更难基准或分布外数据上可能快速饱和。论文表明在 MATH-500 上可超越 labeled bias-steering,但在多模态和音频任务上的提升幅度未突出,暗示该方法对特定任务类型(如数学)更有效,通用性有待验证。
  • 论文附录中自述 **MMAU** 存在 phoneme-counting confound,说明部分性能提升可能来自数据偏差或奖励 hacking,而非真正的推理能力增强。此外,训练过程只调整 bias 参数,对初始化或子空间选择(如 MLP bias vs attention bias)的敏感性未充分消融;与 activation steering 相比,学到的 steering vector 是全局静态的,不能根据输入动态调整,可能限制其处理复杂、多变 prompt 的能力。
论文Naveen Vakada2026-09-28原文

相关内容