论文

TTPO: 测试时策略优化

TTPO: 测试时策略优化

近期主流后训练方法如 强化学习 和 on-policy 自蒸馏 显著推动了大型语言模型在数学推理上的进步,但它们依赖真实标签,无法进行测试时训练。用多数投票伪标签替代真实标签虽为自然选择,却十分脆弱:一旦投票错误,就会污染教师模型并误导每个 token。 我们观察到这一失败模式具有不对称性:无论投票本身是否正确,与伪标签不一致的 rollout 通常都是错误的。基于此,我们提出 测试时策略优化,一种非对称目标:通过 on-policy 自蒸馏蒸馏一致的 rollout,并通过 分组 RL 惩罚不一致的 rollout。Token 级选择 进一步优化两个分支:蒸馏降低已收敛位置的权重,而 RL 仅惩罚高置信度的错误。 该方法在频繁的伪标签错误下仍能保持稳健的更新,且随着模型改进,多数投票路由提供更紧密的自监督。实验表明,在 五个竞赛级基准 上,无标签的 TTPO 匹配了标签监督的 on-policy 自蒸馏;在测试时训练中,将 Qwen3-1.7B 从 38.0% 提升至 45.2%,无思考时提升 +25.2% 至 +36.4%,并展现出强大的跨任务泛化能力。

论文精读

TL;DR TTPO 提出测试时策略优化:利用多数投票伪标签,蒸馏一致 rollout、用 Grouped RL 惩罚不一致 rollout,无需标签即可在竞赛数学推理上提升 Qwen3-1.7B 7.2 个百分点,匹配监督方法。

问题

问题背景

在数学推理的测试时训练(TTT)中,强化学习(RL) 与 在线策略自蒸馏(OPSD) 等方法已经展示了强大的后训练性能,但它们依赖 ground-truth 标签,无法在测试时直接使用。

现有方法局限

以多数投票产生伪标签来替代 ground truth 是一个直观方案,但存在严重脆弱性:

  • 一个错误的投票会污染教师模型,并通过 token 级传播误导所有后续位置。
  • 伪标签错误与样本权重不对称:当 rollout 与伪标签不一致时,即使伪标签本身正确,不一致的 rollout 也通常是错误的,而标准对称蒸馏目标无法利用这一先验。
  • 现有方法缺乏对伪标签置信度的精细处理:token 级别的贡献被均匀对待,导致已经收敛的位置被过度蒸馏,而 confident error 未被针对性地惩罚。

为什么这个问题难/重要

  • 测试时训练必须面对无 ground truth 且伪标签噪声高的非平稳环境,策略优化信号极易被错误样本带偏。
  • 需要平衡 exploiting 当前模型知识(自蒸馏)与 exploring 跳出局部错误(强化学习惩罚),且要区分 token 级别的重要性。
  • 业界对模型在部署后持续自我进化、无监督适应新分布有强烈需求,特别是在数学推理、代码生成等可验证任务上。

行业类比

就像自动驾驶系统在道路测试中根据自车轨迹一致性来自动标注场景并微调策略,但若伪标签错误,可能强化危险行为造成系统性漂移。

核心洞察

  • 多数投票伪标签失败时,与票不一致的 rollout 几乎总是错误,这一不对称性使得惩罚负面样本在伪标签噪声下依然安全。这一观察挑战了以往将伪标签视作真实标签直接监督的做法,也不同于简单地在 RL 中惩罚所有不一致 rollout。TTPO 利用该不对称性设计统一目标:对一致样本做 On-Policy Self-Distillation (OPSD) 蒸馏,对不一致样本做 Grouped RL 惩罚。由于不一致样本大概率错误,惩罚不会误伤正确 rollout;同时可避免错误伪标签对蒸馏造成污染。这种基于统计不对称的损失设计,比盲目使用伪标签或硬投票路由更鲁棒,是测试时无监督训练的关键。
  • Token 级选择不仅看整条 rollout 对错,还精细区分位置:蒸馏时降低已收敛 token 权重,RL 惩罚时只对 confident errors 施加梯度。现有工作通常在 response level 加权或 masking,但 TTPO 引入 token-level 加权和 masking。对于正面样本,OPSD 分支下采样已经和 teacher 对齐的 token,减少冗余梯度;对于负面样本,GRPO 分支只惩罚模型自信但错误的 token,避免惩罚不确定区域。这种细粒度设计在伪标签频繁错误时尤为重要,因为错误伪标签可能只影响局部 token,而全局惩罚会放大噪声。实验显示 token-level 选择可带来显著提升,验证了在无标签测试时训练中局部信号比整体信号更可靠。

方法

输入与总体流程

测试时给定一批无标签数学问题。模型对每个问题采样多个 rollout,通过多数投票得到伪标签 a_hat。该伪标签作为自监督信号,但 TTPO 不将其视为绝对 ground truth,而是按 rollout 与 a_hat 的一致性将样本划分为正、负两类。

关键模块

  • 正样本蒸馏(OPSD 分支):与伪标签一致的 rollouts 使用 On-Policy Self-Distillation 更新模型,强化正确路径。为避免在已收敛位置上过度蒸馏,引入 token 级权重下采样:若模型对某个 token 的预测概率已很高,则降低其蒸馏损失权重。
  • 负样本惩罚(GRPO 分支):与伪标签不一致的 rollouts 使用 Grouped RL 施加惩罚,推动模型远离错误路径。同样引入 token 级 masking:只对模型“自信地预测错误”的 token 施加惩罚,避免对不确定位置的过度扰动。
  • 不对称目标:核心设计是不对称性。传统伪标签蒸馏将伪标签当作 ground truth 对全部样本统一拉近,错误伪标签会误导每个 token。TTPO 观察到:与伪标签不一致的 rollout 通常本身就是错误的,无论投票是否正确。因此对正样本用蒸馏拉近,对负样本用 RL 推远,两者都能从伪标签噪声中提取有效梯度信号。

输出与效果

模型在测试时逐步更新策略,无需人工标注即可提升数学推理性能。在五个竞赛级基准上匹配有监督 OPSD,TTT 场景下 Qwen3-1.7B 从 38.0% 提升到 45.2%。

与依赖 ground-truth 的 RL/OPSD 或单纯伪标签蒸馏相比,TTPO 通过不对称正负样本处理与 token 级选择,显著增强了测试时伪标签噪声下的鲁棒性。

行业影响

落地场景

TTPO 为无标签场景下的 测试时训练(TTT) 提供了可行方案,适用于无法获得 ground-truth 但可多次采样的产品:

  • 教育科技:数学辅导应用,学生提问后模型生成多个候选解答,利用多数投票作为伪标签进行即时微调,提升后续解答准确率。
  • 企业服务:客服/技术支持系统中处理大量无标注用户问题,模型根据自身生成的共识答案自我优化,快速适应特定业务领域。
  • 内容平台:用户生成内容的问答、摘要等任务,无需人工标注即可在推理阶段持续改进模型表现。

商业价值

  • 降本:完全摆脱对人工标注的依赖,省去长尾问题与个性化场景的标注成本。
  • 增收/体验提升:论文显示 Qwen3-1.7B 在 TTT 下从 38.0% 提升至 45.2%,准确率提升直接改善用户满意度与留存。
  • 实时自适应:模型部署后可持续学习,适应数据分布漂移或新领域,保持竞争力。

与现有产品/工作流接口

  • 推理服务集成:在现有 LLM 推理管道(如 vLLM、TensorRT-LLM)中增加多次采样与多数投票模块,产生伪标签后执行 TTPO 更新,实现轻量在线学习。
  • 与离线后训练协同:TTPO 可作为 RLHF/DPO/SFT 之后的部署期优化层,与离线训练形成闭环,弥补线上数据无标签的缺口。
  • 典型 use case:电商平台的商品问答场景,用户提问“这款手机续航怎么样?”,模型生成多个回答,共识高的作为正样本蒸馏、不一致的作为负样本惩罚,从而在无标注条件下持续增强领域回答质量。

局限

  • **对伪标签质量的依赖**:TTPO 的核心是 majority-vote pseudo-labels,论文也承认其依赖投票质量。当初始模型推理能力较弱、投票一致性低时,大量错误伪标签会同时污染正负样本分支:OPSD 蒸馏可能强化错误答案,Grouped RL 可能惩罚正确但不一致的 rollouts。虽然不对称设计和 token-level selection 缓解了部分问题,但若投票正确率低于随机水平或任务难度过高,自监督信号可能彻底失效。实际部署需监控投票置信度,或引入外部验证机制,限制了在低资源或冷启动场景的应用。
  • **领域泛化与计算开销**:实验集中在竞赛级数学推理(如 AIME 等),未覆盖代码、常识推理或开放式生成任务。测试时训练需要为每个 query 采样 K_train 个 rollouts 并执行多次梯度更新,显著增加推理延迟和计算成本,不适合实时或低算力环境。此外,超参数(如 K_train、正负样本比例、RL 权重 λ)对任务敏感,论文未提供自动化选择策略,实际应用需额外调参。与纯推理方法相比,工程落地门槛较高。
  • **与有监督方法的差距及理论假设**:虽然 TTPO 在多数 benchmark 上匹配 label-supervised OPSD,但在个别任务仍存在差距(如某些上界实验显示 supervised 仍略优)。其理论分析基于特定简化假设(如 FKL 信号分析),未完全刻画实际训练中的优化动力学;论文提出的动态训练课程仍是 future work,当前固定采样和更新策略可能限制模型持续自进化能力。与近期 test-time scaling 方法(如 self-refine)相比,TTPO 需要策略梯度更新,可能引入不稳定性和额外方差。
论文Aozhe Wang2026-08-27原文

相关内容