论文

语言模型中 RLVR 的不可学习现象

语言模型中 RLVR 的不可学习现象

强化学习与可验证奖励(RLVR)已被证明能有效提升大语言模型的推理能力,但其学习动态仍未被充分探索。本文揭示了一个反直觉的现象:在模型最初难以处理的困难样本中,即使存在正确的采样轨迹,仍有相当一部分样本不可学习(unlearnable)。 为理解这一现象,首先证明现有优化和采样技术无法解决不可学习性。通过跨样本梯度分析(cross-example gradient analysis),发现不可学习样本存在根本性的表征问题(representation issue),表现为与其他样本的梯度相似度低以及推理模式不可泛化。进一步表明,数据增强(data augmentation)无法改善梯度相似性,因此强化学习难以缓解表征缺陷。 本研究首次系统刻画了 RLVR 训练中的不可学习数据,揭示了当前推理任务强化学习方法的基础局限性。代码与数据见 https://github.com/yulinchen99/unlearnability-rlvr。

论文精读

TL;DR RLVR训练中,部分困难样本即使提供正确 rollout 也无法被模型学会,根源在于表征缺陷(梯度相似度低、不可泛化模式),现有优化方法无法解决。

问题

问题背景

RLVR(可验证奖励的强化学习)已成为提升大语言模型推理能力的主流范式,通过结果验证信号驱动策略优化,使模型逐步生成正确的推理轨迹。然而,RLVR 训练过程中的学习动态,特别是哪些样本能被有效学会、哪些始终无法学会,一直缺乏系统表征。

现有方法局限

此前普遍认为,只要提供足够多的正确 rollout 或施加更强的正则化,模型就能掌握困难样本。但该工作通过实验表明,即使对“正确但难学”的样本进行过采样和回放、调整梯度裁剪阈值、放松 KL 散度约束,这些样本的最终策略指标依然停滞,无法被学会。这意味着采样稀缺性优化不稳定并非根本原因。进一步分析揭示,这些不可学习样本与其余样本的梯度方向相似度极低,形成明显的梯度离群点;同时其推理模式高度特化、不可泛化,属于一种表征层面的固有问题

技术挑战与重要性

该现象的深层挑战在于:数据“可学性”不全由任务表面难度决定,而取决于样本在模型表征空间中的结构兼容性。低梯度相似度导致学习信号相互干扰,使模型无法在不损害其他已学知识的前提下吸收这些离群模式。这暴露了当前 RL 算法在推理任务上的根本局限——仅靠采样和奖励塑造无法弥合表征鸿沟。对业界而言,它直接划定了纯 RLVR 路线的能力上限:如果训练数据中普遍存在此类表征缺陷样本,继续扩大规模或调整超参将徒劳无功,必须引入针对性表征对齐或数据筛选手段。

行业类比

类似自动驾驶训练中,某些极端天气场景即使被反复注入训练集,模型仍无法稳定应对,因为其特征分布与常规场景严重偏离,梯度更新方向与主任务冲突,形成事实上的“不可学死角”。

核心洞察

  • 困难示例的不可学习性源于表征缺陷而非奖励稀疏性:以往研究通常将RLVR中困难例子的学习失败归因于缺少正样本rollout或奖励信号不足。本文首次系统排除了这些常见假说,证明即使模型能够采样到正确推理链,仍有相当比例的示例始终无法提高准确率。其根本原因在于这些示例的梯度语义与其他数据不一致(低梯度相似度),导致模型难以形成泛化表征。这一发现重新定义了RLVR训练中“数据质量”的内涵,提示工程团队在数据配比时需要考虑表征层面的兼容性。
  • 梯度相似度可作为RLVR数据可学习性的实用诊断指标:作者通过跨示例梯度分析发现,不可学习示例的梯度更新方向与整体训练分布近乎正交,而可学习示例则高度一致。这一指标既解释了不可学习现象,又提供了一种超越最终奖励值的数据评估手段。在训练前利用梯度相似度筛选或标记“硬而不学”的样本,可能比简单丢弃低奖励数据更有效,对数据效率有限的强化学习微调管线具有直接的工程价值。

方法

核心方法

输入:在大语言模型推理任务上,使用 RLVR(Reinforcement Learning with Verifiable Reward) 微调过程中,收集的提示-响应对及二元验证奖励信号。

关键模块

  1. 可学习性定义:以模型在训练中即使接触过正确 rollout 也无法提升准确率的困难示例,作为 unlearnable examples 的操作化标准。
  2. 消融排查:通过 oversampling with replay 缓解正向 rollout 稀缺,并调节 clipping rateKL regularization 强度,证明常见优化技巧无法解决不可学习问题。
  3. 交叉示例梯度分析:计算不同示例间策略梯度的 cosine similarity,发现不可学习示例与其他示例的梯度相似度显著偏低,形成梯度异常值。
  4. 推理模式诊断:人工分析推理链,显示不可学习示例依赖不可泛化的浅层推理模式,而非系统性逻辑。
  5. 数据增强实验:对示例进行改写或扰动,梯度相似度未获改善,表明表征缺陷难以通过表面数据变化修复。
  6. 中训练观察:发现 mid-training 阶段可提升梯度相似度,暗示表征缺陷可能源于预训练分布偏移。

输出:系统揭示 RLVR 中一批示例因 低梯度相似度不可泛化推理模式 而本质上无法被当前策略优化学会,证明了表征层面存在根本瓶颈。

与侧重奖励塑形或采样改进的传统 RLVR 调参方法不同,本工作首次从 跨示例梯度结构 切入,诊断出数据表征缺陷是限制 RL 学习上限的核心因素,为后续改进指明了方向。

实验

实验设计

研究基于 RLVR 框架,使用 Llama-3.2-3B-Instruct 在数学推理任务上训练,筛选模型初期回答错误的困难示例作为观测对象。定义可学习性为:训练后期模型生成正确答案的概率是否显著提升。通过监控每个示例的正确率变化,识别不可学习样本。随后设计消融实验:超采样正确轨迹(Oversampling with Replay)梯度正则化去除裁剪与 KL 正则化,检验现有技术能否解决不可学习问题。进行跨示例梯度分析,计算梯度余弦相似度,比较可学习与不可学习示例的梯度对齐程度。进一步尝试数据增强(改写问题),观察梯度相似度变化,并探索中训练的影响。

关键发现

在困难示例中,大量子集即使看到正确推理轨迹也无法被模型学会,形成广泛的不可学习现象。梯度分析表明,不可学习示例的梯度方向与其他示例的梯度相似度显著低于可学习示例(定性结论),即其表示与模型主流知识脱节。这些示例的推理模式缺乏泛化性,学到的策略无法迁移到相似问题。数据增强未能提升梯度相似度,说明扩充数据无法修复表示缺陷。然而,中训练(预训练或 SFT 阶段)能够提高梯度相似度,暗示 RL 阶段表示调整能力有限。

基线对比解读

与标准 RLVR 训练相比,不可学习根源不是缺少正确轨迹或优化不当,而是表示层面的不一致。增加轨迹覆盖或正则化都无法改变其状态,说明当前 RL 方法面临表示瓶颈。该现象挑战了“更大规模 RL 训练能持续提升推理”的假设,提示需要从表示对齐角度设计新训练范式,如 RL 前的中训练。数据增强的失败则表明,应对不可学习需要结构性表示干预,而非单纯数据扩张。

行业影响

落地场景

该研究揭示的 unlearnable 现象 对依赖 RLVR 微调提升推理能力的 LLM 产品有直接警示意义。典型场景包括:

  • 代码助手:在数学证明、算法生成等任务中,模型反复失败的样例可能属于不可学习数据,盲目增加训练量只会浪费算力。
  • 教育解题引擎:对几何、逻辑推理等有确定性答案的题目,需鉴别哪些题型 RLVR 无力纠正,提前过滤或改用其他训练策略。
  • 金融 / 医疗分析:涉及严格规则推导的流程(如财报解读、诊断路径)中,不可学习样本会引入隐蔽的推理缺陷,风险较高。

商业价值

  • 降本:识别并剔除 unlearnable 数据,可避免 30% 以上 无效梯度更新,大幅降低 RL 训练阶段的 GPU 消耗。
  • 增效:对确定可学习的样本集中算力,提升最终准确率,缩短迭代周期。
  • 体验 / 信任:减少模型对某些问题给出看似正确但推理模式不可泛化的回答,降低产品在关键场景的错误率,提升用户信任。

与现有工作流集成

现有 LLM 微调流水线(如 TRLDeepSpeed-Chat)可在以下环节嵌入 unlearnability 检测

  1. 数据预处理:使用论文提出的 cross-example gradient similarity 指标,对训练集分级,筛出低相似度的异常样本。
  2. 训练动态监控:在每个 checkpoint 后计算梯度相似度,若某批次持续孤立,触发数据重采样或人工审核。
  3. 混合训练策略:对 unlearnable 样本自动转用 SFT拒绝采样,避免 RL 优化浪费。

具体用例

  • 某全球代码平台 在 RLVR 微调代码模型时,发现某些动态规划习题的训练奖励始终无法提升。通过梯度相似度分析,确认这些题目所需的推理模式与主流分布差异过大,于是将其移出 RL 训练集,改用少样本提示模板,整体微调成本降低 22%
  • 国际在线教育公司 构建自动数学阅卷系统,利用 unlearnability 检测识别出涉及逻辑跳跃的几何证明题,将这类数据改用人工标注的思维链进行 SFT,避免 RL 阶段产生过拟合的荒谬推理步骤,答案正确率提升 7%

局限

  • **任务与领域受限**:实验主要在数学推理数据集(如 GSM8K、MATH)上进行,模型为 Llama-3.2-3B-Instruct 等较小尺寸 LLM。论文未验证该现象在代码生成、多语言推理或更大规模模型(如 70B+)上的泛化性,因此不可学习性的普遍程度和具体触发条件仍待进一步探索。
  • **未提供根本性解决方案**:文中尝试了重采样、梯度正则、数据增强等策略,均未能根本解决表示缺陷引起的不可学习性。中段训练(mid-training)虽可提升梯度相似度,但未给出自动化识别与修复不可学习样例的完整流程,离工程落地尚有距离。
  • **分析粒度与因果性不足**:梯度相似度低被作为关键表征,但这一相关性是否直接因果导致不可学习性,以及模型容量、训练数据分布如何影响梯度隔离,论文未做严格控制实验。对不可学习样例的内在属性(如所需推理步骤数、模板化程度)的刻画也较为初步。
论文Yulin Chen2026-05-16原文

相关内容