论文

通用推理的可迁移性:多领域 RLVR 的自动化课程

通用推理的可迁移性:多领域 RLVR 的自动化课程

可验证奖励强化学习 (RLVR) 已从单领域训练扩展至涵盖数学、编程和科学的多领域推理套件。然而,训练课程(各领域的采样频率)通常是固定或手动调整的,尽管推理技能在不同领域间的不均衡迁移。现有基于可学习性的课程会适配策略当前改进的领域,但忽略了所选领域的梯度更新是否惠及其他领域。本文提出 迁移感知课程 (TAC),一种赌博机风格的在线课程,优先选择更新能广泛惠及训练套件其余领域的领域。TAC 复用了 RL 训练已生成的信号:每领域优势捕获局部可学习性,而投影梯度(取自正在计算的 GRPO 步骤)通过梯度几何对齐估计跨领域可迁移性,开销极小(<1% 墙钟时间)。在六个领域的推理套件上,TAC 在 Qwen3-1.7B 和 Llama3.2-3B 上均取得了最佳宏平均准确率,优于比例随机采样、手动设计的学习率调度和仅可学习性的赌博机,相比后者提升高达 2.8 个点(相对 10%)。消融实验表明,移除可迁移性项后性能急剧下降,且 TAC 在不平衡训练混合中保持鲁棒,而仅可学习性课程会过度聚焦主导领域。我们的发现确立了跨领域可迁移性作为多领域 RLVR 课程设计的关键信号。

论文精读

TL;DR Transfer-Aware Curriculum (TAC) 利用梯度几何对齐衡量跨领域可迁移性,自动优先采样那些更新后能惠及全局的领域,在多领域 RLVR 中比手工或仅基于可学习性的课程更有效提升推理性能。

问题

问题背景

大语言模型在多领域推理(数学、编程、科学等)上的微调普遍采用 RLVR 范式,训练数据由多个领域混合而成,但如何为各领域分配采样比例(即课程)仍缺乏自动化方案。

现有方法局限

  • 固定/手工课程:预先设定采样比例,无法适应模型训练动态,且默认假设各领域收益均等,忽略了推理技能跨领域迁移的非均质性。
  • 基于可学习性的自适应课程(如 SEC 等 bandit 方法):通过策略在某一领域上优势值的变化来感知学习进度并调节采样频率,但其仅衡量所选领域自身的学习收益,完全无视该领域的梯度更新对其余领域的迁移效果。这会诱使训练资源过度集中于短期进步明显的领域,忽视那些虽自身难学却能广泛促进其他领域能力的“桥梁领域”,导致最终宏观平均准确率受限。

为什么这个问题难/重要

跨领域迁移性的实时利用面临双重挑战:

  1. 计算成本:直观的解决方案是在每一步 RL 更新后评估所有领域表现,这在多领域场景下开销巨大。
  2. 迁移动态性:领域间的技能迁移关系非对称且随训练进程变化,静态迁移图失效,需要在线自适应捕捉。

业界对多领域 RLVR 课程学习的关注度持续上升,因为它直接决定模型在跨任务基准上的综合表现,是实现通用推理能力的关键瓶颈。

行业类比

类似于多任务学习中通过动态权衡任务损失以避免负迁移,多领域 RLVR 课程学习的目标是在资源受限的在线训练中动态发掘与利用任务间的正迁移信号,从而最大化整体优化效率。

核心洞察

  • 跨领域可迁移性是多领域 RL 课程设计中被忽视的关键信号。现有自适应课程仅根据策略当前的学习进度(如 advantage 值)采样领域,忽略了梯度更新对其他领域的广泛影响。TAC 通过梯度几何对齐揭示领域间技能迁移结构,使得课程能够优先选择那些更新后能同时提升多个领域的“枢纽”领域,从而在不牺牲单一领域性能的前提下提升整体泛化。这解释了为何 learnability-only 课程在领域不平衡时容易过度聚焦主导领域,而 TAC 保持稳健。
  • TAC 展示了在 RLVR 流程中复用计算中间产物实现迁移感知的可行性。它利用 GRPO 步中自然产生的投影梯度,以低于 1% 的墙上时间开销完成领域间迁移估计,无需额外模型或前向-反向传播。这种轻量级设计使得迁移感知课程可以成为多领域 RL 训练的默认组件,对实际工程部署具有重要参考价值。

方法

输入

多域推理任务集合 ( \mathcal{D} = {D_1, \dots, D_K} )(如数学、编程、科学等),每个域包含与**可验证奖励(RLVR)**兼容的样本。训练过程中,策略模型持续产生每个域的 rollout 及对应的奖励。

关键模块

TAC 将多域训练视为一个多臂赌博机(bandit)问题,每个域对应一个臂。臂的价值由两部分信号融合:

  1. 本地可学习性信号:直接使用 GRPO 步骤中每个域的优势(advantages),反映当前策略在该域上仍有提升空间的程度。
  2. 梯度基迁移性信号:这是 TAC 的核心创新。训练时,每个域的梯度更新会被投影到一个低维表示。对于任意域对 ((i, j)),计算域 (i) 的梯度更新与域 (j) 损失下降方向之间的对齐程度(如余弦相似度),得到成对迁移性估计。随后进行时间平滑跨域归一化,得到稳定的标量得分,表示训练域 (i) 对全局性能的辐射范围。

这些信号在 bandit 框架中被组合成一个复合价值函数,并通过一种两阶段更新规则来平衡探索与利用:初期给予均匀的 warmup 步骤保证信号质量,后期动态调整每个域的采样概率。算法还内建了数据耗尽策略,防止某个域被过早采空。

输出

每个训练步,bandit 依据当前价值选择一个域,模型仅在该域上执行一次 GRPO 更新。整个过程以 <1% 的 wall-clock 开销运行,最终产出在宏平均准确率上更优的策略。

TAC 与同类方法的差异:现有基于可学习性的课程(如 SEC)只关心模型在所选域上的即时进步,容易陷入“优势域”的局部过拟合;TAC 通过梯度对齐显式建模了域间技能迁移,让训练朝着全局增益最大化的方向演进,从而在多域混合训练中带来显著的性能提升与鲁棒性。

实验

实验设计

在六个推理领域(数学、编程、逻辑与视觉推理、模拟、表格推理、STEM)的数据混合上,使用 Qwen3-1.7BLlama3.2-3B 作为基座,采用 GRPO 进行多域 RLVR 训练。对比四种课程策略:① 比例随机采样;② 手工设计调度;③ 仅基于可学习性的 bandit;④ TAC(本方法,通过梯度几何对齐估计跨域迁移性,融入多臂老虎机在线决策)。TAC 的投影梯度计算复用 GRPO 步骤中的已有信号,总训练开销增加 <1%。

关键发现

TAC 在两个模型上均获得最优宏观平均准确率,相比 learnability-only bandit 提升最高 2.8 个百分点(相对 10%)。消融实验表明,去除迁移性项后性能大幅下降;在不平衡数据预算下,TAC 保持鲁棒,而 learnability-only 策略过度偏向主导域,导致小域性能恶化。课程动态显示,TAC 自动调整域采样权重,与静态基线形成鲜明对比。

深度解读

传统课程设计或忽略域间关系,或仅响应局部可学习性。TAC 的关键洞察在于利用梯度对齐量化迁移性:对某域进行策略更新后,若其梯度方向与其他域的梯度方向高度一致,则更新可能广泛受益。这一信号与局部优势信号结合,使课程在探索和利用间取得平衡。实验证实,迁移性信号与可学习性信号常偏好不同域,证明了联合建模的必要性。该方法仅需极低额外计算,为多域 RLVR 的实际部署提供了高效的自适应课程方案。

行业影响

落地场景

TAC 适用于需要持续优化多技能组合的 AI 产品,如智能编程助手(需同时覆盖代码生成、数学推理、逻辑验证)与全科教育辅导系统(需均衡数学、物理、编程等多学科)。在推理 API 服务中,动态调整训练域采样可保证各能力均不退化,避免固定比例带来的短板效应。

商业价值

  • 降本:自动课程设计避免人工反复调整采样比例,减少调参工程师投入,训练效率提升直接降低 GPU 算力成本。
  • 保体验/增收:多域推理产品若某个域能力落后会引发用户离弃,TAC 通过迁移感知主动防止遗忘,保障综合准确率,延长用户留存与付费周期。在 Qwen3-1.7B 上比纯可学习性课程提升 2.8 个点(10% 相对提升),意味着同等模型规模产出更优服务,间接提高商业报价空间。

与现有工作流的接口

TAC 作为动态采样调度器,可即插即用于现有 RLVR 流程

  1. 在 GRPO 的每个优化步,计算域内 advantage 与跨域梯度对齐;
  2. 按 bandit 方式决定下一批数据源自哪个域;
  3. 仅增加 <1% 的额外 wall-clock 开销,无需改动模型结构或奖励函数。
    集成时只需在数据加载器前插入一个 curriculum 模块,现有检查点保存、多节点训练配置均可兼容。

具体落地案例

  • 教育 AI 平台:某国际化在线教育平台的多科答疑系统,需同时支持数学、物理和编程题。采用 TAC 可自动调整各科训练比例,当物理题正确率停滞时,模型会更多采样与物理共享几何推理的编程题目,利用迁移提升薄弱学科,避免盲目增加该科数据带来的过拟合。
  • 企业级 AI 编码助手:集成代码生成(LeetCode 风格)、逻辑推理和表格理解的综合开发工具。TAC 可确保在代码生成任务上强化时,不会损害表格问答能力,因为梯度对齐会捕捉到共享的逻辑推理成分,从而在少数域数据量不均时仍维持平衡表现。

局限

  • - **可扩展性验证不足**:TAC 依赖在 GRPO 步骤中计算并存储各域的梯度投影,当模型规模增大或域数量激增(如数十个域)时,额外的计算与显存开销可能从当前的 <1% 显著上升,且投影维度的选取会直接影响迁移性估计的质量。论文仅在 Qwen3-1.7B 和 Llama3.2-3B 上测试,未在 7B+ 模型或大规模域集合中验证,因此该方法在更大规模 RLVR 管线中的实用性尚不明确。此外,超参数 α(平衡可学习性与迁移性)的敏感度缺失分析,可能在不同任务混合下需要手动重调,增加工程落地成本。
  • - **梯度对齐信号的可靠性**:TAC 用梯度投影的余弦相似度近似跨域迁移性,但 RL 训练早期梯度方向噪声较大,即便引入时间平滑,仍可能给出误导性的课程偏好。论文未讨论在极端稀疏奖励或高随机性环境下的信号鲁棒性,也未与更直接的迁移性测量手段(如 fine-tuning 后评估其他域性能)对比,使得方法的理论基础尚需进一步夯实。同时,当域间差异过大或存在负迁移时,简单的梯度对齐可能无法捕捉到复杂的知识共享/干扰模式。
  • - **探索范围与基线比较有限**:实验仅覆盖 6 个推理域(数学、编程、科学等),且未与更复杂的动态课程算法(如基于元学习的自动课程、基于不确定性或信息增益的采样策略)进行对比。尽管相比固定采样和纯可学习性 bandit 有提升,但在更丰富的基线(如基于域难度的自适应课程)和更大域集合下的优势边界仍需探究。此外,TAC 的 bandit 框架使用基本的 UCBE 策略,对于非平稳环境中奖励分布漂移的处理较为简单,或可结合更具适应性的 bandit 算法提升长期训练稳定性。
论文Yongjin Yang2026-06-27原文

相关内容