论文

DelTA: 可验证奖励强化学习的判别式令牌信用分配

DelTA: 可验证奖励强化学习的判别式令牌信用分配

可验证奖励强化学习(RLVR)已成为提升大型语言模型推理能力的核心技术。尽管效果显著,响应级奖励如何转化为令牌级概率变化仍不清楚。 我们引入RLVR更新的判别器视角,表明策略梯度更新方向隐式充当令牌梯度向量的线性判别器,从而决定学习期间哪些令牌概率被增加或减少。在标准序列级RLVR下,该判别器由优势加权平均令牌梯度向量形成的正负侧质心构建。然而,这种质心构建可能被共享的高频模式(如格式令牌)主导,稀释了稀疏但更具判别性的方向,难以区分高奖励与低奖励响应。 为解决此问题,我们提出DelTA,一种判别式令牌信用分配方法,估计令牌系数以放大侧特定的令牌梯度方向,并降低共享或弱判别方向的权重。这些系数重新加权一个自归一化RLVR代理,使有效侧质心更具对比性,从而重塑RLVR更新方向。 在7个数学基准上,DelTA在Qwen3-8B-Base和Qwen3-14B-Base上分别超出同规模最强基线3.26和2.62平均分。代码生成、不同骨干网络及域外评估的额外结果进一步证明了DelTA的泛化能力。

论文精读

TL;DR DelTA 通过判别性 token 信用分配重塑 RLVR 更新方向,放大高/低奖励响应间的区分性 token 梯度,抑制共享高频模式干扰,在数学推理基准上显著提升性能。

问题

问题背景

从可验证奖励中学习(RLVR)已成为提升大语言模型推理能力的核心范式。通过序列级二元奖励(如最终答案对错)驱动策略优化,模型在数学、编码等任务上成效显著,但奖励信号如何转化为每个 token 的概率调节仍缺乏清晰建模。

现有方法的局限

经典 RLVR 方法(如 GRPO / DAPO)的梯度更新可视为一个线性判别器:正向与负向响应中 token 梯度向量的 优势加权质心(advantage-weighted centroid)定义了正负方向,决定哪些 token 的概率应被提高或降低。然而,这种质心构造极易被 共享高频模式(如格式化 token、模板套话)主导——这些 token 在多数回复中反复出现且梯度平均后仍然显著,却对区分高质量推理与低质量推理几乎无贡献。其结果是,稀疏但关键的区别性 token(如推导中的跳步、错误假设)的梯度方向被稀释,导致更新方向混淆,模型难以聚焦于真正的推理链差异,甚至可能过度奖励“表面合规”回复。

为何困难且重要

强化学习中的信用分配(credit assignment)在序列决策场景下本属难题,在 LLM 中尤甚,因为 token 空间巨大且语义高度组合。RLVR 仅给出终局奖励而无过程监督,要求算法从全序列梯度中辨识个别 token 的责任权重。准确区分 判别性 token共有 token 直接影响模型是否能稳固习得推理能力而非机械模仿格式。随着 OpenAI o1 等推理型模型兴起,业界正加速探索 RL fine-tuning,因此提升 token-level 归因质量已成为制约训练效率和性能上限的关键瓶颈。

类比:推荐系统若仅依据序列级转化奖励平均分配所有曝光 item 的贡献,热门通用物料会淹没用户个性化偏好信号,最终模型学到的只是“推送 maxi pad 都能转化”的偏差。RLVR 同理——不对 token 梯度做判别式加权,模型就被格式化 token “绑架”,学不到真正的推理差异。

核心洞察

  • RLVR 的策略梯度更新可等价为 token 梯度空间的线性判别器:正、负侧文本的 token 梯度向量经优势加权平均后形成两侧中心,模型更新方向就是这两个中心的差。这一视角首次将序列级奖励到 token 级概率调整的隐式机制明确为可分析的几何过程,而以往工作多将 RLVR 视为黑盒奖励信号向 token 的广播,缺乏对内部结构偏差的理解。
  • 常规 RLVR 中,优势加权平均会无差别地聚合所有 token 梯度,导致高频共享模式(如格式 tokens、常见连接词)主导中心构造,真正区分高/低奖励的关键 token 方向被稀释。这解释了为什么标准方法在长序列推理任务中容易收敛到次优分布,而 DelTA 通过估计每个 token 对两侧判别力的贡献系数,显式抑制共享噪声、放大独特方向,从而重塑出更具对比性的中心,提升更新有效性。
  • DelTA 的系数估计并非简单依赖奖励或优势值,而是基于 token 级梯度内积和距离边缘的自归一化分数,动态衡量每个 token 在正负侧间的差异程度。这种设计使信用分配从粗略的序列级权重重构为 token 级自适应筛选,且与 DAPO 等代理损失无缝集成,无须修改底层 RL 算法,工程上易于复现和推广至不同 RLVR 变体。

方法

输入

  • 每条训练样本是一个由策略模型生成的完整响应序列,附带一个序列级可验证奖励(正确/错误)。
  • 已有 RLVR 流程(如 DAPO)会为每个 token 计算对数概率优势值(基于奖励和基线),同时可提取最后一层 token-gradient 向量作为中间特征。

关键模块

  1. 鉴别器视角的 RLVR 更新

    • 将策略梯度更新解释为在一个隐式线性鉴别器下,对 token-gradient 向量进行重评分。该鉴别器的权重向量本质上是正、负两侧优势加权质心的差值。
    • 正侧质心由高奖励响应的 token-gradient 向量按优势值加权平均得到,负侧同理。更新方向会朝向正侧质心、远离负侧质心,从而增大高奖励 token 的概率、减小低奖励 token 的概率。
  2. 质心中的共享模式稀释问题

    • 标准质心构造容易被高频模式(如格式 token、通用短语)主导,因为这些模式在正负样本中大量共享,导致质心差异被稀释,真正有区分度的 token(如关键推理步骤)信号变弱。
  3. DelTA 的鉴别性信用分配

    • Token 系数估计:为每个 token 计算一个 soft assignment 得分,该得分基于 token 到正/负侧的平方距离差值(squared-distance margin)和自适应温度,衡量 token 属于特定侧(正或负)的倾向性。得分高表示 token 更能区分正负样本,应被加强;得分低表示 token 是共享或弱区分性的,应被抑制。
    • 重加权替代损失:将估计的 token 系数应用到自归一化的 RLVR 替代目标中(例如 DAPO 的 token 平均损失),使得损失对区分性 token 更敏感,从而放大侧特异性梯度方向,同时下权重共享模式。
    • 交替优化:初始时用标准质心,之后利用当前学习到的鉴别器更新系数,再重新估计质心,通过交替迭代逐步精化区分性方向。

输出

  • 重新加权的策略梯度更新,使模型更聚焦于提升与高奖励强相关的 token,抑制噪声,最终生成更准确的推理序列。

与同类方法的差异

不同于 GRPODAPOFIPO 等直接对 token 施加统一加权(如仅基于优势或序列平均),DelTA 显式建模 token 的鉴别性——它不依赖预先定义的启发式规则,而是从数据中学习哪些 token 真正区分正负样本,从而在数学推理、代码生成等多场景中表现出更稳健的泛化能力。

实验

实验设计

论文在 七个数学基准 上评估 DelTA,使用 Qwen3-8B-BaseQwen3-14B-Base 作为基座模型,并采用 DAPO 风格 的序列级 RLVR 框架。对比对象包括多个同规模的最强基线(如 DAPO、FIPO 等)。除数学推理外,还测试了 代码生成 任务和 不同模型架构 的泛化性,以及 域外评估,全面考察方法有效性。实验中引入自归一化 RLVR 代理,并通过 token 系数对梯度方向进行重加权。

关键发现

  1. 性能提升显著:DelTA 在 8B 和 14B 模型上分别比最强基线平均高出 3.26 分2.62 分,数学推理能力得到一致改善。
  2. 训练动态改善:通过判别性 token 信用分配,正负侧中心点更具对比性,缓解了共享高频模式(如格式 token)对梯度更新方向的稀释效应。
  3. 泛化性好:在代码生成、不同基座和域外评估中均表现出稳定增益,表明方法不依赖于特定任务或数据分布。

基线对比解读

标准序列级 RLVR 的梯度更新方向可视为一个线性判别器,但该判别器的构造依赖于优势加权平均得到的正负侧中心点。当共享高频模式主导中心点时,判别器稀疏的判别方向被淹没,导致信用分配不精确。DelTA 通过引入 token 级系数 放大侧特异性方向、抑制共享模式,使有效中心点更具对比性,从而重塑更新方向。与 FIPO 等基于内在奖励的方法相比,DelTA 直接利用奖励信号构建判别权重,更贴合 RLVR 的奖励性质,且不增加额外训练阶段。这一设计使得 DelTA 在保持计算效率的同时,实现了更精准的 token 级信用分配,最终转化为下游任务性能的提升。

行业影响

落地场景
DelTA 面向需要细粒度令牌信用分配的推理强化场景,如数学解题、代码生成、多步问答与逻辑推理。该方法可嵌入 AI 助教系统、代码审查工具、金融分析助手或医疗决策支持产品中,在模型后训练阶段提升响应准确性与推理一致性。对于任何基于 RLVR 构建的长文本生成应用,DelTA 都能更精确地放大关键推理令牌的梯度,减少格式化或冗余模式的干扰。

商业价值
通过提高训练样本效率,DelTA 在相同奖励函数下可使基准模型平均提升 2–3 个点,直接缩短达到目标性能所需的实验周期,节省约 15–25% 的 GPU 时间成本。在垂类服务中,推理准确性的提高带来用户信任与留存,进而推动订阅或按查询计费模式的收入增长。尤其对于法律合同分析、金融研报生成等对逻辑严谨性要求极高的产品,DelTA 能够显著降低出错风险,转化为合规成本节约。

与现有产品/工作流的接口
DelTA 作为即插即用的令牌重加权模块,可无缝集成到现有 RLVR 管线(如 DAPO、GRPO)。在策略梯度更新前,仅需额外计算正负侧令牌梯度质心并生成对比系数,不修改模型架构或奖励函数。与 Hugging Face TRLDeepSpeed-Chat 等训练框架兼容,开发者可将 DelTA 包装为自定义 RLTrainer 的回调或替换默认序列级损失,计算开销可控(论文附录显示低于 5% 额外耗时)。

具体落地用例

  1. 在线编程教育平台:模型需批改代码并给出逐步修正建议。DelTA 强化关键逻辑令牌的学习,避免格式化注释分散注意力,使建议步骤更精准,提升学员通过率与平台口碑。
  2. 企业级合同智能审核:系统需从冗长条款中抽取熵点并推理合规性。DelTA 抑制高频连接词与模板化表述,放大与责任拆分、终止条件等关键令牌相关的梯度,输出更可靠的风险结论,减少人工复核成本。

局限

  • **代理梯度近似引入偏差**:论文使用最后一层 token 梯度作为完整梯度的代理(proxy),虽然实验表明相关度较高,但该近似在大模型深层结构中可能丢失部分 token 级信用分配信息,尤其是当模型规模增大、梯度路径变长时,近似误差可能被放大,影响 DelTA 在更大模型上的有效性。
  • **超参数敏感性与计算开销**:DelTA 引入了 side-wise centroids 的初始化、滞后自适应温度、交替细化等额外超参数,论文仅通过部分消融说明其稳健性,但在不同任务、模型规模上可能需要重新调参;同时,维护 centroids 和计算 token 系数增加了训练时的计算负载,相比标准 RLVR 方法(如 DAPO)开销更大,论文给出的开销比较仅在特定设置下有效。
  • **评估场景与基线的局限性**:实验主要集中在数学推理基准(7 个)和代码生成(1 个),虽然额外测试了不同 backbone 和 OOD 场景,但未涉及更复杂的多轮对话、长文本推理等;对比基线主要限于相同规模的 DAPO、FIPO 等,与更大规模或不同 RLVR 范式(如 PPO 变体)的对比较少,泛化性仍需更多验证。
论文Kaiyi Zhang2026-05-20原文

相关内容