论文

Difficulty-Adaptive Tree-Structured Policy Optimization for Expanding Reasoning Coverage in RLVR 的中译:面向扩展 RLVR 推理覆盖度的难度自

Difficulty-Adaptive Tree-Structured Policy Optimization for Expanding Reasoning Coverage in RLVR 的中译:面向扩展 RLVR 推理覆盖度的难度自

RLVR(Reinforcement Learning with Verifiable Rewards)是近期大型推理模型取得成功的关键。然而,尽管 RLVR 能显著提升单样本准确率,训练中有限的探索往往使其无法扩展模型内在的推理覆盖度(pass@k)。为此,我们从训练时 rollout 的结构设计入手来提升 pass@k。 分析归纳出三条关键设计原则: 1. 难度自适应 rollout 不仅能作为效率启发式,更能有效扩展 pass@k; 2. 树式 rollout 在发现正确答案上优于并行采样; 3. 句级熵引导分叉 克服了 token 级分支的定位现象,最大化语义多样性。 基于这些洞见,我们提出 DATPO(Difficulty-Adaptive Sentence-entropy-guided Tree-structured Policy Optimization)。该方法将难度自适应树搜索与 sibling-diversity 优势项相结合,显式促进语义多样性,从而在训练中扩展推理覆盖度。 在数学推理基准上的实验表明,DATPO 在 pass@k 上优于基线,并直接转化为更优的 test-time scaling 表现。

论文精读

TL;DR DATPO 通过难度自适应树状 rollout 与句子熵引导分叉,在 RLVR 中显式最大化语义多样性,从而提升 pass@k 推理覆盖,并直接改善测试时扩展性能。

问题

问题背景

RLVR 已是训练大推理模型的核心范式,通过可验证奖励(如数学题最终答案)显著提升单样本准确率。但当前关注点正从 pass@1 转向 pass@k,即模型在 k 次采样中至少一次正确的概率,它反映模型内在推理覆盖能力。

现有方法局限

  • 主流 RLVR 目标直接优化单样本期望奖励,训练时探索有限,导致策略熵下降,采样结果趋于单一高概率路径,pass@k 提升远落后于 pass@1。
  • 并行采样(parallel sampling)虽然增加样本数,但各轨迹独立,缺乏共享前缀节约计算,且容易出现重复或近重复解码。
  • 固定难度或随机难度 rollout 无法根据问题难度自适应分配探索预算;token 级分支容易被“局部化”——分叉点集中在浅层或语法层,产生的子轨迹语义高度相似,多样性增益有限。

为什么难/重要

扩大推理覆盖的难点在于:训练阶段鼓励多样性可能与最大化奖励冲突,容易破坏已有策略的稳定性;同时树搜索在训练时引入大量中间状态,需要有效的价值估计与优势计算,否则方差过高。然而 pass@k 直接决定测试时计算扩展的上限:无论是 best-of-n、多数投票还是蒙特卡洛树搜索,都依赖模型能生成多样且正确的候选解。业界在推理成本高企的背景下,对能在相同采样预算下提升覆盖率的训练方法高度关注,因为它们能直接转化为更优的 test-time scaling 表现。

类比

类似代码生成中希望 LLM 返回多个语义不同的候选实现:如果训练只奖励单一正确解,模型会坍缩到常见模板,无法覆盖边界情况或新颖写法。

核心洞察

  • - 难度自适应 rollout 对 pass@k 的增益不是单纯的采样效率改进,而是策略探索行为的结构性变化。以往工作常将难度自适应作为减少冗余采样的启发式,本文证明在简单样本上减少分支、在困难样本上增加分支能直接扩大模型输出的有效推理路径覆盖,从而提升 pass@k 与 test-time scaling 潜力。
  • - 树形 rollout 相比并行采样,本质优势在于条件性多样化:共享前缀后从高熵句子处分叉,比从头独立采样更能触发产生不同解题思路。配合 sentence-entropy-guided forking,可避免 token 级分支集中在相邻 tokens 的局部化现象,显著提高语义层级多样性。这一设计比常见 MCTS 的 token 级扩展更适配推理任务的组合结构。
  • - sibling-diversity advantage term 将分支间多样性直接嵌入优势估计,而不是外挂正则项。它比较同一个父节点下子节点的语义嵌入距离,对扩大推理覆盖的样本给更高权重,使优化目标从提升平均奖励转向提升覆盖上限。这种设计在训练动态上比仅最大化单样本奖励更能稳定提升 pass@k,尤其适合预算受限的 test-time scaling 场景。

方法

输入与总体流程

DATPO 以 RLVR 训练循环为基础,输入为问题提示与当前策略模型。训练时不再使用固定数量的并行采样,而是动态构造 树状 rollout。

关键模块一:难度自适应树搜索

根据每个问题的难度(如初始策略的 pass rate 或熵估计)决定树的分支数与深度。简单题使用浅树、少分支,难题扩展更多节点,使计算资源向高不确定性问题倾斜。这不仅是效率启发式,更直接影响探索范围。

关键模块二:句子熵引导分叉

在树搜索中,分叉点选择不再基于 token 级熵,而是计算每个候选句子结束位置的条件熵,选择熵最高的句子边界作为分叉点。相比 token 级分叉,能显著缓解 局部化现象,即避免分支只在单一 token 附近展开,从而生成语义上更加多样的推理路径。

关键模块三:兄弟多样性增强优势估计

对树中同一父节点下的兄弟分支,计算 块级兄弟多样性 Div_sib(b),将其作为额外项加入优势函数。优势变为原 MC 价值估计与多样性项的组合,策略梯度因此同时最大化正确性与推理路径的语义差异,直接提升 pass@k。

输出与差异

输出为更新后的策略模型,训练完成后其推理覆盖范围扩大,在测试时通过多数投票或 best-of-n 可获得更优扩展性能。与现有树基方法不同,DATPO 不是把树搜索作为推理时策略,而是将其融入 RLVR 训练优化目标,通过难度自适应结构和多样性正则显式扩大训练期间策略的推理覆盖。

实验

实验设计

在数学推理基准 上对比 DATPO 与多个 RLVR 基线,评估 pass@k 与单样本准确率,并验证 test-time scaling 性能。模型与数据集配置见原文,算力未在摘要中披露。

关键发现

DATPO 在 pass@k 指标上显著优于基线,尤其在测试时扩展场景下。难度自适应树搜索结合句子熵引导分叉与 sibling-diversity 优势项,有效扩大了推理覆盖,而非单纯提升单样本准确率。消融实验表明分叉策略与多样性项均有贡献。

对比解读

与并行采样的 RLVR 基线相比,DATPO 的树形结构在训练时能发现更多正确答案,多样性优势项显式鼓励语义多样的兄弟分支,缓解了 token 级别分叉的局部化现象。这使模型在测试时进行更多采样时,pass@k 涨幅更大,体现更强的可扩展性。

行业影响

落地场景

DATPO 提升 pass@k 与推理覆盖,适用于需要高多样性候选答案的场景:代码生成(多方案生成与验证)、数学求解、企业级 Agent 决策、自动化测试用例生成。特别在 test-time scaling 工作流中,模型可提供更多正确候选供 verifier 或多数投票筛选。具体 use case:

  • 企业级编程助手(如 GitHub Copilot 类产品)生成候选代码时,用 DATPO 提高一次通过率,减少用户多次 prompt 重试。
  • 在线教育平台的逐步解题助手,可给出多个可行解题路径,增强自适应辅导和解释性。

商业价值

主要节省 test-time compute:在相同推理预算下获得更高正确覆盖率,减少重试与人工校验。对提供 API 推理服务的厂商,能降低单位正确答案的算力成本;对采用多模型投票或 Best-of-N 的产品,可提升最终准确率而不增加模型规模,同时缩短用户等待时间,带来降本与体验提升的双重收益。

与现有产品/工作流的接口

  • 在现有 RLVR 训练管线(如基于 PPO/GRPO 的数学或代码微调)中,替换 rollout 采样策略为 difficulty-adaptive tree search,无需重构奖励模型,可直接接入现有训练框架。
  • 在推理侧接入 sentence-entropy 作为分支选择信号,可配合现有 verifier 与 search 框架(如 MCTS、Best-of-N)实现 diversity-aware 解码,对已有推理服务做低侵入性升级。
  • 开源实现 DATPO 可作为插件集成到 HuggingFace TRL 或自定义训练循环中,便于技术团队快速验证收益。

局限

  • - **计算开销显著增加**:DATPO 在训练阶段引入树搜索与句子熵计算,相比常规并行采样 RLVR,推理成本与内存占用更高,尤其在大规模模型或长序列推理任务中,可能限制训练吞吐与可扩展性。作者虽在附录 **F.3** 讨论了计算代价,但未与基线进行严格的效率对比,实际生产部署时需额外的工程优化。
  • - **评估领域相对集中**:主实验主要围绕数学推理基准(如 MATH 等)展开,尽管附录 **F.4** 涉及部分域外任务,但总体覆盖范围有限,对代码生成、科学推理、多步常识推理等复杂任务的有效性仍缺乏充分验证,泛化能力有待进一步检验。
  • - **依赖外部嵌入模型**:句子熵引导分叉需要额外的句子嵌入模型来计算语义多样性,其质量与选择直接影响分叉决策的合理性;附录 **F.5** 虽分析了不同嵌入模型的影响,但该依赖引入额外超参数与系统复杂度,且可能在不同领域或语言分布下失效,需要针对具体场景进行适配调优。
论文Youngjun Yu2026-09-08原文

相关内容