论文

DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training

DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training

基于可验证奖励的强化学习(RLVR)在任务具有程序化检查器时表现出色,但大多数长程智能体领域缺乏此类检查器。我们聚焦于 结果不可见(outcome-blind) 设置,即不存在真实成功信号。多准则 评分规则(rubrics) 是提供奖励的常用方式,但通常仅在完整轨迹后给予单一标量分数,在数十步的长程任务中信号稀疏。我们提出 DRACO(Distributing Rubric-based Advantage for Credit Optimization),其核心贡献包括: - 动态评分规则:在训练过程中按策略演化能力自动生成 rubrics,避免静态规则失配。 - 单次轨迹评分与优势再分配:每条完整轨迹仅评分一次,但通过 闭式(closed-form) 方法将评分回传至相关步骤,生成 GRPO 所需的 逐步骤差异化优势(per-step advantages)。 在 AppWorld 上,DRACO 相比基础模型提升 15.9 分,相比使用稀疏真实奖励训练的 GRPO 提升 5.3 分,且全程未使用任何验证器。在领域外任务 Tau-Bench 上,即使没有前沿评判模型,DRACO 仍比基础模型高 5.3 分,优于真实奖励训练及其他基于 rubric 的训练方案。代码已开源:https://github.com/IBM/draco.

论文精读

TL;DR DRACO 在 outcome-blind 长程智能体训练中动态生成 rubrics,将轨迹级评分重分配到步骤优势供 GRPO 使用,无需任何验证器,AppWorld 上较基座提升 15.9 分、较稀疏真值奖励提升 5.3 分。

问题

长期 horizon 的 LLM agent 训练 中,可编程验证器通常不可用,导致无法获得逐步 reward 信号。轨迹级反馈如多标准 rubrics 成为替代,但存在严重信用分配问题。

现有方法局限:

  • RLVR 依赖 programmatic checker,只在少数可验证域有效,多数真实任务无 checker。
  • 静态 rubrics 每条轨迹只给一个标量分数,跨几十步的逐步信用极稀疏;且静态标准无法跟随策略能力进化,训练后期容易饱和。
  • 稀疏 ground-truth reward(如最终成功/失败)信号密度过低,长期 horizon 下难以区分关键步骤与冗余步骤,导致学习效率低。

为什么难/重要:信用分配是 RL 的经典难题,长期 horizon 使问题指数放大:一个轨迹可能包含数十步工具调用、推理、环境交互,哪些步骤贡献正/负价值缺乏细粒度判断。业界对 agent 自主执行长期任务(如软件开发、多轮对话服务)的需求快速增长,若没有密集奖励信号,策略优化很难稳定扩展。DRACO 的核心挑战是在无 verifier 条件下,如何动态生成适应策略能力的 rubrics,并将轨迹级评分解析为逐步优势,且不引入任何可训练的归因模块。

行业类比:就像长文档问答中只给最终答案对错,却要优化中间推理链——需要自动将整体信号拆解到每个推理段落,才能让模型学会正确的思考路径。

核心洞察

  • 动态生成 rubrics 使奖励信号随策略能力演化,避免静态 rubric 饱和。静态 rubric 在训练后期几乎所有轨迹都满分,梯度信号消失;DRACO 在每个阶段根据策略当前表现动态重新生成评估标准,保持判别性。相比固定 rubric 或稀疏 outcome reward,它将评估从“预设验收”转为“自适应课程”,像课程学习但基于自然语言准则,更适合长期 agent 任务。这种动态性让奖励信号持续存在,无需人工频繁调整 rubric。
  • DRACO 的 step credit 重分配是闭式、无需训练的归因机制,将 trajectory-level rubric 评分映射为 per-step advantage,并保持总 advantage 守恒。它通过统计每个步骤被 rubric 标注的通过/失败次数得到步骤质量,再结合 sign-preserving weights 分配方向正确的 push。与学习价值网络或注意力归因方法相比,该机制无额外参数、计算透明、无归因偏差,且具有长度无关、reward-scale 不变等数学性质,在 GRPO 中训练稳定。
  • 在无任何 verifier 的 outcome-blind 设置下,DRACO 性能超过使用 sparse ground-truth reward 训练,说明高质量的细粒度 proxy reward 可优于稀疏真实信号。对实际工程,这提示即使任务有可验证 checker,长期 horizon 中 sparse reward 的 credit assignment 仍可能不足;引入动态 rubric 产生的 dense signal 可作为补充或替代,提升样本效率和最终性能。这一发现挑战了“有 verifier 就应直接使用 ground-truth reward”的默认假设。

方法

输入与总体设定

DRACO 面向 outcome-blind 长时程智能体任务,训练时无 ground-truth 成功信号,仅以任务描述与 rollout 轨迹为输入。

关键模块

  1. 动态逐轨迹 Rubric 生成:从任务描述或轨迹中生成多条评价准则,并随策略能力演化动态更新,避免静态 rubric 饱和。
  2. 轨迹级 Rubric 评分:对完整轨迹应用上述 rubrics,得到每条准则的 pass/fail 判定;评分可使用 self-judge 或外部 judge,不依赖 programmatic verifier。
  3. Rubric 条件步骤信用分配:将轨迹级判定重新分配到各步骤:
    • 统计每个步骤关联准则的 pass/fail 计数,步骤质量等于该步骤相关准则的通过率。
    • 未关联任何准则的步骤继承整体平均质量。
    • 通过 符号保持权重 将步骤质量转换为方向正确的 per-step 优势,并保持总优势与 baseline GRPO 守恒。
  4. GRPO 更新:用 per-step advantages 替代传统轨迹级标量优势,注入 GRPO 策略更新。

输出

更新信号从单一轨迹优势细化为 per-step advantage,直接用于策略梯度。

与同类方法差异:现有 rubric-based reward 仅提供轨迹级标量,且多依赖静态 rubrics 或学习型 attribution 模型;DRACO 采用动态 rubrics 配合闭式信用再分配,无需 verifier 即可产生可区分的步骤级信用。

实验

实验设计

DRACO 在 AppWorld 与 Tau-Bench 两个长程 agent 基准上评估。训练采用 GRPO,动态生成 rubrics 并对轨迹级评分进行重分配,得到 per-step advantage。对比基线包括:base model、使用稀疏 ground-truth reward 的 GRPO、其他 rubric-based training 设置。Tau-Bench 评估中不使用 frontier judge,仅依赖 self-judge。

关键发现

  • AppWorld:DRACO 较 base model +15.9 分;较 GRPO (sparse reward) +5.3 分,且自身不使用任何 verifier。
  • Tau-Bench(out-of-domain):较 base model +5.3 分,超过 ground-truth reward 训练和其他 rubric-based 训练。
  • 消融显示 outcome reward、rubric 类型与 step credit、self-judge 对性能均有影响。
  • 分析表明 static rubrics 会饱和,而 dynamic rubrics 不会;动态 rubrics 中 task-specific criteria 具有判别性,而 recurring criteria 多为静态准则的再发现。

基线对比解读

DRACO 的核心优势在于细粒度信用分配:稀疏 ground-truth reward 只在轨迹级提供单一标量,难以区分长程任务中哪些步骤真正贡献成功;而 DRACO 将轨迹级评分按步骤质量重新分配,生成方向正确的 per-step advantage,保持总 advantage 守恒(详见论文属性 P1-P7)。与 static rubrics 相比,动态生成随 policy 能力演化,避免准则过早饱和。该方法不引入额外归因网络,闭式重分配降低了训练复杂度与调参难度。对工程实践的启示:在缺乏 programmatic verifier 的 agent 训练中,可通过动态 rubric + self-judge 构造 reward,但需注意 self-judge 质量会成为上限,后续可考虑 frontier judge 或更鲁棒的评分融合。

行业影响

落地场景

DRACO 适用于长时程 agent 在无程序化验证器 的领域训练,如多步工具调用、网页/桌面操作、对话式任务等。典型产品包括:

  • 客服自动化:处理多轮咨询、订单修改、退款流程等,无需精确成功信号。
  • 企业流程自动化:如 IT 工单处理、数据录入、报表生成等复杂操作序列。
  • 代码生成 agent:长编程任务中基于动态 rubrics 提供每步细粒度反馈,优于仅用最终结果奖励。

商业价值

  • 降低人工标注成本:动态 rubrics 自动适应策略能力,减少人工设计奖励函数。
  • 提升任务成功率:在 AppWorld 和 Tau-Bench 上相对基线显著提升,直接改善 agent 可靠性。
  • 加快迭代速度:细粒度 credit assignment 使策略学习更高效,可能减少训练轨迹数和计算资源。

与现有产品/工作流的接口

DRACO 可作为 reward shaping 插件 集成进现有 RLHF/GRPO 训练管道:

  1. 轨迹收集后,调用 LLM-as-judge 或自定义 rubric 生成器生成动态 rubrics。
  2. 对每个轨迹批量评分,利用 DRACO 闭式解将轨迹级奖励重新分配到各步优势。
  3. 将该优势传入 GRPO 更新步骤,替代传统标量奖励。

现有框架如 TRL、OpenRLHF 只需在 reward 计算阶段替换为 DRACO 模块,无需改动底层优化器。

具体落地 use case

  • 电商智能客服:训练处理“查询订单状态 → 申请退款 → 提供补偿”等多步任务的 agent。DRACO 根据动态 rubrics 对每个中间步骤(如询问订单号、验证身份)给出细粒度信号,减少错误步骤。
  • 金融合规审查:在长文档审查或交易监控流程中,DRACO 训练 agent 按步骤执行检查清单,根据每个检查点完成质量给予奖励,提高最终审查报告可信度。

局限

  • 依赖 **self-judge** 生成和评分 rubrics,可能引入系统性偏差。论文使用 **Qwen2.5-32B-Instruct** 作为动态 rubrics 的生成器和评分器,在无 ground-truth 奖励的 outcome-blind 设置下,self-judge 的错误或主观倾向会直接影响奖励信号质量。虽然 Tau-Bench 实验显示即使没有 frontier judge 也能提升,但 self-judge 可能对某些任务类型存在盲区,且不同 judge 模型之间的评分分布差异未充分消融。此外,每轮训练均需额外 LLM 推理来生成新 rubrics,显著增加训练计算开销,限制了大规模应用时的效率。
  • 信用重分配采用 **closed-form** 方式,假设各步骤之间近似独立,并用步骤质量 `Q_j` 和方向权重 `w_j` 线性组合,但长期 agent 任务中步骤往往高度耦合,前一步错误可能导致后续步骤连锁失败,独立假设可能造成信用分配失真。同时,该方法必须在轨迹完成后才能评分并重分配,无法支持在线或流式更新,难以应用于需要实时反馈的训练环境。
  • 实验仅在 **AppWorld** 和 **Tau-Bench** 两个 agent benchmark 上验证,且 base model 固定为 **Qwen2.5-32B-Instruct**,域外泛化性尚不明确。动态 rubrics 的生成质量和稳定性也未受到充分检验,随着训练进行,生成的准则可能偏离任务真实目标,需要额外的人工审核或约束机制。此外,与 step-level credit assignment 的 learned attribution 方法(如价值分解网络)相比,DRACO 缺乏可解释的逐步归因,仅依靠评分重分配,在某些需要细粒度调试的场景下可能不足。
论文Shubham Gandhi2026-09-03原文

相关内容