论文

面向代码 Agent 强化学习的组内智能体评分与优势重分配

面向代码 Agent 强化学习的组内智能体评分与优势重分配

代码 agent 的强化学习常依赖可执行测试提供二值奖励。基于该奖励,Group Relative Policy Optimization (GRPO) 会给同一 rollout group 内所有测试通过的轨迹分配相同的 advantage,忽视其在实现质量与任务符合度上的差异,使策略缺少偏好干净、聚焦实现的学习信号。 我们提出 GAGAR,一个面向代码 agent RL 的质量感知信用重分配框架。它基于 dynamic sampling,保留同时包含通过轨迹与失败轨迹的 group;再把每组全部轨迹放入共享工作区,由 SFT 训练的 agentic grader 联合检查并排序测试通过的候选。据此,GAGAR 下调排名较低轨迹的权重,并按比例缩放所有通过轨迹的 advantage 以恢复其原始总和,在保和前提下把信用转向更高质量的实现。 我们在工业规模上,使用 MiMo-V2.6-Flash (310B 总参数) 与 MiMo-V2.6-Pro (1.02T 总参数) 的 RL 前 SFT checkpoint 评估 GAGAR。受控纯代码 Flash 实验显示代码 agent 性能提升、轨迹长度增长减缓、训练更稳定;我们还将 GAGAR 用于 Flash 与 Pro 的大规模混合任务 RL。结果表明,将基于测试的验证与组内智能体评分结合,可提升代码 agent RL 的质量与稳定性。

论文精读

TL;DR GAGAR 针对代码智能体 RL 中二进制测试奖励忽视实现质量的问题,用 SFT 训练的 agentic grader 对组内通过轨迹排名,再通过 sum-preserving 优势重分配把信用向高质量实现倾斜,在 310B 和 1.02T 参数模型上提升性能与训练稳定性。

问题

问题背景

代码智能体的强化学习(RL)当前高度依赖可执行测试作为二元奖励信号,以验证生成代码的正确性。

现有方法局限

在 Group Relative Policy Optimization (GRPO) 框架下,每个 rollout 组内所有通过测试的轨迹 均被赋予相同优势值。这种二元奖励机制完全忽视了实现质量与任务要求的匹配度——例如代码是否包含不必要的改动、是否偏离目标范围。策略因此无法区分“干净、精准的实现”与“勉强通过测试但代码冗余的实现”,导致训练信号粗糙,甚至可能鼓励模型生成更冗长、更具破坏性的代码路径。

为什么这个问题难/重要

难点在于自动评估代码实现质量需要超越测试通过与否的细粒度信号,而可执行测试只能提供二元反馈,手动标注成本过高且难以扩展。业界对代码智能体的实际部署要求高效、可维护的代码生成,同时训练稳定性受奖励稀疏和噪声影响。该问题直接影响 RL 训练后模型的泛化性能和交互效率。

行业类比

类似于代码评审系统:不仅要求测试通过,还要求代码简洁、无副作用——这正是当前代码智能体 RL 所缺失的维度。

核心洞察

  • GAGAR 的核心是保和优势再分配:对同一 rollout group 内通过测试的轨迹先按 agentic grader 排名降权,再对所有通过轨迹按比例缩放以恢复原始优势总和。这不同于直接奖励高质量或惩罚低质量轨迹的 reward shaping,它保持组内正优势总量不变,只改变通过样本间的相对权重,无需调整奖励尺度或 KL 系数,训练更稳定,同时把信号推向更简洁、更符合意图的实现。
  • GAGAR 的 agentic grader 在共享工作区中联合检视同一 rollout group 的全部轨迹,并对通过候选进行排序,而非独立给每个轨迹打绝对分。这种 groupwise 比较利用了轨迹间对比证据,能更可靠地识别 out-of-scope 改动和冗余实现;排序输出避免了 reward model 连续分数引入的奖励尺度漂移。与 LLM-as-judge 独立评分或训练专用质量回归器不同,该排序直接适配 GRPO 的相对优势框架,且 grader 由 SFT checkpoint 冻结参与在线训练,额外成本低。

方法

输入与分组

代码 agent RL 中,每个 rollout group 包含多条轨迹。GAGAR 采用 动态采样,优先保留同时含有通过测试与未通过测试轨迹的组,以便在组内进行对比。

关键模块:Groupwise Agentic Grading

所有轨迹被放入同一个 共享工作空间,由 SFT 训练的 agentic grader 联合检查。该 grader 依据实现质量、任务需求遵循度等标准,对通过测试的候选轨迹进行 质量排名。排名结果通过 rank-to-weight 映射转化为降权系数(低质量轨迹权重更低)。

优势再分配:Sum-Preserving Redistribution

基于排名对通过测试的轨迹进行降权后,GAGAR 按比例重新缩放所有通过轨迹的 优势,使其总和恢复为原始值。这一过程保持组内通过轨迹的总优势权重不变,但将更多信用转移到排名靠前的高质量实现上。

输出与训练集成

调整后的优势作为 GRPO 的优化信号,用于策略更新。该信号既保留测试验证的硬约束,又引入质量偏好,引导策略生成干净、针对性的实现,避免冗余或越界修改。

与同类 GRPO 变体相比,GAGAR 不改变通过/失败的二元奖励结构,而是通过 组内 agentic 评分与优势保持再分配,在维持总优势量守恒的前提下实现质量感知的信用转移。

实验

实验设计

论文使用 MiMo-V2.6-Flash (310B 参数) 与 MiMo-V2.6-Pro (1.02T 参数) 的 pre-RL SFT 检查点。先做受控 code-only Flash 实验,对比 GRPO 基线(测试通过轨迹获得相同 advantage)与 GAGAR。GAGAR 采用动态采样保留同时含通过/失败轨迹的 rollout groups;组内由 SFT 训练的 agentic grader 共同检查并排序通过轨迹,再执行 sum-preserving advantage redistribution。此外进行大规模 mixed-task RL,以及消融 sum-preserving redistribution。

关键发现

  • 在 code-only Flash 实验中,GAGAR 提升 code agent 性能,降低 trajectory-length 增长,训练更稳定。
  • 在大规模 mixed-task RL 中,Flash 与 Pro 均观察到一致收益。
  • 质量感知信用再分配使策略倾向更干净、针对性的实现,抑制超出范围的改动。
  • 消融证明 sum-preserving redistribution 是保持相对偏好并重分配信用的关键。

对比解读

GRPO 对每个 group 内所有 test-passing 轨迹赋予相同 advantage,丢失实现质量差异。GAGAR 通过组内排序下加权低质量轨迹,并按原始 advantage 总和等比缩放保留通过轨迹的整体 credit,将信用转移至高质量实现,同时不改变组间相对重要性。这为 test-based RL 补充了质量信号。工程上,该框架依赖一个额外的 SFT 训练 grader,可能引入评估偏差,但其收益表明在可执行测试之外增加代理质量评估能改善代码 agent RL 的样本效率与行为偏好。

行业影响

落地场景

GAGAR 适用于 代码生成与编程助手、自动化 CI/CD 修复、企业级代码库维护 等产品。例如:在电商平台的后台开发中,用 LLM 自动生成优惠券逻辑或交易流程代码,GAGAR 能优先生成精确、无多余改动的实现,减少后续 review 和回滚成本;在内容平台的推荐系统服务端,自动修复 bug 时避免引入无关重构,降低发布风险。

商业价值

核心收益在 降低维护成本与提升交付质量。通过抑制冗余代码生成,减少代码审查耗时、合并冲突和线上事故;训练更稳定可节省 GPU 重训或超参搜索成本;对客户而言,高质量代码建议提高编程助手订阅留存与口碑。

与现有产品/工作流的接口

GAGAR 可作为 GRPO/RLHF 训练 pipeline 的奖励后处理插件,在现有可执行测试奖励之后,增加一个 SFT 训练的 agentic grader 对通过轨迹排序,并做 sum-preserving advantage redistribution,无需替换测试框架或在线推理链。工程上,可将 grader 封装为独立的 reward model 服务,在 rollout buffer 写入优势前调用;对已有的代码 agent 产品(如 IDE 插件、CI bot),可用离线训练阶段采集的轨迹持续更新 grader,再反向优化线上策略。

局限

  • 动态采样机制要求每个 rollout group 内部必须同时包含通过和失败的轨迹,这在训练早期或面对高难度任务时可能难以满足,导致 quality-aware redistribution 无法稳定执行。同时,动态采样策略本身增加了采样复杂度和额外样本消耗,可能降低训练吞吐。该方法对测试用例的区分度(能否产生同时 pass/fail)有一定依赖。
  • 排序依赖 SFT 训练的 agentic grader,其判别质量直接影响优势重分配效果。如果 grader 对某些实现风格存在系统性偏好(例如过度简洁或过度工程化),则可能引入新的偏差。此外,grader 的推理过程带来额外计算开销,在大规模 RL 中需要权衡收益与成本。论文未详细评估 grader 错误对最终策略的影响。
  • 实验主要在代码 agent 场景开展,虽包含 mixed-task RL,但仍以代码相关任务为主。论文定义的质量标准(clean、targeted、adherence)针对代码实现,能否迁移到数学推理、问答等非代码领域尚不明确。此外,优势重分配仅调整 pass 轨迹之间的相对优势,并未改变 fail 轨迹的优势,可能导致探索信号不足。
论文Jinhao Dong2026-09-26原文

相关内容