论文

Beyond Reward Engineering: A Data Recipe for Long-Context Reinforcement Learning

Beyond Reward Engineering: A Data Recipe for Long-Context Reinforcement Learning

长上下文推理是大语言模型的关键能力,尤其当模型作为自主代理需要推理长轨迹时。强化学习 近期成为提升该能力的主流范式,但现有工作多聚焦于奖励工程,而多样化的训练数据仍然稀缺。本文从数据视角重新审视该问题,发现仅靠简单有效的数据配方,配合最小化的基于结果的 GRPO 设置,即可大幅提升长上下文推理。 数据配方针对三个互补的任务族:检索、多证据合成和推理,为此构建并整理了8个数据集,共约 14K 样本。在 Qwen3-4B/8B/30B-A3B 三个模型上的实验表明,在7个长上下文基准上平均提升 +7.2/+3.2/+6.4 分,超越了先前的 RL 训练集。 进一步,这些增益可迁移至代理任务:在代理微调模型上继续使用我们的数据配方进行 RL 训练,使 GAIA 提升 +4.8 分,BrowseComp 提升 +7.0 分。我们将发布数据集以促进未来研究。

论文精读

TL;DR 从数据中心视角出发,精心构建检索、多证据合成和推理三类数据集,搭配最小化 GRPO 强化学习,大幅提升长上下文推理能力,效果超越以往奖励工程为主的方案。

问题

问题背景

长上下文推理是当前大型语言模型部署为自主代理时的核心能力,尤其在需要理解冗长历史轨迹的任务中至关重要。随着强化学习成为提升此类能力的首选范式,业界正积极寻找更高效的训练方案。

现有方法局限

现有强化学习方法普遍过度聚焦奖励工程,盲目堆砌复杂奖励函数的同时,却忽略了训练数据本身的构建:

  • 现成数据集稀缺且多样性不足,多局限于简单的单点检索或短程推理,难以覆盖真实场景中常见的信息综合、多证据审计等需求。
  • 单纯优化奖励会引发泛化瓶颈——模型在训练集上指标虚高,但在未见过的长上下文基准(如 HELMET、LOOZA)上增益微弱,甚至出现对幻觉的过度拟合。
  • 数据规模与任务覆盖面的匮乏,导致RL 训练收益急剧衰减,无法稳定迁移到更复杂的 agentic 决策链路中。

为什么难 / 重要

长上下文推理的挑战源于双重要求:信息定位精度跨片段逻辑链条构建。模型必须从数万 token 的噪声中精准提取关键证据,再完成跨实体关联、多跳推断乃至数学推导。手工构建此类数据极其耗时:

  • 设计能覆盖检索、多证据合成、纯推理等互补能力的任务家族,需要领域专家反复验证;
  • 上下文长度分布、任务平衡策略、奖励设计之间的相互作用高度非线性,任一环节失调都会摧毁训练稳定性。 在业界,随着 GAIA、BrowseComp 等 agentic 评测被广泛采纳,长上下文推理已成为衡量大模型自主性的核心标尺。

行业类比

这类似于搜索引擎管道优化:若只精心调整排序公式(奖励),但索引库(数据)质量低劣、查询覆盖偏窄,最终系统的实搜体验必然崩塌。高质量、结构化的数据烹饪,才是突破长上下文推理上限的真正杠杆。

核心洞察

  • - **数据多样性而非奖励设计是长上下文RL的关键**:现有工作多聚焦于奖励工程,但本工作表明精心构建的互补数据集(检索、多证据合成、推理)仅14K样本,搭配最简单的基于结果的GRPO,即可在多个基准上平均提升+7.2分(Qwen3-4B),超越先前的RL训练集。这揭示了任务覆盖度比奖励函数细节更重要。
  • - **任务组合的协同效应超越单一类型**:数据菜谱中包含`FuzzyNeedle`、`MultiNeedle` 等检索任务,`CrossEntity`、`LongDocQA` 等合成任务,以及 `LongMath` 推理任务,消融实验表明三类任务缺一不可,去除任何一类均导致退化。这种多证据链的混合训练迫使模型同时学习定位、聚合和逻辑推导,是实现鲁棒长上下文推理的核心。
  • - **长上下文RL训练可直接迁移提升智能体能力**:在通用长上下文数据上RL调优后,继续在智能体微调模型上使用相同数据配方训练,可将 GAIA 提升+4.8分、BrowseComp 提升+7.0分。这表明长上下文推理是智能体执行多步轨迹任务的基础技能,且数据配方具有跨任务通用性,为构建通用型智能体提供了低成本路径。

方法

本文提出一种以数据为中心的长上下文强化学习方案,核心思路是用精心设计的数据配方替代复杂的奖励工程,配合最简化的GRPO (Group Relative Policy Optimization) 训练,即可显著提升大模型的长上下文推理能力。

数据构建:三类互补任务

训练数据覆盖三类能力,共 8 个数据集约 14K 样本:

  • 检索型FuzzyNeedle(模糊匹配检索)、MultiNeedle(多事实检索),要求模型在长文本中定位关键信息。
  • 多证据合成CrossEntity(跨实体推理)、WebSearch(网页搜索式合成)、MultiQuery(多查询整合)、KeyChain(链式线索串联)、LongDocQA(长文档问答),强制模型综合多处分散证据才能得出答案。
  • 推理型LongMath(长上下文数学推理),测试在冗长背景下完成逻辑推导的能力。

训练流程:最小化 GRPO + 多数据集稳定化

  • 输入:每个样本是(长上下文问题,标准答案)对,上下文长度覆盖 4k–128k tokens,分布贴合实际长程场景。
  • 强化学习框架:采用 GRPO 目标,直接优化策略模型,以结果导向奖励驱动——仅根据最终答案是否正确给出二元或数值反馈,不对中间推理过程施加任何稠密奖励或过程监督。
  • 多数据集稳定训练:通过动态采样策略平衡各数据集贡献,避免模型偏向某一任务,同时引入梯度累积与适当的批次大小控制,保证不同难度和长度的样本都能有效学习。

输出与效果

在 Qwen3-4B/8B/30B-A3B 上训练后,模型在七项长上下文基准上平均提升 +7.2/+3.2/+6.4 分,且泛化到长上下文代理任务(GAIA +4.8,BrowseComp +7.0)。

与同类方法的差异:以往工作聚焦奖励工程(如过程奖励、密集反馈),而本方法证明,只要数据本身足够全面且覆盖长上下文所需的关键认知子能力,即便使用最朴素的结果奖励,也能超越复杂奖励设计的效果,将创新重心从“怎么奖”转移到“奖什么数据上”。

实验

实验设计

本文验证一种数据驱动的长上下文 RL 策略,刻意保持奖励设计极简,仅使用基于结果正确性的二元奖励(GRPO)。从检索、多证据综合与推理三类互补任务构建八个数据集,共计约 14K 样本。实验在三个不同规模模型上展开:Qwen3-4B(dense)、Qwen3-8B(dense)和Qwen3-30B-A3B(MoE),并在七个长上下文基准上评测。此外,还设计 Agent 迁移实验:在已有的 agent-tuned 模型上继续 RL 训练,考察对 GAIABrowseComp 的影响。

关键发现

  • 这套数据配方结合最小化 GRPO 设定,普遍带来显著提升:4B 平均 +7.2 分,8B +3.2 分,30B-A3B +6.4 分,超越所有先前 RL 训练集
  • 增益在更长上下文下仍能保持,表明模型学到了通用的长程推理能力。
  • 长上下文 RL 训练可迁移到 agentic 任务:在 agent-tuned 模型上继续训练后,GAIA 提升 +4.8,BrowseComp 提升 +7.0,证明该方法对真实世界智能体场景有效。
  • 消融实验揭示三类任务均有贡献,多证据综合推理任务效果尤为突出,单纯的检索任务不足以保证性能。

与基线的深度对比

此前长上下文 RL 工作多聚焦于奖励函数设计(如过程奖励、稠密奖励),而本文结果打破了“奖励工程是核心驱动力”的认知。采用完全 outcome-based 的 GRPO 就足以获得强劲增益,关键在于多样且结构化的训练数据。与同模型上的先前最佳 RL 数据相比,本文配方在多个尺度上均展现出稳定优势,说明数据多样性(检索 + 合成 + 推理)比单一种类的多跳 QA 更有效。这一发现提示工程实践者:在预算有限时,优先投资数据构造可能比复杂的奖励塑造更具性价比。

行业影响

该方法从数据配方切入长上下文强化学习,对工业界有直接参考价值。

落地场景

  • 自主Agent:需要长轨迹推理的任务(如网页浏览、多步工具调用),可直接应用本文的 GRPO + 数据配方,提升复杂指令遵循与信息合成能力。
  • 法律 / 金融文档分析:处理百页合同、研报,需精准检索与多证据综合,该数据驱动的长上下文训练可降低幻觉、提升答案可信度。
  • 智能客服:长对话历史中的情绪追踪、服务条款引用、跨轮次推理,均可通过此方法增强模型表现。
  • 教育与科研助手:长文本问答、文献综述生成,模型能更有效地定位和关联多个证据片段。

商业价值

  • 降本:减少昂贵的人工奖励工程与 Prompt 调试,仅靠 ~14K 高质量数据即可获得平均 +3.2 至 +7.2 点的基准提升,训练成本可控。
  • 增收:更高精度的长上下文推理可转化为更低 Churn rate、更高用户满意度的 AI 产品,间接拉动订阅 / 调用量。
  • 体验提升:在 GAIA、BrowseComp 等代理任务上 +4.8 和 +7.0 的增益,意味着面向用户的 Agent 产品更可靠,直接降低出错率与人工介入频率。

与现有产品 / 工作流的接口

  • RLHF 管线集成:GRPO 是当前主流在线 RL 算法,可直接嵌入已有的 RLHF 流程,无需大幅改动基础设施。
  • 数据即插即用:公开数据集(8 个任务,涵盖 retrieval、multi-evidence synthesis、reasoning)可作为基础训练集,或按实际业务场景扩展同类任务数据,快速复用配方。
  • 与 Agent 框架协同:在已有 agent-tuned model 上继续 RL 训练,证明该方法可作为 Agent 性能的后训练增强插件,与LangChain、各类 function calling 栈无缝衔接。

具体工业场景示例

  • 电商智能导购助手:处理用户长达数十轮的比价、问询、售后会话,利用长上下文 RL 模型一次性综合多商品信息、政策条款与历史对话,精确生成推荐或解决争议,减少转人工率。
  • 企业级知识库问答:面向大型技术文档与内部工单,模型需从分散的段落中检索并合成答案。使用本文数据配方后,MultiNeedle 与 CrossEntity 等任务能力提升,直接转化为更准确的工单自动分类与解决方案推荐。

局限

  • **合成数据多样性有限**:论文精心构造的三个任务家族(检索、多证据合成、推理)仍主要依赖模板化合成与现有知识库,无法覆盖真实长上下文场景中广泛存在的 **噪音干扰、信息冲突、动态更新** 等复杂特性。例如,检索任务使用固定模式的针状信息,多证据合成基于结构化文档拼接,这可能高估模型在杂乱网页或非结构化文档流上的实际表现。此外,总计约 14K 的样本量相对较小,限制了训练数据分布的广度,可能导致模型对训练集中未曾出现的任务形态或风格过拟合。
  • **模型与基准泛化性待验证**:所有实验仅基于 **Qwen3-4B/8B/30B-A3B** 三个模型,未涉及任何其他主流架构(如 Llama、Gemma、DeepSeek 等),因此结论的普适性存疑。评测基准集中在 HELMET 等现有长上下文测试集,其任务形式与训练数据高度耦合,而论文虽然展示了向代理任务(GAIA、BrowseComp)的迁移,但显著提升可能部分源于这两类任务同样依赖检索和证据综合,未彻底证明该数据配方对 **代码级长上下文推理、长期规划、多轮工具调用** 等更具挑战性的代理场景同样有效。
  • **对超长上下文扩展性未探明**:实验默认上下文长度为 64K tokens,尽管论文测试了 128K 的泛化,但并未深入分析 **百万 token 级** 的超长上下文场景。随着上下文长度急剧增长,GRPO 的奖励信号稀疏性加剧,基于检索和综合的任务设计能否保持有效尚未可知,且计算成本(特别是多证据综合类任务的提示构造开销)可能成为瓶颈。论文未给出训练效率数据,也未讨论数据规模扩大(如 100K+ 样本)时的训练稳定性和收益递减问题,限制了工程落地参考价值。
论文Xiaoyue Xu2026-06-17原文

相关内容