GoLongRL:面向能力的长上下文强化学习与多任务对齐
现有长上下文强化学习(RL)方法常将数据构建视为设计复杂检索路径,导致任务覆盖同质化、奖励设计不合理。为此,我们提出 GoLongRL,一个完全开源、面向能力的后训练方案,使用可验证奖励进行长上下文强化学习(RLVR)。 能力导向数据构建 是核心贡献之一。我们公开了包含 23K 个 RLVR 样本的数据集、完整构建流程和训练代码。根据长上下文能力分类,数据集覆盖 9 种任务类型,每种类型配有原生评估指标。样本来源包括从书籍、学术论文、多轮对话等真实文档生成的合成样本,以及精选的现有语料。在相同 vanilla GRPO 设置下,该数据集性能超越闭源数据集 QwenLong-L1.5。使用该数据训练的 Qwen3-30B-A3B 模型在长上下文任务上达到与 DeepSeek-R1-0528 和 Qwen3-235B-A22B-Thinking-2507 相当的水平,表明更广覆盖和更多样化奖励对长上下文能力提升有显著益处。 TMN-Reweight 是另一贡献,用于解决异质多任务优化中的挑战。它结合 任务级均值归一化(对齐跨任务奖励尺度)和 难度自适应加权(获得更可靠的优势估计),相比 vanilla GRPO 进一步改善平均性能,并在已报告评估中保持或提升通用能力。
论文精读
TL;DR GoLongRL 通过能力导向的多任务对齐与开源数据集,结合异构奖励重加权方法,显著提升长上下文强化学习性能,较小模型即可媲美大规模闭源方案。
问题
问题背景
长上下文处理能力已成为大语言模型的关键瓶颈,业界通过强化学习结合可验证奖励进行后训练,以提升模型对长文档、长对话及复杂推理链的利用效率。
现有方法局限
现有长上下文 RL 方法普遍将数据构造简化为设计更复杂的检索路径,导致:
- 任务覆盖同质化:训练样本高度集中于少数检索模式,忽视长文本摘要、多跳推理、对话状态跟踪等现实需求,能力迁移性差。
- 奖励函数单调:所设计的奖励仅适配单一任务,在多任务训练时无法对齐不同任务的奖励尺度,造成优化偏差。
如原文所述:“homogeneous task coverage and reward formulations that inadequately reflect practical long-context requirements”,数据多样性与奖励合理性均显不足。
难题与重要性
- 技术挑战:
- 数据构建成本高:为每个任务配适自然验证指标,并生成高质量、跨领域的 RLVR 样本,需大量人工或复杂的合成流水线。
- 异构奖励优化难:在 GRPO 等 RL 算法中,不同任务的奖励数值可能相差数个量级,若不进行任务级均值归一化和难度加权,优势估计会严重失真,导致训练不稳定或灾难性遗忘。
- 业界焦点:随着上下文窗口扩展至百万 token,如何让模型有效利用长上下文成为开源社区与工业界的核心关切。DeepSeek-R1-0528、Qwen3-235B 等大型模型的激烈角逐也印证了该能力的重要性,但闭源方案限制了可复现性与改进空间。
行业类比
类似多任务学习中需对不同任务损失进行加权归一化以避免模型偏向高损失任务,在长上下文 RL 中,若不处理跨任务奖励尺度差异,模型将倾向于优化奖励数值大的任务,损害整体长上下文能力。
核心洞察
- 长上下文强化学习的核心瓶颈常被误认为在于训练算法,但实际是任务覆盖与奖励设计。已有方法专注构造复杂检索路径,导致任务单一、奖励脱节。GoLongRL 基于能力分类设计9类多元任务,引入自然评价指标,并用开源数据集展示:相同GRPO下超越闭源QwenLong-L1.5,性能接近更大模型。这验证了广泛任务覆盖与奖励多样性对长上下文能力提升的关键作用。
- 多任务RLVR中,奖励尺度与难度差异使传统优势估计失真。TMN-Reweight 先以任务级均值归一化对齐跨任务奖励,再通过难度自适应权重调整优势计算,抑制大奖励任务主导更新。该方法在长上下文任务上提升平均性能,同时维持通用能力,为异构多任务强化学习提供轻量且稳定的优化方案。
方法
数据构建:能力导向的多任务覆盖
GoLongRL 的方法核心围绕能力导向的数据构建 与异构多任务优化 展开。
输入:长上下文 RL 训练通常依赖可验证奖励(RLVR),即答案可通过规则或程序自动判定对错的任务。传统做法侧重于设计复杂的检索路径,导致任务类型同质、奖励单一。
关键模块一:能力分类与数据集构造
- 作者定义了一个长上下文能力分类体系,涵盖 9 种任务类型,如:事实问答、多跳推理、信息聚合、时间线梳理等,每种任务匹配其自然的评估指标(如精确匹配、F1、Rouge-L)。
- 数据集包含 23K 条 RLVR 样本,来源包括:
- 从已有语料中筛选的开源样本;
- 基于真实文档(书籍、学术论文、多轮对话)生成的合成 QA 对。
- 全部数据、构建管线与训练代码均已开源发布(GoLongRL HuggingFace 合集)。
关键模块二:TMN-Reweight 异构奖励优化
- 在原始 GRPO 框架下,不同任务的奖励尺度差异巨大(如 0/1 准确率 vs. 0~100 的 F1),直接平均会导致优化偏向高方差任务。
- TMN-Reweight 提出两步修正:
- 任务级均值归一化(Task-level Mean Normalization):将每个任务的奖励减均值除标准差,对齐跨任务尺度。
- 难度自适应加权(Difficulty-Adaptive Weighting):根据当前策略在该任务上的优势估计的置信度动态调整权重,抑制噪声信号的干扰。
输出:模型在长上下文能力上显著提升。仅在 Qwen3-30B-A3B 上使用 GRPO 训练,性能即可匹敌 DeepSeek-R1-0528 和 Qwen3-235B-A22B-Thinking-2507,且通用能力保持不降。
与同类方法的差异: 不同于单纯追求检索路径复杂度的做法,GoLongRL 从任务多样性 与奖励校准 两个维度系统性地提升长上下文 RL 的效果,验证了“覆盖度”比“难度”更关键。
实验
实验设计
基于 GRPO 框架,在 23K 多任务 RLVR 样本上训练 Qwen3-30B-A3B 模型。数据覆盖 9 种长上下文能力类型,每个任务配对自然评估指标,来源包括真实书籍、论文、多轮对话等生成的 QA 对。实验对比三个维度:
- 数据集:GoLongRL 与闭源 QwenLong-L1.5 在相同 vanilla GRPO 下的效果;
- 模型能力:训练后模型与 DeepSeek-R1-0528、Qwen3-235B-A22B-Thinking-2507 等大型思考模型的性能比较;
- 优化方法:提出的 TMN-Reweight(任务级均值归一化 + 难度自适应权重)与 vanilla GRPO 的消融。
关键发现
- 仅替换数据集,GoLongRL 在 vanilla GRPO 下超越 QwenLong-L1.5,验证了能力导向数据构造的有效性。
- 基于该数据训练的 30B 模型,长上下文性能与两个百亿级以上思考模型相当,说明更广泛的覆盖和奖励多样性能大幅提升长上下文能力,即使模型规模较小。
- TMN-Reweight 进一步优于 vanilla GRPO,在异构任务中平均性能提升,同时通用能力保持不变或改善。
与基线的对比解读
与 QwenLong-L1.5 对比表明,单纯提高检索复杂度容易造成任务同质化,而 GoLongRL 的 9 类任务设计提供了更贴合真实长文本需求的奖励信号。与 DeepSeek-R1 等更大模型的持平,凸显了高效数据策略和面向能力的后训练对缩小模型规模差距的潜力。TMN-Reweight 针对异构奖励引入的归一化和重加权,解决了多任务优化中 advantage 估计不稳定的工程痛点,对多奖励 RL 训练有直接借鉴意义。
行业影响
落地场景
GoLongRL 面向长上下文场景的强化学习后训练方案,适用于需要处理超长文档、多轮对话或复杂检索的 AI 产品。典型落地业务包括:
- 知识密集型应用:企业级智能客服、法律合同审查、学术论文辅助写作。模型需理解数十页文档并给出精准回答,GoLongRL 的多任务对齐与多样化奖励设计可直接提升这些场景的指令遵循与事实一致性。
- 内容生产与审核:长视频摘要、播客节目笔记、合规性审计。它的能力导向数据构造(9 类任务)使模型能同时优化抽取、推理、对话等异构能力,减少二次微调成本。
- 编程助手:长代码仓库理解与多文件重构。其 GRPO 变体 TMN-Reweight 在异质奖励环境下稳定优化,适合多编程语言、多框架组合的复杂开发辅助。
商业价值
核心价值路径是 降本增效 与 体验提升:
- 降本:全开源的数据、代码、训练流可显著减少企业自研长上下文 RLHF 的成本。
- 增效:在同等 GRPO 设置下,其数据集表现优于闭源清光长 L1.5,且用 30B 参数模型达到接近 DeepSeek-R1-0528 等更大模型的性能,这为企业部署轻量级、高性能长上下文模型提供了可行路径,降低硬件投入。
- 体验提升:多任务覆盖使单一模型同时处理问答、摘要、事实核查等,提升用户在同一产品内的连贯体验,减少多模型切换带来的延迟与一致性风险。
与现有产品/工作流的接口
GoLongRL 以 GRPO 框架为基础,可无缝嵌入当前主流的 RLHF 流水线:
- 数据层:其 23K 样本依赖真实源文档生成 QA 对,可直接作为
trl或DeepSpeed-Chat等库中 RL 阶段的数据格式,替换或补充现有偏好数据。 - 训练层:TMN-Reweight 算法是在 GRPO 优势估计上的轻量级改造,通过任务级均值归一化与难度自适应权重修正,可集成到任何基于策略梯度的 RL 训练器中,无需额外模型或架构变更。
- 部署层:训练出的模型为标准的因果语言模型,可直接用 vLLM、TGI 等引擎部署,并方便与检索增强生成 (RAG) 系统结合,增强长上下文推理能力。
具体落地 Use Case
案例 1:国际电商平台的自动化合同审核
某跨国电商需要审核数千份供应商合同,合同长达数十页。使用 GoLongRL 训练的模型可同时执行关键条款抽取、合规风险推理与多语言摘要。相比传统小模型流水线,端到端方案减少接口开销,且 TMN-Reweight 优化后的模型在处理不同长度的合同时,奖励信号更稳定,避免模型偏好短文本捷径。
案例 2:在线教育平台的个性化学习导师
一家在线教育平台希望提供基于整本教材的智能问答与学习路径推荐。GoLongRL 的多任务数据集包含从书籍、论文中合成的样本,能训练模型理解章节逻辑与前后文引用。结合平台的 RAG 系统,模型为学习者提供证据锚定在教材原句的解释,并通过难度自适应加权提升对基础概念与复杂推导不同难度问题的适配性。
局限
- 论文未深入讨论TMN-Reweight中难度加权系数对超参数的敏感度,实际应用时可能需要额外调优才能在不同任务分布上稳定生效。此外,奖励归一化依赖任务级分组,当引入新任务或任务分布变化时,需重新统计历史奖励基线,影响线上部署灵活性。
- 数据构造虽然覆盖9类能力,但合成样本对书中抽取的问答对、多轮对话的生成质量高度依赖源LLM的能力,可能引入幻觉或事实错误,论文未系统评估合成数据噪声对最终模型真实性的影响。另外,数据集规模仅23K,在长上下文中对复杂推理任务的覆盖密度可能不足,扩展性有待验证。
- 实验主要对比了Qwen3-30B-A3B和DeepSeek-R1-0528等,但未在更大规模模型上进行验证;长上下文评测多集中在检索和摘要类指标,缺少对多跳推理、工具调用等更复杂长上下文交互场景的覆盖,泛化性评估不够全面。