论文

可验证环境是乐高积木:面向推理泛化的递归组合

可验证环境是乐高积木:面向推理泛化的递归组合

强化学习结合可验证环境已成为提升大语言模型(LLM)推理能力的有效途径。已有研究表明,增加环境数量可改善强化学习性能,但传统的人工或独立构建方法受限于线性扩展瓶颈,阻碍了可扩展的推理泛化。 本文提出 RACES(递归自动组合环境扩展) 框架,将可验证环境视为可组合的构建模块,通过递归组装实现自动扩展。核心思想是:当一个环境的输出类型与另一环境的输入类型匹配时,两者可自动融合为新的可验证环境,从而支持递归组合。RACES 包含 300 个独立环境,并定义了一组组合操作符(SEQUENTIAL、PARALLEL、SORT、SELECT),以诱导多样化的推理模式。 大量实验表明,在组合环境上训练强化学习能持续增强推理泛化能力。具体地: 1. RACES 使 DeepSeek-R1-Distill-Qwen-14B 在六个基准上平均提升 3.1 分(从 48.2 到 51.3); 2. 将 Qwen3-14B 的性能从 58.8 提升至 61.1; 3. 仅需 50 个基础环境即可达到 300 个独立环境相当的训练效果,显著提高了环境利用效率。

论文精读

TL;DR RACES 将可验证环境视为可组合积木,通过递归自动组合突破手动构建的线性瓶颈,用少量基础环境即可实现大规模训练效果,显著增强推理泛化。

问题

问题背景

利用可验证环境(verifiable environments) 进行强化学习(RL),已成为提升大语言模型(LLM)推理能力的重要范式。可验证环境提供确定性的 reward 信号(例如代码执行、数学定理验证),避免了 reward hacking 问题,但其效果高度依赖环境的数量多样性,以迫使模型学习通用推理策略而非表面捷径。

现有方法局限

当前环境构造主要依赖人工设计或独立自动生成,面临三大瓶颈:

  • 线性扩展天花板:环境数量增长与人力/算力投入呈线性关系,难以规模化。当环境数从 10 扩至 100 时,收益可能显著,但进一步扩至 1000 时边际收益骤降,且构造复杂度剧增。
  • 缺乏组合式推理覆盖:单一环境往往只针对特定原子技能(如算术、排序),无法自动组合出需要多步复合推理的场景(例如“先筛选再排序后求和”)。手动组合这些场景既低效又容易遗漏。
  • 环境类型隔离:不同环境间输入/输出类型不兼容导致无法直接串联,现有方法未将环境视为可自由拼接的类型化模块

技术挑战与重要性

该问题的核心挑战在于:

  1. 类型约束的组合:环境常具有特定的输入域(domain)和输出域(codomain),组合时必须保证类型匹配,否则会产生无意义的 trajectory,污染训练。
  2. 组合爆炸与质量控制:穷举所有可能组合会导致指数级的环境数量,如何选取有效且不冗余的组合是难点;同时,组合后的环境仍需保持可验证性(reward 信号明确)。
  3. 泛化与效率的平衡:RL 训练需要大量环境来提升泛化,但实际部署时资源有限,亟需**“环境高效”** 的方法——用少量基础环境产生等效于大量独立环境的训练效果。

业界日益关注如何从“单一任务 RL”走向“通才推理器”,该问题的解决将推进 RL 在 LLM 上的规模化应用,与 scaling law 在数据侧的探索形成呼应。

行业类比

如同软件工程中组合测试(combinatorial testing) 通过少量参数组合覆盖大量场景,训练通用推理模型也需要一种“环境组合器”,以有限原子环境自动生成海量复合任务,将环境设计从手工作坊升级为自动化流水线。

核心洞察

  • 将可验证环境视为可组合的LEGO积木,通过输入输出类型匹配实现递归自动合成,从线性环境扩展转变为组合爆炸,为强化学习训练提供近乎无限多样的推理任务。这与现有手工或独立环境构建方法形成对比,后者扩展线性,难以支撑大规模泛化。RACES框架仅用少量基础环境,即可通过组合生成大量复杂复合环境,大幅提升了环境利用效率,使得模型在未见基准上的推理能力稳步提升。
  • 组合算子系统性地定义了顺序、并行、排序、选择等关系,将不同环境结构化融合,迫使模型学习协调多种推理模式。这种复合训练生成了覆盖更广泛认知能力的任务分布,比单纯增加独立环境数量更有效。实验表明,即使只使用50个基础环境,通过组合训练也能达到使用300个独立环境的性能,证明组合而非堆积是增强推理泛化的关键路径。

方法

RACES 方法

输入 是一组可验证环境,每个环境被形式化为一个从(输入类型)到值域(输出类型)的映射,并且具备自动验证输出正确性的能力。

关键模块递归自动组合引擎:

  • 类型驱动链接:当环境 A 的值域与环境 B 的域匹配时,自动将 A 的输出作为 B 的输入,串联成新环境。
  • 组合算子:定义了四种算子,诱导不同推理模式——SEQUENTIAL(顺序执行)、PARALLEL(并行处理后合并)、SORT(排序操作)与 SELECT(条件分支)。这些算子本身可递归应用到已组合的环境上,形成深度嵌套结构。
  • 递归扩展:从少量基础环境(如 50 个)出发,反复應用算子,自动生成大量非线性的复合环境,每个复合环境仍保持可验证性(输出可自动判别对错)。

输出 是规模化、结构多样的训练环境池,直接供给 RL 训练(例如基于 process reward 或 outcome reward 的优化)。

工程启示:RACES 将环境构造从“手工逐一打造”转变为“组合式生产”,大幅降低领域专家介入成本;算子带来的结构化推理链(如先排序再筛选)能系统性地提升模型泛化能力。与同类方法的差异在于:以往工作依赖线性增加手工环境数量,RACES 则通过基于类型兼容的递归组合实现指数级扩展,环境利用率显著更高,且在仅 1/6 基础环境时即可达到同等训练效果。

实验

实验设计

RACES 从 300 个个体可验证环境出发,定义 SEQUENTIALPARALLELSORTSELECT 四种组合算子,自动递归融合生成复合环境。RL 训练在这些复合环境上进行,而后在六个未参与环境构建的多样推理基准上评估泛化性能。基座模型采用 DeepSeek-R1-Distill-Qwen-14BQwen3-14B,以衡量方法对不同模型架构 / 规模的影响。

关键发现

  • 推理泛化全面提升:RACES 将 DeepSeek-R1-Distill-Qwen-14B 平均得分从 48.2 提升至 51.3(+3.1),Qwen3-14B 从 58.8 提升至 61.1(+2.3),六个基准均未见训练环境,表明组合式环境促进的推理能力可跨任务迁移。
  • 环境利用效率显著:仅用 50 个基础环境 进行递归组合,RL 训练效果与直接使用全部 300 个个体环境相当,打破了环境数量线性扩展的瓶颈。
  • 组合算子多样性有效:不同算子诱导的顺序推理、并行分解、排序比较、选择性聚焦等模式协同提升泛化,验证了递归组合的 LEGO 积木式设想。

与基线对比的深度解读

传统方法需逐个手工构建或独立生成环境,扩展成本随环境数量线性增长。RACES 通过组合算子自动合成指数级多样的训练场景,同等算力下获取更丰富的推理模式。即使基础环境大幅缩减,递归组合仍能逼近甚至追平全量个体环境的性能,这揭示了一个关键洞见:可验证环境的“类型兼容性”是比数量更核心的规模化要素。与纯粹的 environment scaling 相比,RACES 提供了一条高效、低冗余的 RL 训练扩展路径,尤其在大模型推理能力持续迭代的工程实践中,能显著降低环境构造与数据采集的成本,同时对未见基准的泛化表现稳健,显示出组合多样性对于避免过拟合特定推理表面形式的重要性。

行业影响

落地场景

RACES 通过可验证环境的递归组合,自动生成海量、多样的推理任务,直接服务于以 LLM 为核心的知识密集型应用。在 智能客服 中,可将退货政策、物流追踪、支付争议等独立环境组合为复合查询,训练模型进行多步闭环推理;在 金融风控 中,可将反洗钱规则、交易图谱、监管条款环境融合,使模型具备跨领域的合规推理能力;教育辅导 平台能将数学、逻辑、编程题环境按题型和难度自动叠加,生成个性化训练数据;医疗决策支持 中,组合症状、检查、用药等知识环境,产出可靠的多步诊断路径。

商业价值

价值核心在于大幅降低环境构造的人工成本,传统手动搭建 100 个环境需数周专家工时,RACES 用 50 个基环境即可通过组合算子达到等效 300 个环境的训练效果(论文显示 300 环境复合训练与 300 个独立环境性能相当),直接减少标注与工程开支。同时,RL 训练后模型在 6 个未见基准上平均提升 3.1 分(DeepSeek-R1-Distill-Qwen-14B),推理准确率的提升可转化为 产品体验的质变,如客服首解率上升、合同审查遗漏减少,从而降低运营成本并提高用户留存,对 SaaS 产品有明确的增收逻辑。

与现有产品/工作流的接口

RACES 可封装为环境管线组件,对接主流 RL 框架(如 OpenRLHF、veRL)和 LLM 微调平台。实践中,企业可将自身业务文档、规则库、API 交互定义为 viable_env 基类,然后通过组合算子自动生成复合训练集;生成的轨迹与 reward 可直接喂入 PPO/GRPO 流程。CI/CD 中可安排定期重新组合环境,实现 持续学习,将新业务规则快速注入模型。例如,电商平台将促销规则、库存查询、售后政策三个 base env 用 SEQUENTIALPARALLEL 算子组合,自动产生“大促期间换货加赠品”的复杂推理链,无需人工编写完整对话模版。

局限

  • **组合操作的通用性受限**:RACES 依赖预定义的操作符(SEQUENTIAL、PARALLEL、SORT、SELECT)和严格的类型匹配(域与陪域一致)来触发组合,但现实中的推理任务往往包含非结构化的语义依赖与隐含约束,难以被直接映射为这些操作原语。当基环境涵盖的推理模式有限时,递归组合可能生成大量冗余或噪声任务,而缺乏自动筛选高质量组合的机制,可能导致 RL 训练中出现奖励信号漂移或训练不稳定。
  • **实验规模与泛化验证不足**:当前评估仅基于 14B 参数的开源模型,未在更大规模(如 70B+)或更小模型上进行扩展性分析,也未与基于程序式合成数据、进化算法等环境生成方法进行直接对比。此外,组合环境虽在六个未见于训练阶段的基准上取得提升,但未报告 RL 训练收敛速度、环境质量对最终性能的敏感度,以及组合环境与人工设计环境在分布偏移下的鲁棒性差异,这些因素可能限制该框架在生产管线中的直接复用。
论文Hao Xiang2026-06-10原文

相关内容