SPADE: 自适应合成可执行环境中的自我对弈
持续自我改进需要不断扩展的、自生成的、多样化的自适应目标池。对于语言智能体而言,现有的训练环境池(手工精选、静态合成或冻结验证器)在学习者扩展时保持目标分布固定,限制了开放式自我提升。 为此,我们提出 SPADE(Self-Play in Adaptive Synthetic Executable Environments),一个自我对弈强化学习框架。其中,单个 LLM 扮演两个角色:环境设计器(Environment Designer)以可执行代码形式编写完整的长视野训练环境,采用 OpenAI Gym 风格的 reset() / step() 接口;以及推理智能体(Reasoning Agent)学习在其中行动。每个环境都是有状态的多轮环境(状态转移、奖励函数和验证代码),因此一个接口可同时涵盖推理问题和多步智能体工具使用。推理智能体的遗憾通过有无特权提示时的奖励差距来估计;在优化这一遗憾信号的过程中,环境设计器学会将环境定位在智能体能力边界,同时保持环境可行。 通过大量实验,我们发现若干关键成功要素:将环境设计器锚定到从大型预训练语料库采样的文档,并赋予其累积环境记忆。扩展到 30B 参数模型后,SPADE 在八个保留的数学、科学、代码和推理基准上平均比最强的固定环境基线高出 +5.3;在工具使用场景中,BFCL-v4 多轮上提升 +5.7,ACEBench-Agent 上提升 +13.9;在游戏场景中,与最强基线的差距随模型规模扩大而增大。通过将环境设计本身变为可学习组件,SPADE 朝着开放式自我改进迈出了切实一步。
论文精读
TL;DR SPADE 让单一 LLM 自博弈:同时担任环境设计师与推理智能体,用后悔信号生成可执行 Gym 环境并逼近能力边界,在八项推理与工具使用基准上平均提升 +5.3,最高 +13.9。
问题
问题背景
当前语言模型的持续自我改进依赖于不断扩展的自生成目标池,如何自动生成多样、自适应且可执行的训练环境成为焦点。
现有方法局限
- 手工策展环境成本高、覆盖窄,难以规模化,且无法随模型能力动态调整。
- 静态合成环境生成后目标分布固定,模型能力增长后仍训练同一分布,导致边际收益递减。
- 冻结验证器只提供二元对错信号,无法指示环境难度是否处于代理能力边缘,因此不能指导环境设计。
- 推理任务与多步工具使用任务接口割裂,现有环境池难以用统一框架覆盖。
为什么难/重要
让环境设计本身成为可学习组件,需要生成可执行、可验证、难度自适应的代码环境,难点在于:
- 环境必须可解(可行性)且处于代理能力边界(前沿性),否则训练停滞或无效。
- 自博弈中设计者与代理的奖励信号需耦合,本文用基于提示的遗憾(regret)估计为设计者提供学习信号。
- 统一
OpenAI Gym风格reset()/step()接口可覆盖推理与工具使用,但环境设计空间的探索与利用平衡极具挑战。 此问题关乎开放式自我改进,业界关注如何将环境设计从外部固定组件变为模型内部可优化部分。
行业类比
类似自动驾驶仿真平台自动生成越来越复杂和多样化的驾驶场景,以持续提升决策模型的泛化能力。
核心洞察
- 环境设计者通过 regret 信号实现自适应课程学习。SPADE 让单一 LLM 同时作为环境设计者和推理代理,设计者根据代理在有/无特权提示下的奖励差距(regret)来调整生成环境的难度,使环境始终位于代理能力边缘。与固定环境池或静态合成环境不同,这种机制将环境设计本身变成可优化参数,从而支持开放式自我改进,并且实验表明随着模型规模增大,优势更加明显。
- 代码作为环境统一了推理与工具使用。SPADE 中环境以 Python 代码实现,提供 OpenAI Gym 风格的 reset()/step() 接口,既能表达长时程推理任务,也能模拟多步工具调用场景。这种统一表示使同一训练框架可以同时提升数学、科学、代码等推理基准以及 BFCL-v4、ACEBench-Agent 等工具使用基准,避免了为不同任务设计不同环境格式的碎片化问题,为通用 agent 训练提供了基础设施。
方法
输入与角色定义
SPADE 采用双角色自博弈框架:单个 LLM 同时承担 Environment Designer(环境设计者)与 Reasoning Agent(推理代理)。输入包括:
- 从大规模预训练语料库采样的文档(用于 grounding,保证环境多样性与真实性);
- 累积环境记忆(accumulated environment memory),使设计者能参考历史生成记录避免重复并追踪难度演进。
关键模块:代码即环境
环境设计者将任务直接写成可执行 Python 代码,实现 OpenAI Gym 风格的 reset() / step() 接口。每个环境包含:
- 状态转移逻辑:定义 agent 动作如何改变内部状态;
- 奖励函数:返回标量奖励;
- 验证代码:判定任务完成或正确性(尤其在数学、科学、代码等可验证领域);
- 多轮回合结构:同时覆盖推理问题与多步 agentic 工具调用。
推理代理在该代码环境中通过 RLVR / GRPO 进行策略优化,无需额外手工奖励模型。
核心机制:基于提示的遗憾奖励
对每个环境,计算推理代理在两种条件下的奖励差:
- 无特权提示(without privileged hints):代理仅靠自身能力探索;
- 有特权提示(with privileged hints):提供 ground-truth 线索或子目标分解。
两者奖励差称为 regret(遗憾),作为环境设计者的优化信号。设计者被训练最大化 regret,从而自动生成处于代理能力边界、既有挑战性又可行的环境;同时保持可行性避免不可解任务。
输出与训练流程
- 环境设计者输出可执行环境源代码;
- 推理代理在该环境中交互,产生轨迹与奖励;
- 环境设计者根据 regret 信号更新,生成下一轮更难或更合适的环境;
- 循环持续,形成开放式的自我改进。
与同类方法的差异
SPADE 将环境设计本身变为可学习组件,而非固定/静态合成环境池,使目标分布随学习者能力动态调整,这是相较于 hand-curated、statically synthesized、frozen-verifier 等固定环境策略的关键区别。
实验
实验设计
SPADE 采用双角色自博弈 RL:同一个 LLM 分别作为 Environment Designer 和 Reasoning Agent。环境以可执行代码形式生成,提供 OpenAI Gym 风格的 reset()/step() 接口。训练覆盖 games、tool use 和八个 held-out math/science/code/reasoning 基准。核心机制是基于特权提示的 regret 信号,让环境设计器瞄准代理能力边缘。
关键发现
消融显示两个组件至关重要:从大规模预训练语料中采样文档进行 grounding,以及积累环境记忆。扩展至 30B 参数模型后,SPADE 在八个基准上平均提升 +5.3,在 BFCL-v4 multi-turn 提升 +5.7,在 ACEBench-Agent 提升 +13.9;games 场景下相对最强基线的优势随模型规模增大而扩大。
与基线对比
最强固定环境基线(fixed-environment)维持固定目标分布,而 SPADE 将环境设计本身变为可学习组件。这种自适应机制使训练目标持续逼近代理能力边界,避免了固定验证器或静态合成环境的分布饱和问题。优势在 tool use 和 games 上尤其明显,说明该框架具备跨领域泛化潜力。
行业影响
落地场景
SPADE 适用于需要大量多样化长程训练环境的场景:企业级智能体平台(客服、运维、销售自动化)、软件工程辅助(代码生成、测试)、科学计算与教育模拟(虚拟实验、自适应习题)。其核心是让同一个 LLM 生成适应学习者能力的环境,因此可以持续扩展训练任务池。
商业价值
- 降本:替代人工设计环境与基准,减少专家标注成本,环境生成可无限扩展。
- 增收/体验:通过提升模型在复杂推理与工具调用上的表现,改善产品自动化水平,例如减少人工客服介入率、提高代码生成准确率。
- 可持续迭代:自博弈机制让模型能力与环境难度同步提升,避免固定环境带来的能力饱和。
接口与集成
生成的环境符合 OpenAI Gym 风格 reset()/step() 接口,可直接接入现有 RLVR/GRPO 训练流程;环境设计器可基于企业私有文档语料接地,生成贴合业务的模拟环境;模型可作为微调组件替换现有策略模型。
具体 use case:电商平台售后智能体训练——自动生成包含多步骤退换货、物流异常、优惠叠加计算的工作流环境,训练 Agent 在长程对话中调用订单查询、库存系统等工具;教育平台可自动生成数学证明或物理模拟环境,动态调整难度。
局限
- **计算与工程复杂度过高**:SPADE 需要同时训练环境设计者和推理智能体,环境设计者生成完整可执行代码并验证,推理智能体在动态环境中多轮交互,整体训练 token 消耗和基础设施需求远超静态合成环境或手工环境。论文未提供与基线的训练成本对比,也未讨论超参数对资源敏感度。对资源受限团队,直接复现 30B 规模自博弈训练门槛较高,可能限制其大规模应用。
- **环境质量受预训练语料库制约**:论文强调将环境设计者 grounding 在大规模预训练语料文档上以提升多样性,但语料库分布可能造成生成环境的领域偏置或盲区。若语料库中某类知识稀疏,则对应环境难以出现;若存在语义偏见,可能生成有歧义或不合规的任务。此外,生成的可执行环境代码可能包含未预期的副作用或安全漏洞,论文未详细说明沙箱隔离与代码审计机制。
- **遗憾信号存在策略性利用风险**:环境设计者的奖励基于有提示与无提示奖励差(遗憾),理论上可能诱导其生成过度困难或定义模糊的环境以持续获得高遗憾奖励,即使有可行性约束,长期训练仍可能出现对抗性环境设计。论文在 games 域观察到多样性维持,但未系统分析环境设计者的失败模式或奖励 hacking 现象,也未给出鲁棒性缓解策略。