Terminal Agents 的环境进化
交互式且可验证的环境对训练 terminal agents 至关重要。随着前沿模型能力增强,从零合成的环境挑战性逐渐下降,所提供的学习信号有限。近期共进化(co-evolution)方法基于 rollout 中暴露的弱点,在模型可学习边界附近迭代合成环境。然而,其对 on-policy rollout 的依赖限制了泛化能力,也难以在模型变强后持续提供学习信号。 为解决上述问题,本文提出环境进化方法,通过 off-policy 方式增量提升环境难度,并在训练中按代调度进化后的环境,以提供连续学习信号。我们从多轮学习目标中推导出三个影响环境难度的进化方向,并借助循环工程的多智能体框架(loop-engineered multi-agent harness)实现这些方向的进化。 定量 rollout 实验中,我们使用 Hy4 preview、Claude Opus 5 和 GPT-5.6 Sol 验证了环境进化能持续生成更难的环境。在 Qwen3.6-27B 与 Qwen3.6-35B-A3B 上通过简单的长时程 RL 训练,该方法分别在 Terminal-Bench 2.1 上带来 14.4 和 18.0 个百分点的性能提升。
论文精读
TL;DR 针对终端智能体的环境进化方法,以离线方式逐代提升任务难度,通过循环多智能体生成持续学习信号,使 Qwen 模型在 Terminal-Bench 2.1 上性能提升 14.4–18.0 个百分点。
问题
问题背景
训练通用终端智能体时,强化学习环境正成为新的扩展维度;环境的难度与多样性直接决定智能体通过可验证反馈能学到什么,而当前领域更关注如何持续提供有效学习信号。
现有方法局限
两条路线各有瓶颈:
- 从头合成环境:随机或固定模板生成的任务不随模型能力动态调整,前沿模型很快饱和,学习信号衰减。
- 共同进化(co-evolution):依赖
on-policyrollouts 暴露模型弱点,再围绕可学习前沿合成新环境。这导致环境生成过度绑定当前模型行为,限制对未见分布泛化;且模型变强后需要更多 rollout 才能挖掘弱点,持续供应学习信号的代价与延迟上升,环境进化速度可能跟不上模型提升。
为什么这个问题难/重要
环境难度需要与模型学习曲线同步,但合成环境是开放生成问题,需同时控制可控难度、多样性与可验证性。业界已投入规模化 agentic RL 基础设施,环境侧成为瓶颈:若环境不变,模型在已有任务过拟合,无法泛化到真实终端交互;若进化不当,可能生成错误或超出可学习范围的任务,浪费训练资源。
行业类比
类似自动驾驶仿真中,若场景库不随模型能力动态扩充更复杂、长尾的交通事件,模型只会对常见路况过拟合,无法处理罕见但高风险的边缘案例。
核心洞察
- 环境演化(environment evolution)将环境难度提升从依赖 on-policy 弱点的被动适应转变为 off-policy 的主动渐进调度。与传统的 agent–environment co-evolution 不同,后者必须在当前策略 rollout 中暴露弱点才能生成新环境,一旦策略变强或分布偏移,演化信号就会衰减,且容易过拟合当前策略。off-policy 环境演化可以基于历史数据或外部种子独立推进,配合 lineage scheduler 按世代调度,确保训练全程提供持续且泛化的学习信号。
- 从 multi-turn learning objective 推导出三个影响环境难度的演化方向,把环境修改从启发式试错升级为可解释的梯度式调整。以往环境合成方法多依赖随机变异或人工调参,缺乏对任务难度来源的形式化分析。该工作直接对多轮学习目标做分解,识别出决定难度的关键维度,再通过 loop-engineered multi-agent harness 沿这些方向闭环迭代,使环境演化过程具有可复现、可扩展的工程化框架,为大规模 RL 训练提供了稳定的环境供给方案。
方法
环境演化方法
环境演化 以离线策略方式从初始种子环境库出发,通过循环工程的多智能体协作逐步提升任务难度。输入包括种子环境和可选的参考模型能力评估,但不需要当前策略模型自身的 rollout 暴露弱点。
1. 关键模块
多回合学习目标 → 三个演化方向:作者从多轮交互的优化目标出发,推导出三个影响环境难度的方向,用于指导后续演化。具体方向由理论学习目标决定,覆盖任务解决所需的能力维度。
Loop 1: Plan Refinement Loop:基于序列引导,对完成任务的计划/步骤序列进行精炼,提高任务对规划能力的要求。
Loop 2: Environment Refinement Loop:在精炼后的计划基础上,对环境定义本身(如文件系统状态、依赖约束、初始配置)进行迭代修改,使任务更难被现有模型解决。
Evolution-Lineage Scheduler:将演化产生的环境按世代(generation)排列,训练时按世代逐步投入,而不是一次性混入所有难度环境,从而维持连续的学习信号曲线。
2. 输出与验证
输出为一系列逐步加难的终端任务环境,用于长时域 RL 训练。在 Qwen3.6-27B / Qwen3.6-35B-A3B 上训练后,Terminal-Bench 2.1 得分分别提升 14.4 / 18.0 个百分点。
与依赖 on-policy rollouts 的 co-evolution 方法不同,本方法完全离线生成环境,不依赖模型当前表现作为演化信号,因此随着模型变强仍能持续提供有效学习梯度。
实验
实验设计
论文提出 环境演化(environment evolution),通过 off-policy 方式增量提高任务难度,并利用 loop-engineered multi-agent harness 沿三个从多轮学习目标导出的方向进行演化。实验首先在 Hy4 preview、Claude Opus 5、GPT-5.6 Sol 三个前沿模型上做 rollout 实验,验证演化后环境难度一致提升;随后在 Qwen3.6-27B 和 Qwen3.6-35B-A3B 上进行 long-horizon RL 训练,用 Terminal-Bench 2.1 评测性能。
关键发现
- 环境演化在多个模型中稳定产生更难的终端任务环境。
- 在 Terminal-Bench 2.1 上,两个模型分别提升 +14.4 pp 和 +18.0 pp,表明 off-policy 演化与调度能持续提供学习信号。
- 相比依赖 on-policy rollouts 的 co-evolution 方法,本方法泛化性更好,且随模型增强仍能保持难度增长。
基线对比解读
与 co-evolution 相比,环境演化不依赖每次 rollout 暴露的弱点,而是通过多智能体 harness 主动设计难度,避免 on-policy 采样带来的偏差与学习信号衰减。实验增益在两种不同规模模型上均显著,说明方法具有模型无关性。
行业影响
落地场景 终端智能体训练环境自动化生成,适合云平台智能运维助手、DevOps 命令行交互测试、自动化脚本执行等产品。
商业价值 主要走降本与体验提升:环境演化减少人工设计维护成本,离策略调度避免每次训练都跑 on-policy rollout,提高 GPU 利用率与训练吞吐。模型在持续难度递增的环境下学习,任务成功率提升(本工作在 Terminal-Bench 2.1 提高 14.4/18.0 个百分点),直接改善自动化运维响应速度与可靠性。
与现有工作流的接口 可作为独立环境生成服务嵌入 RL 训练 pipeline:多智能体 harness 输出环境配置与终端指令,通过统一 API 接入 Ray 或 Kubernetes 部署的训练器;演化调度器按代分配难度,环境可缓存复用,降低实时交互开销。相比 co-evolution 依赖 on-policy rollout 的弱点,本方法支持离线演化,更适配大规模异步训练。
具体 use case
- 云平台智能运维:生成从单命令检查到多步故障定位的终端任务,训练 agent 处理 SSH 登录、日志分析、配置修改;环境演化持续增加多步推理和异常场景,减少人工干预。
- 电商数据处理自动化:构建 SQL 查询、ETL 脚本执行环境,演化难度从单表查询到多表关联与脏数据清洗,让 agent 学会处理复杂数据管道,提升数据团队效率。
局限
- **离线演化依赖外部前沿模型与高推理成本**:环境难度提升由 Hy4 preview、Claude Opus 5、GPT-5.6 Sol 等多智能体循环完成,这些模型的生成与评判能力直接决定演化质量;若目标训练模型能力接近或超过这些外部模型,演化信号可能退化,无法持续提供有效学习信号。同时多智能体协作的工程复杂度高,每次环境更新需多次大模型调用,实际部署中可能限制迭代频率与扩展规模。
- **实验范围较窄,泛化性未充分验证**:RL 训练仅在 Qwen3.6-27B 和 Qwen3.6-35B-A3B 两个模型、Terminal-Bench 2.1 单一基准上验证,提升 14.4/18.0 个百分点虽显著,但未覆盖其他规模模型、终端任务或更通用智能体基准,难以判断离线环境演化是否只是过度拟合该基准的任务分布,或对工具使用、多步推理等能力有更广泛的迁移效果。
- **方法缺少理论保证与自动化分析**:三个演化方向从多轮学习目标推导,但循环工程设计依赖人工提示词与多智能体协作,缺乏对演化轨迹、难度单调性或收敛性的形式化证明;与 on-policy 协同演化方法的对比可能不够全面,未系统分析离线调度带来的分布偏移风险,也未验证在更长训练周期下是否需要持续注入新环境以维持学习信号。