EnvACE: 通过世界预演内化环境动态以实现智能体强化学习
训练大语言模型智能体进行长程工具使用,通常依赖与真实或合成的可执行环境交互,其构建与验证成本高昂,或依赖难以落地的外部模拟器。 本文提出 EnvACE 方法,用 世界预演 替代训练时的外部环境交互。策略在行动与预演之间交替:先产生工具调用,再扮演环境生成该动作引发的响应,并基于预演响应进行后续决策。两个角色通过任务成功奖励端到端联合优化。通过世界预演,策略将动作与环境响应的关系内化到参数中,形成直接支持决策的 智能体世界模型。 在 BFCL-v4、tau^2-Bench、VitaBench 与 FinMCP-Bench 上,EnvACE 表现强劲且可迁移,全面超越环境扩展基线。控制实验表明,世界预演在不同模型规模下一致提升策略学习。测试时,内化的世界模型可在提交执行前进行私有预演,在适度预演预算下带来额外收益。 这些发现确立了世界预演作为一条超越外部环境约束、扩展 LLM 智能体训练的新路径。代码已开源。
论文精读
TL;DR EnvACE 让 LLM 智能体训练时**无外部环境**,通过轮流扮演动作/环境两个角色进行 **世界排练**,将环境动态内化到模型参数中,实现端到端的智能体强化学习,在多个基准上性能超越传统环境扩展方法,且支持测试时私有排练进一步提升。
问题
问题背景
基于大语言模型的智能体(LLM Agent)在长程工具使用任务中,通常需要通过与环境交互获取反馈信号来优化策略。当前主流方法依赖真实环境或合成的可执行环境(如 API 模拟器、沙盒),但这些环境的构建与验证成本高昂,限制了训练数据的规模化扩展。
现有方法局限
- 环境依赖过重:无论是真实 API 调用还是代码沙盒执行,每次交互都需耗时构建、维护一致性,且错误响应可能污染训练流。
- 可扩展性瓶颈:环境数量与多样性受限于工程资源,无法像纯文本语料那样无限扩展,导致 RL 训练中的探索覆盖面不足。
- 反馈稀疏与噪声:长程任务中,环境仅在任务结束时返回稀疏奖励,且环境模拟误差(如工具 API 版本差异)易引入错误反馈,误导策略学习。
- 外部模拟器难接地:合成环境可能与真实分布偏移,训练出的策略在部署时出现性能衰退。
为何重要与困难
技术挑战在于让 LLM 同时扮演决策者和环境模拟器:模型需要内化“动作-环境响应”的因果关联,确保排练出的虚拟反馈具备足够保真度以支撑有效策略更新,而非产生幻觉式反馈。业界关注度高,因为 LLM 智能体的自主规划与工具调用能力是迈向通用个人助手或自动化智能体的关键,而当前训练范式受制于环境构造成本,难以 scaling。如果能让模型通过“内心排练”替代外部交互,将大幅降低训练门槛,并支持持续在线学习。
行业类比
类似自动驾驶中利用世界模型进行端到端规划训练——无需每次踩油门试错,而是在内部模拟各种路况反馈,从而高效优化驾驶策略。EnvACE 将这一思想引入 LLM 智能体领域,用世界排练构建内部环境模拟器。
核心洞察
- **世界排练替代外部环境交互** 是 LLM Agent 强化学习的新路径。传统的 Agent 训练依赖真实或合成的可执行环境,构建与验证成本高、扩展性差。EnvACE 让策略同时扮演行动者与环境,通过生成工具调用后再自行生成响应,将“行动-结果”关系内化到模型参数中,彻底消除了对独立外部环境的依赖。与基于仿真的方法相比,这种内化的世界模型不仅降低了训练门槛,还天然地避免了环境与策略间的分布偏移,使大规模训练更可行。
- **内化世界模型支持私有排练** 赋予了模型测试时思考的能力。训练完成后,EnvACE 的策略内化了一个可运行的世界模型,这使得 Agent 在正式执行前可以自行进行多次头脑预演,评估不同行动的可能结果,从而选择更优决策。这种机制本质上是一种无需外部环境交互的 test-time scaling,与仅靠外部搜索或额外标注数据的做法不同,它利用了策略自身的一致性,可在有限预算下稳定提升性能,尤其适用于工具调用等长程任务。
方法
EnvACE 是一种智能体强化学习(Agentic RL)方法,核心创新是用 世界排练(World Rehearsal) 替代训练阶段的外部环境交互,使策略模型同时扮演行动者(Actor) 与环境模拟器(Environment Simulator) 两个角色。
输入
- 任务上下文(
context):用户指令、历史对话、可用工具定义。 - 任务成功奖励(
reward):仅依赖最终任务结果,无需过程标注。
关键模块:世界排练与联合优化
- 交替生成:模型先以行动者角色生成工具调用(
tool_call),随后立即切换到环境角色,基于当前状态与行动生成模拟的环境响应(rehearsed_response),并将该响应拼接到历史中,用于后续多步决策。这一循环(action → rehearsal → response → next action...)让策略在不接触真实环境的条件下完成完整交互轨迹的模拟。 - 角色统一优化:所有行动者逻辑与环境模拟逻辑共享同一组模型参数,通过 角色感知的 GRPO(Group Relative Policy Optimization) 进行端到端优化。该方法在计算优势函数时区分不同角色,避免角色差异导致的梯度偏差,并直接使用任务成功奖励作为唯一监督信号。
- 测试时扩展:训练完成后,内部化的世界模型允许在真实执行前进行私人排练——即模型可私密生成多条模拟轨迹并自我验证,再选择最优行动输出,从而在有限的额外计算预算下提升测试性能。
输出
- 内部化了环境动态(environment dynamics) 的策略模型:其参数中编码了“行动-状态变化-反馈”的因果关联,形成一个与决策直接耦合的智能体世界模型(agent world model)。测试时可直接生成行动,也可利用排练进一步提升稳健性。
与同类方法的差异
不同于 RAGEN 等通过合成环境或外接模拟器扩展交互数据的训练范式,EnvACE 完全不存在训练时的外部环境依赖,将环境建模与策略学习融合为单一模型参数的联合优化,从而解耦了对具身环境或可执行验证器的需求,开辟了 LLM 智能体 Scaling 的新方向。
实验
实验设计
EnvACE 在四个覆盖长程工具使用的基准上进行评估:BFCL-v4、tau^2-Bench、VitaBench 和 FinMCP-Bench,以衡量方法的性能与可迁移性。训练阶段完全摒弃外部环境交互,改为策略在「行动—世界排练」两阶段间交替:首先生成工具调用,然后扮演环境角色生成相应响应,所有步骤通过 GRPO 端到端优化。对比基线包括依赖真实或合成执行环境、外部模拟器的 environment-scaling 方法。控制实验针对世界排练的有效性、模型规模影响、训练动态及测试时扩展(rehearsal budget)进行消融。
关键发现
世界排练显著提升了策略学习,使模型参数内部化行动与环境响应的关系,形成直接服务于决策的 agent world model。在所有基准的总体评估中,EnvACE 超越了环境扩展基线,且性能在不同模型规模上一致提升。即使训练时未使用外部环境,测试时利用内部世界模型进行有限次数的私人排练(无需额外交互),仍能带来进一步增益,验证了环境动态被有效捕获。
与基线对比
相较于传统方法,EnvACE 的核心差异在于 用世界排练替代了昂贵且难以接地气的环境交互。环境扩展基线通常需要构建或验证可执行环境,不仅成本高,且约束了训练规模。EnvACE 通过联合优化双角色,直接从任务奖励中学习环境规律,既降低了训练开销,又将环境知识压缩进模型参数,实现了跨基准的强可迁移性。这一路径突破了外部环境扩展的瓶颈,为 LLM 代理训练提供了新的规模化可能。
行业影响
落地场景
- 智能客服与自动化工作流:LLM 智能体需要多步工具调用(如查询订单、创建工单、退款),训练时无法实时访问生产 API。EnvACE 的 world rehearsal 让模型在训练中自行模拟工具返回,无需外部环境,可快速产出可用的交互策略。
- 金融风控与投研助理:涉及复杂的数据库查询与多源数据整合,构建高保真模拟环境成本极高。内部排练降低了对真实数据流的依赖,加速策略迭代,并可在部署前通过私有排练预判风险。
- 企业 IT 运维自动化:查询服务器状态、执行脚本、分析日志等场景中,环境异构且安全敏感。EnvACE 能内部化运维工具的响应模式,训练出的智能体可泛化到不同基础设施,避免直接在生产环境试错。
商业价值
- 大幅度降低训练环境成本:免去构建、验证和维护外部模拟器或沙箱的工程开销,让中小团队也能训练复杂的工具使用 Agent。
- 提升任务成功率与泛化能力:策略网络通过内部排练学习到更鲁棒的动作-响应因果链,在新工具、新场景中表现更稳定,直接减少人工介入,实现降本增效。
- 测试时增益:内部化的世界模型支持 私有排练(private rehearsal),在正式执行前低成本推演,进一步提高决策质量,推动自动化率提升。
与现有工作流的集成
- 直接插入现有 LLM 强化学习训练管线(如 GRPO),不需要修改推理架构,只需在训练阶段引入交替的 acting/rehearsal 数据生成模式。
- 测试时的私有排练可封装为一个独立的推理前置步骤,与 LangChain、Semantic Kernel 等主流 Agent 框架无缝对接,或以 API 形式透出给现有网关,无需额外基础设施。
具体落地 Use Case
- 电商售后客服智能体:处理退货时需依次查询订单状态、验证物流、生成退款指令。EnvACE 在训练中让模型自行扮演这些 API 的返回环境,学习完整的决策链,训练成本远低于搭建全功能沙箱,且测试时的私有排练能预测并规避错误操作。
- 金融合规报告生成:从多个内部系统提取交易数据、风险指标并生成监管报告。EnvACE 可内部化各个数据接口的响应特征,训练出的 Agent 在缺失真实连接时也能学习正确编排,显著降低对预生产环境的依赖,加速上线周期。
局限
- **环境模拟误差累积**:World rehearsal 依赖模型自身生成环境响应,其质量受限于基础模型的先验知识和当前任务分布。当工具调用的结果涉及精确计算、动态数据库访问或复杂状态变更时,生成式响应可能偏离真实返回,导致策略在误差累积下做出次优决策。论文在 VitaBench 等需要精确工具输出的任务上可能观察到性能波动,但未量化这种误差对 long-horizon 任务的系统性影响。
- **训练奖励稀疏与优化稳定性**:EnvACE 使用任务成功奖励进行端到端联合优化,虽然配合 GRPO 可以缓解部分问题,但环境模拟部分的反馈间接且延迟,可能导致世界模型在早期训练中产生无意义或矛盾的响应,影响策略收敛速度。与使用稠密中间奖励或显式环境监督的方法相比,该方法在复杂任务上的训练效率仍有待验证,且未讨论对超参数(如角色切换频率、奖励裁剪)的敏感性。
- **推理阶段计算开销**:测试时的 private rehearsal 虽然能提升性能,但每个动作前额外进行环境模拟显著增加了推理延迟与 token 消耗,限制了在低延迟场景或资源受限部署下的实用性。论文虽分析 rehearsal budget 的影响,但未对比在相同推理预算下通过更优策略或检索增强等方法可能获得的收益,也未提供在实时交互应用中的可行性评估。