EnfFactory: 通过可执行环境合成与鲁棒强化学习扩展工具使用智能体
现有方法通过智能体强化学习(Agentic RL)赋予大语言模型(LLM)工具使用能力时,面临两大瓶颈:缺乏可扩展、鲁棒的执行环境,以及训练数据难以捕捉人类隐含的推理过程。传统方案依赖昂贵的真实 API、易产生幻觉的 LLM 模拟器,或仅支持单轮交互的合成环境,且生成轨迹往往过度指定,类似于指令序列而非自然意图,削弱了 RL 训练效果。 本文提出 EnfFactory 自动化框架,同时解决上述挑战。该方法从真实资源中自主探索并验证有状态的可执行工具环境,通过拓扑感知采样与校准精炼技术合成自然的多轮轨迹,生成包含隐含意图的接地查询(grounded queries)。仅需跨越 7 个领域的 85 个已验证环境,EnfFactory 即可产出 2,575 条 SFT 和 RL 轨迹。 实验表明,相比此前常用 5 倍以上环境的方法,EnfFactory 以更少资源实现更优训练效率与下游性能:在 BFCLv3 上提升 Qwen3 系列模型最高 +15%,在 MCP-Atlas 上提升 +8.6%,在对话基准 τ²-Bench 和 VitaBench 上提升 +6%。 通过完全自动化环境构建与轨迹合成,EnfFactory 为 Agentic RL 提供了可扩展、可扩展且鲁棒的基础。
论文精读
TL;DR EnvFactory 全自动合成可执行工具环境与自然多轮轨迹,用极少环境高效训练 LLM 工具使用能力,性能大幅提升。
问题
问题背景: 当前 AI 领域聚焦于让大语言模型(LLM)具备强大的工具使用能力,通过 Agentic Reinforcement Learning(Agentic RL)训练智能体与外部工具进行多轮交互,是提升复杂任务解决能力的主流路径。
现有方法局限:
- 执行环境构建瓶颈:真实 API 调用成本高、难以大规模部署;基于 LLM 的模拟器易产生幻觉、状态不可靠;现有合成环境大多为单轮或依赖预收集的静态文档,缺乏动态状态管理与多轮交互支持。
- 训练数据质量低:合成的轨迹往往过度具体(over-specified),类似于指令序列而非自然人类意图,缺少 隐含意图(implicit intents),导致 RL 训练时探索空间受限、模型泛化性差,无法有效学习真实场景下的隐式推理。
为什么这个问题难/重要: 构建 有状态、可执行、多轮 的工具环境需要从真实资源(如 API 文档、网站)中自主探索和验证,确保环境正确且动态适应,涉及自动化环境生成与校验技术。同时,生成自然的多轮轨迹需理解任务拓扑,通过 拓扑感知采样(topology-aware sampling)和 校准精炼(calibrated refinement)来产生带有隐含意图的复杂查询,技术难度高。该问题直接关系到 Agentic RL 的可扩展性和经济性,是迈向通用工具智能体的关键瓶颈,业界急需低成本、高保真的训练范式。
行业类比: 类似于自动驾驶需要高保真仿真器训练感知决策,工具智能体的训练也亟需可交互、动态的工具环境,才能学习真实世界中的复杂交互策略。
核心洞察
- 从真实资源自动构建有状态、可执行的环境,替代了高成本的真实 API 和幻觉严重的 LLM 模拟器。EnvFactory 通过自动探索与验证,从文档站点提取工具定义并构建沙盒执行环境,确保操作的确定性和闭环反馈。相比依赖在线 API 或模拟器的方法,它不仅避免了 API 调用费用和速率限制,还消除了 LLM 模拟器的幻觉问题,使 RL 训练获得真实、一致的环境奖励,从根本上提升了训练信号的可靠性。
- 通过拓扑感知采样生成隐式意图的自然多轮轨迹,突破了合成数据过度指定、缺乏人类真实推理的瓶颈。EnvFactory 分析工具间的依赖图,按拓扑路径采样真实工作流,并引入校准精炼步骤,使查询保留隐式意图,而非简单的指令序列。对比以往将 tool-use 简化为单步调用或填充模板的做法,这种设计生成的轨迹更接近人类交互模式,训练出的模型在复杂多步工具调用任务上泛化能力更强。
- 以极少的训练环境和轨迹实现显著的性能提升,证明任务环境和轨迹质量比数量更重要。EnvFactory 仅用 85 个环境和 2575 条轨迹,就将 Qwen3 系列模型在 BFCLv3 上提升 15%,在 MCP-Atlas 上提升 8.6%,优于使用 5 倍以上环境的基线。这颠覆了堆数据量的传统思路,表明高保真环境的自动构建与面向意图的轨迹生成是小样本下提升 Agentic RL 效果的关键路径。
方法
EnvFactory 方法框架由三个核心模块构成:环境构建、依赖工具图 与 轨迹合成,输入为真实的工具文档或 API 资源,输出是高质量的 SFT 与 RL 训练轨迹。
1. 环境构建
EnvFactory 自动探索并验证有状态、可执行的工具环境。它从真实资源(如 API 文档)中提取工具定义,通过主动调用与结果校验,确保环境可运行且无幻觉,避免了对 LLM 模拟器的依赖。
2. 依赖工具图
为捕获工具间的复杂依赖关系,EnvFactory 构建 依赖工具图(Dependency Tool Graph),其中节点为工具,边表示调用顺序或参数依赖。基于该图,采用 拓扑感知采样 生成合理的多步工具组合场景,使训练数据覆盖真实的多轮交互路径。
3. 轨迹合成
利用图采样结果,EnvFactory 通过 校准优化(calibrated refinement)合成自然的 多轮工具使用轨迹。该过程并非生成明确的指令序列,而是产出包含 隐含意图 的 grounded queries——用户请求中不显式指定所有子任务,而是需要模型自行在对话中推断和规划工具调用,更贴近真实人类使用习惯。最终得到 2,575 条轨迹,覆盖 85 个验证环境、7 个领域,用于 SFT 与 Agentic RL 训练。
与现有方法相比,EnvFactory 不依赖昂贵 API 或与预收集文档绑定的单轮环境,而是通过拓扑感知采样与隐含意图的合成,以更少的环境数量产生更高效的训练数据,显著提升 RL 训练的下游性能。
实验
实验设计
EnvFactory 自动从真实资源中探索并验证了 85 个可执行工具环境,覆盖 7 个领域;通过 拓扑感知采样 与 校准精细化 生成了 2,575 条多轮 SFT 与 RL 轨迹。这些轨迹用于训练 Qwen3 系列模型,并在四个标准基准上评估工具使用能力:BFCLv3、MCP-Atlas、τ²-Bench 和 VitaBench。对比基线包括未使用 EnvFactory 的原始 Qwen3 模型,以及先前依赖数百个环境或 LLM 模拟器的合成数据方法。
关键发现
- 仅需先前工作约 1/5 的环境数量,EnvFactory 即取得更优的训练效率和下游性能。
- 在 BFCLv3 上最高提升 +15%,MCP-Atlas 提升 +8.6%,对话基准平均提升 +6%。
- 全自动化环境构建与轨迹合成避免了 API 成本与 LLM 幻觉,生成的隐式意图查询比过度指定的指令序列更贴近真实人类推理,显著提升了 RL 训练的鲁棒性。
与基线对比的深度解读
先前方法多依赖人工定制的单一回合环境或依赖预收集文档的合成器,不仅扩展性差,还因轨迹的过度指定而降低 RL 效果。EnvFactory 通过端到端自动化,在环境数量大幅缩减的前提下仍实现一致的性能优势,证明 拓扑感知采样 能捕捉工具间的依赖与状态转移,而 校准精细化 有效过滤噪声并保持自然的多轮交互结构。这一结果揭示了可验证、可执行环境的规模远不如其真实性和轨迹质量重要,为低成本、可扩展的 Agentic RL 提供了可复现的工程范式。
行业影响
落地场景
EnvFactory 自动生成高保真工具环境和多轮对话轨迹,赋能以下场景:
- AI 客服代理:为电商平台、金融服务等构建包含订单查询、物流追踪、支付退款等复杂工具链的训练环境,训练模型端到端处理多轮会话,减少人工兜底。
- 内部工作流自动化:企业 IT 部门可快速将内部 API(如 HR 请假、报销、项目管理)转化为可执行环境,训练专用代理提升员工自助服务效率。
- IoT 设备控制:智能家居或工业自动化中,合成跨设备、多步骤操控序列,训练模型理解隐式意图(如“准备早晨会议”隐含开灯、煮咖啡、播放日程)。
商业价值
- 降本:摆脱对昂贵真实 API 调用或人工编写密集指令格式的依赖,全自动管道将环境构建与轨迹合成的人力成本降低一个数量级。与需要 5 倍以上环境的前工作相比,EnvFactory 仅用 85 个环境即实现更优训练效率,显著节省算力与数据准备成本。
- 增效:模型工具调用基准(BFCLv3、MCP-Atlas)提升高达 +15%,对话质量提升 6%,意味着代理任务完成率越高,客户满意度与续费率越高。
- 体验提升:合成轨迹模拟自然人类意图(而非过度指定的指令序列),使模型更贴近真实交互,降低幻觉与错误调用,增强用户信任。
与现有产品/工作流的集成
EnvFactory 产出的 SFT 和 RL 轨迹可直接用于主流 RL 训练框架(如 TRL、VeRL),通过以下方式融入现有技术栈:
- 数据生成流水线:作为开源微调工具链的前置环节,接受自定义 API 定义后自动构建环境并合成轨迹,输出标准化训练集。
- 模型训练:生成的数据兼容 Qwen 等系列模型,可结合 LoRA 等高效微调方法注入多工具调用能力。
- 与 MCP 生态对齐:EnvFactory 构建有状态、可执行的工具环境天然适配 MCP(Model Context Protocol)服务器规范,训练出的代理可直接接入 MCP 客户端生态。
具体落地案例
- 全球电商平台:构建包含价格查询、库存检查、优惠券验证、下单支付的跨工具场景,合成多轮训练轨迹,训练后的客服代理可理解“我想用上次那个八折券买那双打折的鞋,能寄到纽约吗?”并串联调用。
- 医疗问诊助手:将预约挂号、病历查询、药品相互作用检查等 API 映射为环境,生成隐式意图对话(如“最近总是头痛,上次开的药还有效吗?”),训练模型安全、合规地调用工具链。
局限
- **环境规模与多样性有限**:尽管仅用 85 个环境即取得显著效果,但这些环境涵盖 7 个领域,仍可能遗漏大量工具使用模式。自动化验证高度依赖工具文档的完整性与真实性,若文档缺失或描述模糊,环境生成可能出错或遗漏边缘情况,导致合成轨迹覆盖不足。与依赖大规模 API 的方法相比,环境多样性受限可能影响模型在长尾场景下的鲁棒性。
- **轨迹合成的真实度 gap**:拓扑感知采样与校准精炼虽意图生成自然的多轮交互,但合成轨迹仍可能过度规整,缺乏真实人类意图中的模糊性、隐式修正与试探行为。此外, grounding 过程依赖自动验证,可能引入伪正例,使 RL 训练信号受到噪声干扰。实验仅在 **Qwen3 系列** 模型上验证,未展示跨模型架构(如非 Qwen 结构)的泛化能力,实际部署时效果可能衰减。
- **计算与资源假设**:论文未详细分析环境构造与轨迹合成时的计算开销,尤其是对长依赖关系图的拓扑采样可能带来指数级组合问题。此外,方法假定可访问“真实资源”(如 API 文档),对缺乏标准化接口的工具(如企业内部系统)扩展性存疑。虽然声称自动化,但实际流程中仍需人工设定领域分类与初始种子,尚不能实现完全无监督的规模化扩展。