AgentMercury: 你的 Agent 可以在大规模商业场景中合成可验证环境
智能体通过与环境的交互来学习行为,然而训练所用的环境往往依赖人工构建或围绕预定义任务与基准进行合成。这种以任务为中心的模式难以扩展到反映真实且不断演变的工作流场景,因为多样化任务应能从底层世界中自然涌现。 我们提出 AgentMercury,一个可扩展的框架,用于从高层级业务场景合成可执行环境。与针对特定任务构建环境不同,AgentMercury 首先实例化一个持久化世界,包含实体、服务、工具、状态及可执行的跨服务不变量,随后多样化的任务和交互轨迹可从中自发涌现。我们构建了覆盖 14 个行业和 50 个国家的 4,783 个可执行环境,并将其作为强化学习的训练基底。 尽管这些环境并非针对评估基准生成,在这些面向业务的环境上训练的策略在企业工作流以及涵盖推理、编码、科学计算和工具使用的域外基准上均取得了显著提升。实验中,在 AgentMercury 环境上训练后,Qwen3.5-4B 在 EnterpriseOps-GYM 上的得分从 12.3 提升至 15.7,在 AIME26 上的得分从 45.9 提升至 56.0。 我们还展示了构建过程本身是可以学习的:在构建轨迹上微调 Qwen3.5-35B-A3B,可将保留业务场景的可执行世界作者成功率从 3.3% 提升至 83.3%。这些结果表明,场景化环境能提供超越基准专用训练的通用学习信号,而其构建本身也能成为一种可学习的能力。
论文精读
TL;DR AgentMercury 从高层业务场景合成可执行环境作为 RL 训练底物,使智能体在企业工作流与跨域基准上显著提升,且环境构建本身可学习。
问题
问题背景
训练智能体(agent)与环境交互是强化学习(RL)和 agentic AI 的核心路径。当前领域高度关注环境生成(environment synthesis),希望用训练环境扩展 agent 的泛化能力,而不是仅仅为单一 benchmark 优化。
现有方法局限
主流范式以任务为中心(task-centric):环境围绕预设任务和 benchmark 手工构建或半自动合成。例如 WebArena、OSWorld 等环境为固定任务硬编码了动作空间、状态转换和评估逻辑。这类方法存在三个具体技术局限:
- 可扩展性差:新任务需要重新设计环境,无法复用底层世界状态和服务逻辑。
- 缺乏涌现性:任务被提前限定,agent 只能学习预定义的求解路径,难以产生跨任务、跨服务的组合行为。
- 与真实业务流程脱节:手工构造的环境往往简化了多实体、多服务之间的时序约束和不变量(invariants),导致在真实企业工作流中技能迁移不足。
为什么这个问题难/重要
从高维业务场景(business scenario)自动合成可执行环境(executable environment)至少面临三个挑战:
- 世界一致性:需要同时生成实体、服务、工具、状态及跨服务不变量,并保证其可执行、可验证。
- 任务涌现:不能预定义任务,必须让环境在交互中自然产生多样化任务和轨迹,这对生成质量和 RL 采样都提出更高要求。
- 训练信号通用性:希望环境不仅提升企业工作流表现,还能迁移到推理、编程、科学计算等 out-of-domain benchmark,这要求环境支撑通用认知技能,而非任务特化捷径。
业界对此高度关注:scalable environment synthesis 已被视为解决 agent 训练数据瓶颈的关键方向之一,但现有工作要么仅生成任务实例,要么依赖仿真器,缺乏直接生成可执行业务世界的框架。
行业类比
这类似于用合成金融交易沙盒训练风控 agent:不是给 agent 预设“检测欺诈交易”这一个任务,而是生成完整的多账户、多市场、多监管规则的可执行世界,让合规检查、异常检测、报表生成等能力从底层规则中自然涌现。
核心洞察
- AgentMercury 的核心创新是将环境合成从“任务中心”转向“世界中心”:先实例化持久世界(实体、服务、工具、状态、跨服务不变量),再让任务自然涌现。 与现有围绕预定义任务和基准的环境合成(如手工构建或任务特定生成)不同,这种世界中心范式使环境能反映真实、持续演化的工作流,并支持跨服务不变量等复杂交互,从而生成更多样、可扩展的训练轨迹,为 RL 提供更通用的学习信号。
- AgentMercury 进一步证明环境构建本身可以成为可学习的能力:通过从构造轨迹中微调 Qwen3.5-35B-A3B,将可执行世界作者成功率从 3.3% 提升到 83.3%。 传统方法依赖提示工程或规则模板生成环境,质量不稳定且难以扩展;将构建过程作为监督信号训练模型,使环境生成能力内化到模型参数中,显著提高生成质量和泛化性,为自动化环境生产提供新路径。
方法
核心思路
AgentMercury 将训练环境构建从任务中心转向世界中心:输入一个高层业务场景(如“跨境支付”),先生成一个持久的可执行世界,再从中自然派生多样任务,而非为每个任务单独搭环境。
关键模块(输入 → 流程 → 输出)
场景到世界构建
使用 LLM 将场景描述转化为结构化世界规范,包含:- 实体(entity)与服务(service)定义
- 工具(tool)接口
- 状态(state)存储
- 跨服务不变量(cross-service invariants):可执行校验规则,保证世界逻辑自洽 最终产出可被代码解释器加载的可执行环境。
任务实例化
基于世界状态和可用工具,采样或生成任务实例,不限于预定义任务集,可覆盖多服务协同、异常处理等复杂场景。可执行交互与确定性评分
策略(agent)在环境中进行多轮交互,环境根据动作更新状态并检查不变量。评分函数确定性地评估轨迹是否满足目标(如最终状态是否合规、跨服务一致性是否保持),无需人工标注。策略学习
将合成环境作为 RL 训练基底(采用 GRPO 等算法),让策略在大量不同世界中探索。由于世界多样,策略学会通用问题解决能力,而非仅优化特定基准。世界构建过程学习
收集“场景→世界规范”构建轨迹,微调 Qwen3.5-35B-A3B,使模型本身掌握从场景直接生成可执行世界的能力,将作者成功率从 3.3% 提升至 83.3%。
输出
- 一个可扩展的环境生成器(输入场景即可产出可执行世界)
- 一个在多个基准上显著提升的策略模型(如 Qwen3.5-4B 在 EnterpriseOps-GYM 从 12.3→15.7,AIME26 从 45.9→56.0)
与同类方法差异:传统方法为特定任务手工或自动构造环境,AgentMercury 则从场景级世界出发,任务动态涌现,训练信号更通用,且环境构建本身可学习,形成闭环。
实验
实验设计
针对任务中心范式的扩展瓶颈,作者提出 AgentMercury:先从高层业务场景合成可执行持久世界(含实体、服务、工具、状态与跨服务不变式),再从中实例化任务并采样交互轨迹。研究构造了 4,783 个环境,覆盖 14 个行业与 50 个国家,用作 强化学习训练基底。实验未针对任何评测基准优化。另用构造轨迹微调 Qwen3.5-35B-A3B,验证构造过程本身是否可学习。
关键发现
以 Qwen3.5-4B 为策略模型,在 AgentMercury 环境上训练后,EnterpriseOps-GYM 得分从 12.3 升至 15.7,AIME26 从 45.9 升至 56.0。值得注意的是,这些评测基准并非环境构造目标,提升来自场景世界交互中涌现的通用能力。此外,通过构造轨迹微调,模型在 held-out 业务场景上的 可执行世界构造成功率从 3.3% 提升至 83.3%,证明环境构造本身可被模型内化。
与基线对比
与“围绕基准手工构造环境”的范式相比,AgentMercury 的世界中心(world-centric)设计使任务从持久状态与跨服务约束中自然涌现,避免了为每个任务单独设计环境,扩展性更强。策略提升幅度(尤其 AIME26 +10.1)显示,非针对性的交互训练带来了跨域迁移信号,优于仅依赖基准专用数据的基线。构造成功率的跃升则说明,将环境生成作为可学习能力,能显著降低人工构建成本,这是传统工程方案难以实现的。
行业影响
落地场景
AgentMercury 可直接用于企业级 agent 训练基础设施:从高层的业务描述自动合成可执行世界,而非手工搭建 task-specific 模拟器。典型场景包括:
- 电商售后自动化:合成订单、支付、库存、物流、客服等多服务环境,训练 agent 处理退款、改地址、库存查询等跨系统任务。
- 金融合规与对账:生成跨账户、跨机构的交易流与环境不变量,让 agent 学会在状态约束下完成异常检测与报告生成。
- SaaS 工作流编排:将企业内部的工单、审批、CRM、数据同步等抽象为可交互世界,训练 agent 自主推进长流程。
商业价值
核心降本来自环境构建的边际成本骤降:手工编写模拟器需要领域工程师数周,AgentMercury 可将业务描述批量转化为可执行环境,已生成 4,783 个覆盖 14 行业的环境。同时训练收益不限于单一基准:作者报告在 EnterpriseOps-GYM 从 12.3 提升至 15.7,AIME26 从 45.9 提升至 56.0,说明在业务环境上训练能泛化到推理与代码任务,相当于一份训练预算覆盖多条产品线。
与现有工作流集成
生成的环境可作为 RL 环境的统一接口,直接对接现有训练栈(如 GRPO 或 PPO)。环境本身可封装为 HTTP 服务或 MCP server,让 LangGraph、AutoGen 等 agent 框架直接调用。对于模型微调,可将 construction trace 作为监督数据,训练模型自主生成新环境——论文中微调 Qwen3.5-35B-A3B 后将 authoring 成功率从 3.3% 提升至 83.3%,这意味着环境生成本身可成为模型能力,嵌入到企业开发管线中形成“场景→环境→训练→部署→回流”闭环。
局限
- **环境保真度受限**:合成环境从高层业务场景自动生成,底层依赖 LLM 对实体、服务、状态和跨服务不变量的结构化编写。虽然构建了 4,783 个环境,但生成质量受限于模型对真实业务流程的理解,可能遗漏异常路径、长尾状态和非确定性交互。论文未系统评估生成环境与真实企业系统的分布差异,仅通过下游基准分数间接验证,其策略在真实部署时可能遇到分布外情况。
- **训练效果的模型特异性与动态适应性**:强化学习实验主要在 **Qwen3.5-4B** 上展示收益,未充分验证在不同架构和参数量模型上的普适性。此外,训练基采用离线生成的静态环境,无法反映实际业务中持续演进的流程和工具变化;论文讨论中提到“closed environment-agent loop”但尚未实现,因此目前框架缺少从智能体交互反馈进行环境迭代的机制。
- **构造过程学习的监督依赖与泛化边界**:将环境构造本身作为学习任务,需要大量构造轨迹作为监督信号。微调 **Qwen3.5-35B-A3B** 将创作成功率从 3.3% 提升到 83.3%,但轨迹收集可能引入特定分布偏差,学习到的构造策略对未见过的行业或复杂场景泛化能力未经充分检验;且生成后的环境仍需通过可执行性验证,无法完全免除人工校验。