论文

可验证隐藏动力学 Play:从已求解机制生成 Agentic RL 环境

可验证隐藏动力学 Play:从已求解机制生成 Agentic RL 环境

语言模型 agent 日益面对状态演化、决策互依、结果延迟的长时程任务,扩大训练规模需要多样的 agentic 环境、可靠的结果信号与低扩展成本。现有流水线通常先建环境、后定结果规则或标注轨迹,导致动力学与评估只能事后对齐。 VHD-Play 反转这一依赖次序:先采样并求解数学模型,再由语料接地的 setter 把决策过程渲染为有状态工具,可执行动力学与轨迹评分参考继承自同一已求解模型。该流水线以每个环境约几美分的成本产出 3,300 个多样 agentic 环境。 在 Qwen3.6-35B-A3B 上对三个族训练,五族诊断的平均 agentic 得分由 0.204 升至 0.815,增益也见于三个训练族与八个未见机制族的留出实例,并迁移到函数调用、旅行规划与 365 天电商等外部基准。在 E-Commerce Bench 上,训练后 checkpoint 每次运行均不破产并超过 Qwen3.7-Max。 对比书面问题与有状态版本(揭示或隐藏参数)可见,大部分可学习差距来自有状态交互而非底层求解;冻结的 35B setter 可实现更大环境,规模匹配的训练在机制规模与时间跨度增长时仍保持增益,显示可演化训练基底的潜力。

论文精读

TL;DR VHD-Play 先采样并求解数学模型,再渲染为有状态工具环境,将可执行动态与轨迹评分绑定到同一模型;仅几美分成本生成 3300 个环境,使 Qwen3.6-35B-A3B 的智能体得分从 0.204 提升至 0.815。

问题

问题背景

语言模型智能体越来越多地面对长周期任务:状态随时间演化、决策相互依赖、结果延迟反馈,这让 Agentic RL 对大规模、多样化、可验证环境的需求迅速上升。

现有方法局限

现有环境生成管线通常先构建环境,再事后定义结果规则或人工标注轨迹,导致动态与评估必须对齐。这会带来三个具体技术缺陷:

  • 评分规则与动态可能不一致,产生噪声标签或奖励 hacking 漏洞;
  • 轨迹标注成本高,难以线性扩展到数千个环境;
  • 环境多样性受限于手工设计,难以覆盖隐藏状态交互与多步决策的复杂组合。

为什么这个问题难/重要

难在可验证结果信号在长程有状态交互中很难获得:需要可执行动力学模型与对应参考解,同时环境生成成本必须极低、评分必须可靠,否则模型容易过拟合环境表面特征或记住单一策略。业界关注点正从静态问答转向 agentic RL,而环境生成就是这一范式的数据瓶颈——没有可持续的生成机制,大规模训练就缺少可靠的奖励来源。

行业类比

类似程序化生成游戏关卡来训练强化学习智能体,但 VHD-Play 保证每个关卡都有可验证的“通关参考”,让奖励信号从生成源头就与动态一致。

核心洞察

  • VHD-Play 将环境生成顺序反转为“先采样并求解数学机制,再渲染为有状态工具”,从而将动态规则与轨迹评分从同一模型继承,消除了事后对齐误差。 传统管线通常是“先搭环境、后补奖励”,导致 dynamics 与 evaluation 需要额外对齐,且扩展成本高。VHD-Play 通过让同一个已求解的数学模型同时提供可执行动态和评分参考,保证了结果信号的可验证性和一致性,且每个环境成本仅几美分,实现了低成本多样化环境的规模化生产。
  • 实验对比书面问题与有状态版本发现,可学习差距主要来自 stateful interaction(有状态交互),而非底层数学求解能力,这表明训练重心应放在交互动力学上。 这一发现与直觉相反——很多人认为模型瓶颈在于数学推理。论文显示隐藏参数、序列化决策等有状态交互才是提升 agentic 能力的关键,因此 RL 环境设计需要强调多步状态演化与信息获取,而不是简单地提高问题难度。这为后续 agentic RL 训练提供了明确的方向。

方法

输入:采样的数学机制

VHD-Play 的起点是一个从机制家族中采样并求解的数学模型。模型定义了隐式动态(状态转移、决策依赖、延迟结果),求解器给出该模型下的最优策略或参考轨迹,为后续环境提供可验证的结果信号。

关键模块:语料库基 Setter 与可执行动态渲染

  1. Setter 渲染:一个由大规模语料训练的 setter 接收已求解模型的决策过程,将其转化为一组 stateful tools(有状态工具),工具的执行逻辑严格对应模型的动态方程。
  2. 动态与评分继承:渲染后的环境直接继承已求解模型的可执行动态(状态更新规则)和轨迹评分参考(基于同一模型的最优/参考策略),无需事后对齐。
  3. 隔离与验证:生成的环境经过准入与验证步骤,确保工具行为与数学模型一致,并隔离不同环境实例,避免状态串扰。

输出:多样化 Agentic 环境

输出是可直接用于强化学习训练的有状态交互环境,每个环境包含一组工具、初始状态、终止条件和评分函数。实测单环境生成成本仅几美分,可批量产出 3,300 个多样化环境,覆盖多个机制家族(如库存控制、路由、背包分配等)。

与同类方法的差异点

与先构建环境再定义结果规则或标注轨迹的流水线不同,VHD-Play 通过反转构造顺序,先求解模型再渲染环境,从根源上消除了动态与评估之间的对齐误差。

实验

实验设计

VHD-Play 通过“先求解机制,后渲染环境”的逆向构造流程生成 3,300 个多样化的 agentic 环境,单个成本仅几分钱。实验以 Qwen3.6-35B-A3B 为基座,在三个 mechanism family 上训练,并在五 family 诊断、held-out 实例及八个未见 family 上评估泛化。另设 written-out vs stateful 消融,以及外部基准(function calling、travel planning、E-Commerce Bench)验证迁移。

关键发现

  1. 训练后模型在五 family 诊断中的 mean agentic score 从 0.204 提升至 0.815。
  2. 增益泛化到全部三个训练 family 的 held-out 实例和八个 unseen mechanism families。
  3. 在 E-Commerce Bench 上,训练后 checkpoint 每轮均无破产,且整体表现超过 Qwen3.7-Max。
  4. 状态隐藏/暴露对比显示,可学习差距主要来自 stateful interaction,而非底层问题求解。

与基线对比解读

传统流程先构建环境、再事后对齐 outcome rule 和轨迹标注,VHD-Play 从已解数学模型中同时继承可执行 dynamics 和 trajectory-scoring reference,消除了事后对齐误差。与 written-out 版本相比,stateful 版本暴露了 agent 在长期状态交互中的短板,说明环境动态性本身是训练信号的关键。35B setter 能生成更大环境,scale-matched 训练在机制规模与 horizon 增大时保持增益,验证了该管线作为可演化训练基底的潜力。

行业影响

落地场景

VHD-Play 生成的可验证有状态环境适合训练执行长时程、多步决策的智能体。典型场景包括:

  • 电商供应链:库存补货、动态定价、履约路径规划,环境内置状态转移与延迟奖励,替代逐单人工标注。
  • 企业服务自动化:差旅规划、审批流、客服工单处理等富含隐藏状态与约束的任务,可批量生成多样化模拟场景。
  • 金融交易模拟:风险约束下的组合调整、下单策略,利用可执行动力学评估长期收益。

商业价值

  • 降本:单环境成本仅几美分,远低于人工构建或专家轨迹采集;论文显示 3,300 个环境总成本极低,边际扩展几乎为零。
  • 增收:训练后的模型在 E-Commerce Bench 上完成率 100% 且超过 Qwen3.7-Max,直接提升业务流程自动化成功率,减少人工干预与错误损失。
  • 体验提升:模型从纯问题求解转向有状态交互,能主动获取信息、规划全周期动作,在真实应用中表现出更连贯的决策能力。

接口与现有工作流集成

VHD-Play 输出标准化的环境描述 + 工具接口 + 轨迹评分参考,可直接接入现有 RL/RLHF 训练流程:

  1. 工具调用格式与主流智能体框架(如 function calling)对齐,生成的 stateful tools 可即插即用。
  2. 冻结的 35B setter 可持续生成更大规模环境,支持课程式训练(curriculum learning),与现有模型厂商的训练管线兼容。
  3. 环境隔离与参考计算模块可嵌入 MLOps 平台,作为持续生成新训练任务的引擎。

具体 use case:

  • 电商补货智能体:在数千种不同需求波动、价格弹性、仓储约束的模拟环境中训练,模型学会在缺货风险与库存成本间权衡,部署到订单管理系统后自动执行补货决策。
  • 差旅规划助手:由 VHD-Play 生成预算、时效、偏好组合各异的旅行规划任务,模型通过多步工具调用完成行程编排,能处理航班延误、酒店变更等动态扰动。

局限

  • **覆盖的机制家族数量有限**:论文仅从有限的机制家族(三个训练家族、八个未见家族)生成环境,这些家族可能偏向于特定类型的决策问题(如库存、路由、分配)。真实世界 agentic 任务涉及更多样的动态结构(如博弈论、部分可观测、多智能体交互),当前生成范式在这些领域的适用性未经验证。此外,每个家族内的变体可能高度同质,无法充分覆盖长尾分布,可能限制训练策略的泛化能力。若要将该方法推广到更广泛的任务,需要显著扩展可求解机制库,但部分机制可能不存在解析或数值可解形式。
  • **对 setter 能力的强依赖**:环境渲染依赖一个语料库 grounded setter(LLM),其质量直接决定环境与原始机制的语义一致性。虽然论文使用了冻结 35B setter 并验证了规模效应,但 setter 仍可能引入偏差:例如将数学模型错误映射为工具接口、参数命名不自然、或生成不符合真实世界约束的任务描述。隐藏参数实验显示大部分学习差距源于有状态交互,但 setter 生成工具时的错误可能混淆这一结论。对于低资源领域或需要精确语义对齐的任务,当前 setter 可能不可靠,且验证 setter 输出是否忠实于机制本身成本较高。
  • **可验证性假设过强**:VHD-Play 要求环境动态与评分参考继承自同一求解模型,这保证了内部一致性,但真实世界的 agentic 任务往往不存在可求解的数学机制,或机制无法完全覆盖观测到的行为。对于开放域、模糊目标或依赖人类判断的任务,该方法无法直接应用。此外,即使机制可解,求解过程本身可能昂贵(如大规模优化问题),从而削弱低成本生成的优势。论文未讨论当机制不可解或部分可解时如何降级生成,也未评估训练出的策略在真实机制不符的环境中的表现。
论文Xinjie Shen2026-09-23原文

相关内容