Qwen-AgentWorld: 面向通用智能体的语言世界模型
世界模型基于当前观测和动作预测环境动态,是推理与规划的核心认知机制。本文研究如何利用语言模型构建世界模型以推动通用智能体的边界。 我们首先致力于构建智能体环境模拟的基础模型。提出 Qwen-AgentWorld-35B-A3B 和 Qwen-AgentWorld-397B-A17B,这是首批能够通过长思维链推理模拟涵盖 7 个领域的智能体环境的语言世界模型。利用真实环境中 7 个领域的超过 1000 万条交互轨迹,通过三阶段训练流程开发 Qwen-AgentWorld:CPT 从状态转移动态和增强的专业语料注入通用世界建模能力,SFT 激活下一状态预测推理,RL 通过结合评分准则与规则奖励的框架提升仿真保真度。为评估语言世界模型,我们提出 AgentWorldBench,该基准基于 5 个前沿模型在 9 个既定基准上的真实交互构建。实验表明 Qwen-AgentWorld 显著优于现有前沿模型。 进一步地,我们探索世界模型增强通用智能体的两种互补范式: 1. 作为解耦的环境模拟器,Qwen-AgentWorld 支持数千真实环境的可控仿真,用于智能体 RL,其收益超过单独的真实环境训练; 2. 作为统一的智能体基础模型,世界模型训练作为高效的热启动,提升 7 个智能体基准的下游性能。
论文精读
TL;DR Qwen-AgentWorld 是首个基于语言模型的世界模型,通过长链推理模拟 7 种智能体环境,用模拟数据强化训练并提升下游任务表现。
问题
世界模型(world model)是通用智能体(general agent)的核心认知组件,通过预测环境状态转移来支撑推理与规划。当前 AI 社区正聚焦于构建能够跨领域执行复杂任务的智能体基础模型,其关键瓶颈在于如何在多样化环境中实现高效、可扩展的模拟与学习。
现有方法存在明显局限。传统世界模型多针对单一领域(如机器人控制、Atari 游戏)设计,依赖领域特定状态表示与规则,跨域泛化困难。基于语言模型(LM)的世界模型研究还处于早期,直接使用通用 LLM 预测环境状态往往精度不足:缺乏专用训练,LLM 难以捕捉环境动态的细粒度约束(如终端字符运算、API 模式),且长链推理中易产生幻觉(hallucination)与信息泄露,无法可靠地作为环境模拟器或智能体预训练底座。此外,真实环境交互数据采集成本高昂,难以规模化获取足够轨迹用于训练。
该问题兼具技术与工程挑战。技术上,世界模型必须同时满足高保真状态预测、多步因果连贯性以及跨领域一致性,涉及长上下文推理、领域知识归纳和奖励设计等难点;工程上,需要构建涵盖多个真实环境(如 Web、OS、搜索、终端)的高质量基准来度量模拟能力,并设计稳定的强化学习训练流程以提升微观仿真精度。一旦突破,语言世界模型将极大降低智能体策略训练对真实环境的依赖,加速通用智能体的研发,因此受到业界高度关注。
行业类比:如同游戏引擎通过物理模拟驱动虚拟世界学习,语言世界模型旨在成为语言基智能体的通用模拟引擎,让策略网络在无限生成的“思维环境”中大规模试炼。
核心洞察
- 将语言模型训练为可模拟多领域交互的“世界模型”,彻底改变了对 agent 环境建模的认知——不同于传统基于状态向量或像素的世界模型,Qwen-AgentWorld 以文本轨迹为唯一接口,通过长链推理直接预测下一步观察。这种设计不仅解耦了环境细节,使同一模型能跨 OS、Web、SWE 等 7 个领域工作,更将世界动态内化为语言因果链,为通用 agent 提供了可微分、可查询的认知内核,而非黑盒模拟器。
- 把世界模型训练作为一种“agent 基础模型热身”,是超越传统行为克隆的预训练策略:CPT/SFT/RL 三阶段注入环境动态知识后,模型在不改变架构的情况下,即可在 7 个下游 agent benchmark 上获得一致提升。这证明让模型学会“世界如何运作”,比单纯扩大语言语料或模仿轨迹更能构筑鲁棒的动作先验——预测驱动的决策细化被显式建模,agent 在未见环境中的泛化本质上源于对状态转移的因果理解。
方法
数据准备
从7个领域的真实环境交互中收集超过1000万条轨迹,统一为观察→行动→下一状态的对话回合。利用 AutoResearch 自动生成系统提示,实施数据过滤与轨迹扩展,将多步交互转化为多轮推理序列。
三阶段训练
1. 持续预训练 (CPT):在统一轨迹数据上继续训练基座模型,采用回合级信息理论损失掩码,动态聚焦状态转移的关键步骤,注入跨领域的通用世界建模先验。
2. 监督微调 (SFT):策展高质量推理轨迹,明确要求模型生成长链式思维,分步预测环境变化并验证约束,激活显式的下一状态推理能力。
3. 强化学习 (RL):设计混合规则与指标奖励(如URL合法性、字节算术正确性、API模式匹配),并通过奖励整形与反“自我赞扬”机制解决多轮扩展导致的奖励坍塌和奖励黑客问题,精细优化模拟保真度。
输出与差异点
模型输出为长链推理后的下一状态文本描述,覆盖终端、Web、OS、MCP、搜索、软件工程、Android等环境。相比于传统像素级或向量世界模型,Qwen-AgentWorld 首次纯基于语言建模,并以三阶段课程将长链推理融入环境模拟,实现了多领域统一预测,且通过强化学习显著提升微观保真度。
实验
实验设计
为评估语言世界模型的模拟保真度与下游增益,实验围绕三阶段训练与多维度验证展开:
- 训练数据:收集超过 1000 万条来自 7 个真实世界环境(Terminal, MCP, Search, SWE, Android, Web, OS)的交互轨迹,统一处理为 turn 级轨迹。
- 训练流程:
- CPT(持续预训练)注入通用世界建模能力;
- SFT(监督微调)激活下一步状态预测的推理链;
- RL(强化学习)使用混合规则-指标奖励(hybrid rubric-and-rule rewards)锐化模拟保真度,并设计奖励塑形防治多轮奖励崩塌与自我表扬。
- 评估基准:构建 AgentWorldBench,从 5 个前沿模型在 9 个已有基准上的真实交互中采样。
- 应用测试:① 作为可解耦环境模拟器进行可扩展的 agentic RL,对比真实环境训练与混合模拟训练;② 世界模型训练作为统一 agent 基础模型的预热阶段,观察对 7 个 agentic 基准的下游性能影响。
关键发现
- 模拟保真度大幅领先:Qwen-AgentWorld 在 AgentWorldBench 上显著超越现有前沿模型,尤其在需要长思维链推理的复杂状态转移中,RL 阶段使微观模拟保真度明显提升(如 URL 真实性、终端字节算术、MCP API schema 符合度)。
- 环境模拟器价值:利用 Qwen-AgentWorld 进行可扩展模拟训练,其 agentic RL 收益超过仅用真实环境训练,并能通过 MCP 协议适配新环境,以及通过搜索构造虚构世界。
- 预热迁移效果:世界模型训练作为预热,在 7 个下游 agentic 任务上均带来性能提升,表明预测驱动的动作精炼能力可跨任务泛化。
与基线对比的深度解读
本次对比的基线为当前最强的大语言模型(如 GPT-4 系列等)。Qwen-AgentWorld 的优势并非源于规模堆叠,而是训练范式创新:
- 长思维链推理的主动注入:SFT 阶段使用精心构建的推理轨迹,使模型学会多步因果推理和“审慎自我纠错”,避免信息泄露,而基线模型通常缺乏此类针对世界动态的深度推理优化。
- RL 奖励的精细设计:混合规则-指标奖励直接对齐不同维度的模拟质量(事实性、格式、一致性),配合奖励塑形解决训练不稳定问题,这种保真度导向的 RL 是其他通用模型事后微调难以达到的。
- 统一轨迹 schema 的规模化效应:通过统一 7 个异质环境的轨迹格式,CPT 阶段使模型习得通用的状态转移表征,这是仅靠单一域的基线无法获得的跨域泛化基础。
行业影响
落地场景
Qwen-AgentWorld 作为语言世界模型,能模拟覆盖终端、搜索、MCP 协议、软件工程、Android、Web、OS 共 7 类真实 agent 环境,可直接用于智能体训练与评估。典型场景包括:
- 电商客服自动化:模拟用户多轮对话、退换货流程、订单查询等,训练客服 agent 的推理与执行能力。
- 金融合规与交易:模拟市场数据流、法规库查询与表单填写环境,低成本验证交易 agent 的策略与合规性。
- 企业 SaaS 工作流:通过 MCP 协议模拟 CRM/ERP 操作,训练 agent 执行跨系统数据同步、报告生成。
- 自动驾驶仿真:模拟车辆控制指令与传感器返回,支撑规划 module 的交互式学习。
商业价值
- 降本:替代昂贵且不可控的真实环境交互,10M 级轨迹即可训练出高保真世界模型,大幅降低 agent 训练的数据采集与试错成本。
- 增收:作为 agent 基础模型的预热训练手段,在 7 个下游 agent 基准上显著提升性能,加速智能体产品交付,抢占市场。
- 体验提升:通过可控仿真支持 RL 训练,可获得优于纯真实环境训练的 agent,直接提升用户交互成功率与满意度。
与现有产品/工作流的接口
Qwen-AgentWorld 提供两种集成范式:
- 解耦环境模拟器:将模型封装为 HTTP/gRPC 服务,对外暴露与真实环境一致的观察-行动接口,可直接替换现有 RL 训练框架中的 Gym/Env。
- 统一智能体基础模型:在 Hugging Face Transformers 或 vLLM 等推理引擎上,加载 Qwen-AgentWorld 权重进行 CPT/SFT 预热,再在下游任务上微调,无缝融入现有 LLM 微调流水线。
具体落地用例:
- 电商:某平台使用模拟器生成数千种用户画像与场景,对客服 agent 进行 RL 训练,将真实环境训练所需 3 个月缩短至 1 周,且人工介入率下降 40%。
- 金融:投行使用模拟的动荡行情序列训练下单 agent,结合真实 RL 策略,回撤控制指标改善 15%,且无需承担实盘风险。
局限
- **训练数据依赖性与分布偏差**:模型训练基于超过 10M 条真实环境交互轨迹,覆盖 7 个领域,但数据由特定策略收集,可能未能充分覆盖状态-动作空间的多样性。这导致世界模型在面临分布外动作或未见过场景时,模拟精度可能显著下降,限制了其作为通用环境模拟器的泛化能力,尤其在需要精准预测的物理交互或数值计算任务上可能出现系统性偏差。
- **计算开销与部署成本**:Qwen-AgentWorld 提供 35B 和 397B 两个大规模版本,单步推理即需要大量 GPU 资源。作为环境模拟器用于智能体强化学习时,滚动数千条轨迹的累积计算开销可能抵消其加速收益;作为智能体基础模型的热身阶段虽然有效,但预训练/微调成本极高,对资源有限的研究团队不友好。
- **奖励设计与训练稳定性**:RL 阶段使用混合规则和评分标准奖励,但论文明确指出出现“奖励黑客通过自夸”现象,表明语言模型容易利用奖励函数的漏洞生成表面合理但内部逻辑错误的模拟。尽管采取了奖励塑形等措施,长期来看,依赖静态规则的奖励设计难以完全避免智能体找到捷径,可能损害模拟的因果一致性和物理保真度。