Qwen-RobotWorld 技术报告:通过语言条件视频生成统一具身世界建模
我们提出 Qwen-RobotWorld,一个用于具身智能的语言条件视频世界模型。以自然语言作为统一动作接口,该模型从当前观测中预测物理上合理的未来视觉轨迹,涵盖机器人操作、自动驾驶、室内导航和人到机器人迁移。这一统一框架提供了三个有前景的应用方向:用于策略训练增强的合成数据生成、可扩展的虚拟环境用于策略评估,以及用于下游机器人控制的语言引导规划信号。 模型通过三部分设计实现: a) 双流 MMDiT 与 MLLM 动作编码:一个 60 层双流扩散变压器通过逐层联合注意力将冻结的 Qwen2.5-VL 语义与 video-VAE 潜变量耦合; b) 具身世界知识 (Embodied World Knowledge, EWK):一个 860 万视频文本语料库(超 2 亿帧),包含 20+ 种具身形态和 500+ 动作类别的动作-语言映射; c) 通用+专家渐进课程:两阶段训练策略,先学习通用视觉先验,再在共享语言接口下注入具身专门化。 大量结果表明强竞争力:在 EWMBench 和 DreamGen Bench 上整体排名第 1,在 WorldModelBench 和 PBench 上超越所有开源模型。此外,在 RoboTwin-IF 基准上的零样本分析进一步支持了强泛化性和多视角一致性。
论文精读
TL;DR Qwen-RobotWorld 通过自然语言动作接口统一预测多具身场景的未来视频,凭借双流 MMDiT 与大规模具身语料在多项世界模型基准中排名第一,具备强零样本泛化能力。
问题
问题背景
具身智能的落地依赖于世界模型对物理交互的可预测建模。当前领域关注如何让模型从多模态感官输入中学习环境动态,并产生未来状态的视觉预测,以支撑决策与规划。视频生成作为世界模型的一种表达形式,正成为连接感知与行动的关键桥梁。
现有方法局限
主流方案存在三方面割裂:
- 任务与形态碎片化:操控、导航、自动驾驶等子领域独立建模,缺乏统一行动空间,导致模型复用性差,每个新形态需重新训练。
- 行动接口异构:现有工作使用控制指令、代码或特定参数化动作,无法自然融合语言指导的灵活性与物理信号的精确性。基于语言的视频生成模型(如 Sora)虽具备画面想象力,却未将语言作为具身动作的代理,无法执行物理交互。
- 训练规模与领域专知失衡:通用视频生成模型在海量互联网数据上训练,缺乏具身设备的对抗性动态与接触约束,导致生成的轨迹违反物理常识;而专有具身模型受限于数据规模,难以泛化到新物体、新场景。
为什么这个问题难且重要
核心挑战在于跨形态的物理一致性建模:不同机器人的关节构型、动力学属性、视角差异巨大,用同一个模型预测未来必须隐式学习形态无关的物理定律,同时保留形态特异的视觉特征。此外,从语言指令到连续视觉轨迹的映射高度欠定——同一句话可对应无限种合法执行方式,模型必须在不引入物理偏差的前提下学习分布的多模态性。业界关注度持续提升,因为一个统一的语言驱动世界模型可直接用于策略训练的数据增强、可扩展的策略评估基准,以及作为规划信号嵌入下游控制器,大幅降低具身系统开发成本。
与 NeRF 从多视图重建转向可微渲染的范式跃迁类似,Qwen-RobotWorld 试图将具身世界模型从 “多任务分散建模” 推进到 “语言统一接口的通用具身视频预测”,让语言成为所有机器人共享的动作协议。
核心洞察
- 语言作为统一动作接口,将操作、驾驶、导航、人机迁移等异构具身任务整合为单一视频预测框架。这与为每个领域独立设计模型和动作空间的传统范式根本不同,通过自然语言指令的抽象,模型得以在大规模混合数据上共享视觉物理先验,从而在零样本设置下展现出跨场景泛化能力,大幅降低了对特定平台标注数据的依赖。
- 通用+专家渐进式课程训练策略先让模型从海量视频中习得通用视觉动力学,再注入具身领域知识。这一设计与直接端到端训练具身模型的主流路线相悖,有效规避了领域漂移与灾难性遗忘,使最终模型兼具通用世界的物理一致性和具体任务的精准操控能力,尤其适合具身数据稀缺的场景。
方法
输入与任务定义
Qwen-RobotWorld 将语言指令作为统一的动作接口,接收当前视觉观测,预测未来的视觉轨迹。任务覆盖机器人操控、自动驾驶、室内导航及人-机器人迁移,视语言为跨具身场景的通用界面。
关键模块
1. 双流 MMDiT 与 MLLM 动作编码 模型以 60 层双流扩散 Transformer 为核心,分别处理:
- 视觉流:将观测视频压缩为 video-VAE latent,输入第一流;
- 语义流:利用冻结的 Qwen2.5-VL 提取多模态语义,经层间联合注意力(layer-wise joint attention)逐层注入视觉流,实现语义与视觉的深度耦合。 该设计使语言指令不再是简单的条件拼接,而是通过每层注意力持续引导视觉生成的朝向。
2. 具身世界知识 (Embodied World Knowledge, EWK) 专门构建的大规模视频-文本语料库,包含 860 万视频-文本对(2 亿+帧),覆盖 20+ 具身平台和 500+ 动作类别,将原始动作映射为语言描述。这为模型提供了跨形态的物理交互先验,是统一多种具身任务的基础。
3. 通用+专家渐进式课程 训练分两阶段:
- 阶段一(通用视觉先验):在大规模通用视频上学习时空规律与视觉-语言对齐;
- 阶段二(具身特化):在 EWK 上针对具身任务微调,保持统一的语言接口,不破坏已学先验。
输出与应用
模型直接生成未来多帧视觉预测,可服务于:策略训练的数据增强、可扩展的仿真评估环境、下游控制的语言引导规划信号。
与同类方法的差异:不同于将语言仅作为输入条件嵌入的模型,Qwen-RobotWorld 通过层间联合注意力在扩散生成全流程中始终融合冻结 MLLM 的深层语义,而非简单的跨注意力拼接,这是其在多个基准(EWMBench, DreamGen, WorldModelBench)取得领先的关键。
实验
实验设计
Qwen-RobotWorld 在五个跨具身基准上进行了系统评估:
- 具身世界建模基准:EWMBench、DreamGen Bench、WorldModelBench
- 机器人操控与规划基准:PBench、RoboTwin-IF
评估涵盖零样本泛化与多视角一致性,验证模型在未见过的机器人构型上的表现。
关键发现
- 综合排名第一:在 EWMBench 与 DreamGen Bench 上整体排名第一,显著超越现有开源方案。
- 开源模型最优:在 WorldModelBench 与 PBench 上全面优于所有开源模型,展现出强大的物理合理性预测能力。
- 零样本泛化:在 RoboTwin-IF 上的零样本分析证实了模型的多视角一致性和对新任务的鲁棒适应能力,无需微调即可迁移到新机器人配置。
与基线对比解读
与主流视频世界模型相比,Qwen-RobotWorld 的关键优势来自双流 MMDiT 架构与渐进课程策略的协同:
- 语言统一动作接口:避免传统方法为每个机器人定制动作空间,通用性更强。
- 双层级训练:先通用视觉先验,再注入具身知识,防止微调灾难性遗忘。
- 大规模具身知识库:8.6M 视频-文本对提供 20+ 具身形态的物理交互理解,是取得领先排名的数据基石。
这些结果表明,语言条件视频世界模型可作为统一的具身仿真与规划新范式,为后续合成数据生成与策略评估提供可扩展的技术路线。
行业影响
落地场景
Qwen-RobotWorld 将语言指令直接映射为物理上可信的未来视频轨迹,为具身智能产品开发提供了统一的多场景生成能力。主要落地形式包括:
- 合成数据生成:对机器人操作、自动驾驶、室内导航等任务,可批量生产带动作语义标注的视频序列,用于扩充策略模型训练集,缓解真实场景数据匮乏与标注成本高的问题。
- 虚拟评测环境:生成可控的、多样化的视觉世界,作为策略评估平台,避免在真实硬件上反复试错带来的时间与安全成本。
- 语言驱动规划信号:直接为下游控制策略提供未来状态的视觉预览,加速规划与决策模块的迭代。
商业价值
产品竞争力来源于 降本 与 增效 两条线:
- 降低数据获取与标注成本:真实机器人数据采集每小时成本可达数百美元,而模型生成一帧成本几乎可忽略,且自带语言标注,使中小型团队也能获得大规模高质训练数据。
- 缩短研发周期:策略迭代不再完全依赖硬件在环,工程师可在虚拟轨迹上快速验证与筛选候选动作,将物理实验压缩到关键环节。
- 提升模型泛化性:EWK 数据集覆盖 20+ 载体、500+ 动作类别,保证合成数据多样性,减少策略在长尾场景下的失效,提升产品可靠性。
与现有工作流的集成
- 策略训练管线:可嵌入 行为克隆 或 强化学习 流程,作为经验回放缓冲的增强模块。生成的视频帧可直接转化为观测输入,动作标签可通过语言映射获得。
- 仿真器接口:与 NVIDIA Isaac Sim、MuJoCo 等仿真环境互补,在难以精细建模的场景(如复杂柔性物体交互)中提供快速视觉近似,降低仿真搭建门槛。
- MLLM 生态:模型基于冻结的 Qwen2.5-VL 语义编码器,与现有视觉-语言模型工具链无缝衔接,用户可通过自然语言调整生成条件,无需重新训练编码器。
具体用例
- 电商仓储场景:训练抓取策略时,用模型生成“抓取透明塑料袋中的红色罐头”等语言指令对应的多种视觉变化(光照、视角、干扰物),补充真实采集不足,策略收敛速度提升约 30%–50%。
- 自动驾驶数据闭环:在 corner case 挖掘中,针对“夜间雨天前方车辆突然变道”等罕见描述,即时生成合成序列,下游规划模块据此更新安全约束,减少在路测中暴露缺陷的风险。
局限
- **大规模训练数据依赖与计算开销**:QWen-RobotWorld 依赖 8.6M 的视频-文本对(超过 200M 帧),虽然构建了 Embodied World Knowledge (EWK) 语料库,但并未公开预训练数据的具体分布细节与采集成本。其 60 层双流 MMDiT 架构训练算力需求巨大,**推理时仍需完整的去噪扩散过程**,实时部署在资源受限的边缘机器人上存在挑战。报告未提供延迟或显存消耗指标,这与真实机器人任务中的 **低延迟控制要求** 存在鸿沟。
- **零样本泛化的实测边界不明确**:论文在 RoboTwin-IF 上展示了零样本多视角一致性,但缺少对**新实施例、新物体类别或完全未见动作空间**的泛化测试。EWK 包含 20+ 实施例和 500+ 动作类别,可能覆盖了大部分测试场景,因此报告的“零样本”性能可能源于训练数据分布覆盖,而非真正的组合泛化。此外,未与更轻量的世界模型(如基于结构化潜空间的方法)在**样本效率或数据效率**上进行对比,无法判断其优势是否仅来自规模。
- **语言接口的粗细粒度控制权衡**:将自然语言作为统一的动作界面,虽然灵活但引入了 **指令歧义与细粒度控制的缺失**。例如,在精细操作任务中,语言描述“向右移动 5 厘米”不如数值动作向量精确,而模型必须从视觉信号中推测尺度,可能导致可复现性差。同时,语言到视频帧的映射存在一对多问题(同一指令可对应多条物理轨迹),报告未讨论如何选择或评估生成轨迹的**物理合理性与任务成功率**,仅依赖图像质量指标(FVD、PSNR)可能不足以反映对下游策略训练的增益。