论文

World-Language-Action Model 用于统一世界建模、语言推理与动作合成

World-Language-Action Model 用于统一世界建模、语言推理与动作合成

我们提出世界-语言-动作模型 (WLA),一种全新的具身基础模型。WLA 接收文本指令、图像和机器人状态作为输入,联合预测文本子任务、子目标图像和机器人动作,融合了世界-动作模型 (WAM) 从大量第一人称视频中学习世界建模的能力,以及视觉-语言-动作模型 (VLA) 解决复杂长时域任务的语言推理能力。 WLA 的核心是自回归 Transformer 骨干(而非 WAM 中的双向扩散 Transformer),用于预测下一状态,包括语义级文本意图和细粒度物理动态。物理动态由基于专用世界专家 (World Expert) 的世界建模目标监督,并用于简化动作专家 (Action Expert) 的状态-动作关联特征。WLA 使用元查询 (meta-queries) 使世界预测隐式影响动作生成,在推理时可禁用世界预测;也可激活世界预测以实现测试时扩展,提升机器人控制性能。 我们的原型 WLA-0(2B 活跃参数)在 NVIDIA RTX 5090 上单次推理仅需 40 ms。在仿真和真实环境评估中,WLA-0 实现了多任务与长时域学习的最优性能,例如在 RoboTwin2.0 Clean 上成功率达 92.94%,在 RMBench 上为 56.5%。WLA-0 还能直接从跨实体机器人视频中学习新任务,无需动作标注。

论文精读

TL;DR WLA 模型首次将世界建模、语言推理与动作生成统一为自回归 Transformer,通过 meta-queries 实现可选测试时扩展,以 2B 参数在长程任务中取得 SOTA 成功率。

问题

问题背景

具身智能旨在让机器人理解自然语言指令,在物理世界中完成复杂、长期的任务。当前主流路线分为两类:Vision-Language-Action (VLA) 模型 侧重语言推理与动作生成,而 World-Action Model (WAM) 通过预测物理动态来学习策略。两者各擅胜场,但如何在一套框架中统一语言推理、世界预测与实时动作生成,仍是开放难题。

现有方法局限

  • VLA 模型(如 RT-2、Octo)直接将指令映射为动作,缺乏对未来的显式预测。面对多步物理交互任务(如“清理桌面”需要依次移动多个物体),状态估计误差会逐步累积,导致长期任务失败率高。
  • WAM(如 Cosmos、Genie)虽能从视频中学习下一帧预测,但大多采用 双向扩散 Transformer (DiT),生成速度慢(>200ms/步),难以满足实时控制要求。同时,WAM 对语言指令的分解和推理能力不足,难以处理包含多子任务的复杂指令。
  • 此外,现有 WAM 难以利用 跨形态(cross-embodiment)视频 学习新任务,因为不同机器人的动作空间和形态差异巨大,模型无法直接迁移。

为什么这个问题难且重要

难点在于三个层面的耦合:语言推理 需要将长指令分解为子任务序列;世界预测 需要建模精细的物理动态(物体移动、接触等);动作生成 必须实时、准确,且能从世界预测中受益。三者相互依赖——语言意图驱动物理交互,物理反馈又修正动作选择。现有方法往往顾此失彼:VLA 忽略物理预判,WAM 缺乏语义规划。同时,从无动作标注的跨形态视频中学习 是降低数据成本的关键,但要求模型能抽象出独立于机器人硬件的物理常识,这对模型架构提出极高要求。业界对具身基础模型的需求日益迫切,因为泛化能力和样本效率直接决定机器人落地的可行性。

行业类比

这类似于 自动驾驶 中,将感知(周边预测)、规划(高层决策)与控制(底层执行)在统一模型中联合优化,从而在长尾场景中实现更鲁棒的行为。


综上,WLA 模型的提出正是为了填补这一空白:用自回归 Transformer 替代扩散模型,实现高速推理(推理仅 40 ms),并通过世界专家与元查询机制,让世界预测隐式指导动作生成,同时可从跨形态视频中学习新任务。

核心洞察

  • WLA 通过元查询机制将世界预测隐式注入动作生成,使模型既能从海量自我中心视频中学习物理动态,又能在部署时关闭世界预测以保持低延迟,形成了一种柔性且高效的世界模型利用范式。这与现有世界动作模型必须在线运行世界预测不同,显著降低了推理成本,同时保留了测试时扩展的选项。
  • 采用自回归 Transformer 同时生成文本子任务、子目标图像和动作,实现了语言推理与物理动态的紧耦合,避免了 VLA 模型中高层规划与低层控制分离的误差累积。这种联合预测使模型能够捕捉长程任务中语义与物理的协同,从而在复杂多步骤任务上显著超越基线。

方法

输入与多模态编码

WLA 接收文本指令多视角图像机器人本体状态 (关节角度、末端位姿) 作为输入。图像通过冻结的视觉编码器 (如 SigLIP) 提取特征,与语言指令的词元、状态向量拼接为统一的多模态 token 序列,送入模型主干。

自回归 Transformer 主干与状态预测

核心采用自回归 (AR) Transformer,区别于 WAM 常用的双向扩散 Transformer。模型逐个预测下一个状态,该状态被解耦为两部分:

  • 语义级文本意图:描述当前子任务 (如“拿起杯子”);
  • 细粒度物理动态:以子目标图像的形式,补全动作所需的视觉先验。 这种设计让语言推理与物理世界预测在统一框架内协同。

专家监督与训练目标

  • World Expert:由大规模自我中心视频预训练的世界模型提供监督,计算世界建模损失 (如像素重建或潜在空间对比),驱动模型学习环境动态。
  • Action Expert:利用世界预测产生的隐式物理表征,将状态变化与动作建立关联,通过行为克隆损失优化动作解码头。 训练时,模型同时优化世界预测和动作生成两个目标,前者为后者提供更丰富的上下文。

Meta-query 机制与推理优化

引入meta-queries 作为可调节的潜变量,控制世界预测对动作生成的影响权重。推理时:

  • 高速模式:关闭世界预测分支,仅生成动作,达到 40 ms/步 (RTX 5090);
  • 增强模式:激活世界预测并迭代微调,实现测试时扩展 (test-time scaling),提升长序列任务成功率。

与同类工作的差异:相比 VLA 模型仅输出动作,WLA 显式建模子目标图像与物理动态,可利用无动作标注的视频学习;对比 WAM 的扩散架构,AR 式生成更贴合序贯决策,且通过 meta-queries 提供灵活的推理精度-效率权衡。

实验

实验设计

WLA 在三个模拟基准 (RoboTwin 2.0, LIBERO, RMBench) 和真实机器人平台上评估多任务、长周期操控能力,并测试了从无动作标注的跨 embodiment 视频中学习新任务的潜力。模型使用 2B 参数的自回归 Transformer 骨干,输入为文本指令、图像和机器人状态,联合预测文本子任务、子目标图像与动作。推理时 meta-queries 机制可选择关闭世界预测,以降低延迟;也可激活世界预测进行测试时缩放 (test-time scaling) 来提升鲁棒性。

关键发现

  • WLA-0 在 RoboTwin2.0 Clean 任务上成功率达到 92.94%,在 RMBench 上达到 56.5%,均优于现有具身基础模型,验证了世界建模与语言推理融合的有效性。
  • 自回归 Transformer 统一处理语义级文本意图与细粒度物理动态,让世界预测隐式地引导动作生成,从而在长时序任务中保持状态一致性。
  • 在仅使用 2B 活跃参数的情况下,单次推理仅需 40 ms (NVIDIA RTX 5090),满足实时控制需求。
  • 即使没有动作标注,WLA 也能从跨 robot 视频中学习新任务,展现了利用海量无标注视频数据的潜力。

与基线的深度对比

相较于仅依赖视觉-语言-动作的 VLA 模型,WLA 引入了世界建模接口 (类似 WAM),能够从第一人称视频中学习物理规律,因此对未见场景的泛化能力更强。与 WAM 常用的双向扩散 Transformer 不同,WLA 的自回归架构能够同时预测高层语义与低层动态,避免扩散模型的高延迟,并在动作专家与状态-动作相关性建模之间建立了更紧密的联系。实验结果表明,这种设计在保持推理效率的同时,显著提升了长周期任务的完成率,尤其当激活测试时缩放时,性能可进一步提升。

行业影响

落地场景

WLA 模型 的核心能力是融合语言理解、世界建模与动作生成,直接面向具身智能产品。典型落地场景包括:

  • 智能仓储与物流:自主移动机器人(AMR)根据“将红色货箱从A区搬运至B区传送带”等自然语言指令,实时规划操作序列,并适应动态环境变化。
  • 家庭服务机器人:理解“打扫客厅后再去厨房取一杯水”的长程任务,自主分解子目标、预测物理交互结果,并执行抓取、放置、导航等动作。
  • 柔性制造:机械臂通过观察少量人类演示视频,无需动作标注即可学习新装配任务,快速切换产线。

商业价值

  • 降低开发与部署成本:利用大规模无动作标注的自我中心视频进行预训练,大幅减少对昂贵专家演示和逐任务编程的依赖。从视频直接学习新任务的能力,使系统的边际扩展成本显著下降。
  • 提升任务成功率与效率WLA-0 在长程任务基准 RMBench 上取得 56.5% 成功率,结合 test-time scaling 技术,可在推理时动态优化规划,直接降低任务失败带来的物料和时间浪费。
  • 改善用户体验:自然语言交互界面使非专业用户也能轻松指挥机器人,拓展了服务机器人的市场接受度。

与现有产品/工作流的接口

WLA 可作为 具身智能代理的控制策略模块 集成到现有技术栈:

  • 与机器人操作系统(ROS)对接:接收来自相机、激光雷达的感知流和 6-DoF 状态估计,输出目标关节位置或末端执行器轨迹,通过标准 ROS topic 或 Action 接口通信。
  • 模拟先行验证:先在 NVIDIA Isaac Sim 等仿真平台中对 WLA 策略进行闭环测试,再利用 sim-to-real 迁移技术部署到真实硬件,降低硬件损坏风险。
  • 云端-边缘协同:由于推理仅需 40 ms(RTX 5090),模型可部署在边缘 GPU 上,同时将稀有长程任务的世界预测和重规划请求卸载到云端,平衡延迟与算力成本。

具体落地用例

  1. 电商分拣中心的自主补货机器人: 当前流程仍依赖固定编程或人工遥控。部署 WLA 后,系统可直接解析业务系统下达的“将商品X从周转箱Y补货至货架Z第三层”指令,自主导航、识别和操作,并利用世界模型预测抓取对货架的影响,避免碰倒其他物品。该方案可减少对系统集成工程师的依赖,并适应每天变化的库存布局。

  2. 医疗场景中的辅助送样机器人: 护士通过语音或平板下达“去化验室取A类样本送到B病房”的任务,机器人利用 WLA 的语言推理能力分解子任务,结合实时视频预测开门、避让行人等动态效果,并生成安全动作序列。世界建模模块帮助机器人理解透明障碍物、湿滑地面等罕见物理属性,提升运行安全性和成功率。

局限

  • **计算与推理效率**:WLA-0 虽有 2B 参数并在 RTX 5090 上达到 40ms 推理,但单次推理仅生成一步动作;长序列任务仍需多次串行调用,累积延迟可能限制高实时性场景。此外,test-time scaling 会进一步显著增加计算开销,论文并未给出其计算成本与性能收益的定量关系,实际部署时需权衡吞吐与成功率。
  • **世界预测质量与依赖性**:世界预测的物理动态由 World Expert 监督,但论文未分析该预测的误差如何影响动作生成。若世界模型在未见环境或动态中产生偏差,通过 meta-query 机制仍可能误导 Action Expert,而关闭世界预测则将牺牲 test-time scaling 带来的增益。该机制在不确定环境下的鲁棒性缺乏系统评估。
  • **跨形态泛化的证据有限**:从无动作标注的跨形态视频学习仅在一组简化任务上展示了可能性,未系统验证形态差异(如不同自由度、视点)对学到的策略的迁移效果。此外,训练数据仍依赖大量标注的专家示教,如何高效利用纯视频数据仍是开放问题,WLA 目前仅提供了初步方向。
论文Yi Yang2026-06-04原文

相关内容