论文

World Action Models: A Survey

World Action Models: A Survey

World Action Models (WAMs) 是一种具身预测动作模型,能够对未来进行预测以辅助决策。近期 WAMs 主要沿两条路径发展:一是重新利用大型视频生成模型,二是基于语言或视觉语言主干而无需视频生成核心。这一快速发展模糊了广义世界模型、视频生成模型、动作接地的视频世界模型、视觉-语言-动作策略以及 WAMs 之间的边界。本综述为该领域提供了一个统一框架。 首先,它厘清了上述概念边界,然后通过两个互补视角组织现有工作:第一个视角关注每种方法需要生成的内容,涵盖渲染未来、潜在未来和无视频生成的动作推理;第二个视角从预测基质、主干网络、动作耦合和部署模式分解每种方法。这种分析支持对交互性、因果性、持久性、物理合理性和泛化性进行统一讨论,并涉及数据、评估和开放挑战。 贯穿这些维度,一个一致的设计模式浮现出来:WAMs 并非简单带有动作头的视频生成器,而是预测动作方法,其设计选择在表征丰富度与计算、内存、延迟和动作标签成本之间权衡。该领域正朝着生成更少未来内容但保留控制所需信息的方向发展。 - 关键概念:World Action Models, 视频生成模型, 动作耦合, 部署模式, 预测基质 - 数据集与指标:文中讨论了相关数据集和评估挑战,但未列出具体名称。 - 创新点:提供了统一的 WAMs 定义和分类框架,揭示了设计权衡。

论文精读

TL;DR 该综述厘清世界行动模型(WAMs)与其他概念的边界,通过预测基质、行动耦合、骨架与部署机制四维解剖统一现有方法,核心发现是WAMs并非视频生成器+行动头,而是随计算、延迟、行动标签成本权衡表征丰富度,领域正向“生成更少未来、高效支撑控制”演进。

问题

问题背景 具身智能系统在执行操控任务时,需要对动作的未来后果做出预测以支持决策,世界动作模型 (WAMs) 作为将预测未来直接服务于动作选择的框架,正成为机器人学习与自动驾驶等领域的聚焦点。

现有方法局限 当前主流路线存在明显分裂:一是基于视频生成的世界模型,它们通过渲染像素级未来来提供丰富表征,但推理计算与内存开销巨大,难以满足闭环控制的低延迟需求;二是以语言或视觉-语言模型为骨干的策略网络,它们绕过未来预测直接输出动作,虽然速度快,却缺乏对物理因果、时序持久性和交互合理性的显式建模,导致长期规划泛化能力不足。此外,这两类方法的边界模糊,缺乏统一的解剖框架,阻碍了系统性的对比与改进。

技术挑战与重要性 WAM 设计的核心矛盾在于表征丰富度与推理效率的权衡。理想模型需要生成包含物理规律(如因果性、物体持久性)的预测,同时确保在真实部署中计算可负担。该问题之所以困难,是因为需要从高维感知输入(视频、传感器)中提取简短却足以支撑决策的未来信号,并耦合多模态动作空间。业界对通用具身智能体的追求,使得 WAM 成为从仿真训练到真实世界泛化的关键瓶颈。

行业类比 这类似自动驾驶中从密集运动预测向稀疏占位预测的演进——WAM 正朝着“少生成、重控制”的方向转变,用更精简的预测换取实时且物理一致的动作输出。

核心洞察

  • WAM 的本质是通过“预测基板–动作耦合–骨干网–部署模式”四维解剖,明确区分于广义世界模型、视频生成模型和 VLA 策略。 传统综述常将上述概念混为一谈,而该工作首次以统一的符号和分类学,澄清了各方法在生成内容、动作交互方式和计算路径上的根本差异,尤其指出动作耦合并非简单的“视频+动作头”,而是决定模型是否真正面向控制的架构选择,这为选型与创新提供了可操作的评估框架。
  • 当前 WAM 的主流趋势是“生成更少而保留控制所需”,这与追求高保真完整视频生成的传统路线形成鲜明对立。 许多视频生成世界模型试图渲染整个未来帧,带来极大的计算和延迟开销;但实际控制往往只需部分表征(如隐空间状态、几何图元或可供性地图)。该设计转向直接降低了部署成本,同时通过约束生成目标来提升物理因果、持久性和交互性的学习效率,为资源受限的实时机器人系统铺平了道路。

方法

核心范式:预测未来以驱动行动

World Action Models (WAMs) 将状态预测动作生成统一为一个端到端系统:给定历史观测序列与过往动作,模型先对未来物理状态进行显式或隐式推演,再从中提取可执行的动作指令。

输入

  • 多模态上下文:RGB 视频帧、深度图、自然语言指令、本体感知信号等。
  • 动作序列:示教中的机械臂末端位姿、移动速度、离散动作 ID,或文本形式的任务描述。

关键模块与设计轴

WAMs 通过四个正交维度解耦设计空间:

  1. 预测基底 (Predictive Substrate)

    • 像素级基底:直接生成未来帧图像,保真度高但计算代价大。
    • 特征基底:在潜在空间预测未来表征,兼顾效率与表征丰富度。
    • 几何基元基底:预测物体位姿、关键点等结构化信息,物理可解释性强。
    • 可供性地图基底:预测操作区域热图,直接服务于动作定位。
      基底选择决定了“梦想什么”,与动作耦合方式正交。
  2. 动作耦合 (Action Coupling)

    • 条件 rollout:以当前动作序列为条件生成未来帧/状态。
    • 联合生成:动作与未来状态同时从噪声或序列中生成。
    • 后预测动作头:先生成未来,再通过额外策略网络抽取动作。
    • 动作表征可为连续数值、离散 token 或文本块,可控制 chunk size
  3. 架构骨干 (Architectural Backbone)

    • 迭代去噪 (视频扩散):高画质,推理慢,适合离线规划。
    • 自回归 (逐帧/逐 token):流式生成,延迟可控,支持在线使用。
    • 联合嵌入预测 (JEPA):不生成像素,预测能量函数或隐状态,计算高效。
    • 混合骨干:生成模型与动作头结合,共享编码器。
    • LLM/VLM 骨干:利用语言先验,直接推理动作而无需视频生成。
  4. 部署模式 (Deployment Regime)

    • 开环 rollout:一次性生成完整未来序列,再提取动作。
    • 分块闭环控制:逐段预测并执行,误差可回馈矫正。
    • 单步闭环:每步预测下一步,动作即时输出。
    • 交互模拟:人/智能体可在预测中交互修改未来。

输出

  • 未来状态:可以是渲染图像、潜在序列、符号化场景图或可供性分数图。
  • 动作轨迹:连续控制量或离散动作 token,供机器人执行。

与同类方法的差异

不同于纯视频生成的世界模型只追求视觉逼真,WAMs 明确将预测的未来面向动作裁剪;也不同于直接映射观测到动作的 VLA 策略,WAMs 显式建模未来状态,使因果推理、物理交互检查、长期规划成为可能,实现了“少生成、多行动”的效率平衡。

实验

实验设计概述

综述未提出全新实验,而是系统梳理了现有世界行动模型 (WAMs) 的评估范式。评估围绕两条主线展开:一是生成质量,包括视觉保真度指标 (PSNR、FVD 等);二是控制效能,通过闭环基准(如任务成功率、累积奖励)和物理合理性(persistence、causality)检验。数据源覆盖机器人遥操作、人类演示、互联网视频、仿真和 WAM 自我生成数据,形成了多层次的测试平台。

关键发现

当前评价存在显著缺口:视觉指标与任务表现不完全对齐,高质量渲染未必带来更优策略。许多方法在短视距 rollout 上表现良好,但在长程一致性物理交互上急剧退化。综述指出一个一致设计模式:WAM 不是简单在视频生成器上加动作头,而是通过基板 (substrate) 选择(像素、特征、几何基元、可供性映射)在表示丰富度与计算开销之间权衡。趋势是**“少生成,多行动”**,即只预测控制所需的未来信息,而非完整视频帧。

对比解读

三类设计哲学(Render-and-DecodeLatent-OnlyVideo-Generation-Free)形成鲜明对比。Render-and-Decode 视觉可解释但计算昂贵;Latent-Only 效率高却丢失细粒度细节;Video-Generation-Free 基于 VLM/LLM 直接推理行动,无需解码像素,延迟最低,但牺牲了物理动态模拟能力。基板与行动耦合 (action coupling) 的分离使方法可灵活组合,例如在特征基板上使用联合生成式耦合,兼顾效率与因果性。当前最佳实践倾向于在可交互闭环部署中,根据场景复杂度动态选择基板粒度,而非追求端到端像素级预测。

行业影响

落地场景

World Action Models (WAMs) 将未来预测与行动决策深度耦合,可在机器人操作、自动驾驶、游戏 AI、数字孪生等需要闭环交互的场景中落地。例如,仓库机器人可利用 WAM 预见抓取动作后的物体运动,自主调整路径;自动驾驶系统可通过预测未来交通参与者行为,提前规划安全轨迹;内容平台可借助 WAM 生成物理一致的交互式视频,用于用户创作或仿真培训。

商业价值

WAM 通过生成式预测替代大量真实交互数据采集,显著降低数据标注与物理试错成本。在具身智能场景中,WAM 既可充当数据增强引擎,又能作为可微的世界模拟器,加速策略训练,缩短产品迭代周期。此外,基于未来预测的决策可提升系统鲁棒性,减少异常工况下的安全损失,直接带来运营增收与体验升级

与现有工作流的集成

WAM 通常以预测模块形式嵌入现有具身智能栈:输入视觉-语言编码器(如 CLIP)的输出,结合动作指令,生成未来帧或潜在状态,再馈给下游的策略网络或规划器。这种松耦合设计使其能集成进 ROS 2 / Behavior Tree 等标准机器人中间件,或通过 API 与 NVIDIA Omniverse / Isaac Sim 等仿真平台联动,无需颠覆现有管线即可赋予其内省预测能力。

具体落地用例

  • 仓储拣选机器人:WAM 接收当前场景和 candidate grasp pose,预测执行抓取后的点云变化,判断是否会导致碰撞或滑落。若预测结果不安全,则拒绝该动作并重规划,显著减少现场调试时间和碰撞损耗。
  • 自动驾驶仿真测试:WAM 替代传统规则驱动的交通参与者模型,生成逼真的多模态未来轨迹,测试 ego 车辆在复杂交互博弈下的安全性。相较于物理引擎模拟,WAM 的神经生成可覆盖更多长尾场景,并降低计算开销,加速回归测试。

局限

  • 论文自陈的局限:当前 WAM 评估体系严重缺失,缺乏对物理可行性、因果性、持久性、交互性等核心属性的标准化基准,现有指标多以视觉保真度(如 FVD、PSNR)为主,难以衡量对实际控制决策的贡献;同时,数据获取仍高度依赖遥操作与人类演示,限制了可扩展性。
  • 方法论层面的局限:该综述的贡献在于统一术语与提出设计空间分类,而非提出新模型或实验发现;其划分的三种生成哲学(渲染解码、纯潜变量、无视频生成)与四种解剖维度(预测基板、动作耦合、骨干架构、部署模式)可能随领域快速演进而出现混合方法,导致分类边界模糊,且未给出不同设计选择的定量优劣对比。
  • 与更聚焦的综述对比的弱点:相比仅讨论视频世界模型或 VLA 政策的深度综述,本调查覆盖范围广但每个子领域的分析深度受限,未对特定方法(如扩散与自回归骨干)的计算-性能权衡提供系统性元分析或可复现的基准实验,部分表述停留在文献罗列层面,缺少对失败模式或负面结果的系统性归纳。
论文Qiuhong Shen2026-06-18原文

相关内容