论文

Masked Visual Actions用于统一世界建模

Masked Visual Actions用于统一世界建模

视频模型从视觉世界的运动、交互和接触响应中吸收了丰富的先验知识,使其成为机器人世界建模的理想基础。核心挑战在于如何以与视觉空间一致的形式将动作传达给这些模型,同时保持物理操控的基础。 我们提出Masked Visual Actions,一种像素空间控制接口,将动作表示为视频中任意实体的部分暴露轨迹。暴露机器人运动使模型作为前向动力学模型,预测场景对低级机器人动作的响应;暴露期望的物体运动则使同一模型恢复与结果一致的机器人行为。仅使用15小时的真实视频和仿真掩码示例进行微调,单个检查点在多种场景和多种实体中实现了高视觉保真度和可控性。 在下游操控设置中,该模型生成的想象 rollout 结果与真实执行结果相关,可用于策略评估;通过基于模型的规划中对候选未来进行排序来改进决策;并支持逆向建模,从期望的物体运动合成机器人运动。

论文精读

TL;DR Masked Visual Actions 将操控动作表达为视频中实体部分运动轨迹的掩码,统一正向动态与逆向规划,仅15小时微调即实现跨具身泛化。

问题

机器人世界模型正寻求从大规模视频数据中捕捉物理交互先验,以提升在复杂场景中的预测与规划能力。现有方法通常采用文本描述离散动作标签关节空间矢量作为控制条件,但这些模态与视频模型预训练所使用的像素空间存在显著语义鸿沟。文本条件难以精确描述低层级的连续运动,离散动作丢失了运动细节,而关节空间矢量又高度依赖特定机器人形态,难以泛化。这导致视频模型无法充分利用其已学到的密集视觉交互先验,生成的未来帧往往物理不一致或无法准确响应操控意图。该问题的技术挑战在于:如何在保留视频模型强大的动态先验的同时,注入物理上可执行的动作控制信号,并实现跨场景、跨机器人形态的统一接口。工业界对通用机器人基础模型的探索(如 RT 系列)也凸显了此类统一世界模型的重要性。类比而言,这类似于图像生成领域中从文本到 ControlNet 可控生成的跃迁——关键在于提供一个能与视觉先验自然融合的控制表示,而非外挂一个模态不匹配的指令。Masked Visual Actions 提出了在像素空间直接描绘部分轨迹作为动作信号,巧妙绕开了模态对齐难题。

核心洞察

  • **像素级动作接口统一前向与逆动力学**:Masked Visual Actions 将控制命令表达为视频帧中任意实体的部分揭示轨迹,使同一个视频生成模型既能承担前向世界模型(预测机器人动作后的场景反应),也能作为逆模型(给定期望的物体运动合成机器人动作)。这与主流方法中为前向和逆问题设计分离模型的做法形成对比,从根本上利用视频模型已内化的物理交互先验,避免了为不同控制方向重新学习冗余表示。
  • **极低数据预算下实现跨具身泛化**:仅用 15 小时的掩码示例微调,模型就在多种真实与仿真场景、不同机械臂形态下达到高视觉保真度和动作可控性。这挑战了机器人世界模型必须依赖海量特定机器人数据的假设,证明通用视频扩散模型的视觉先验可以大幅降低新任务和平台的适配成本,为小样本机器人学习提供了更高效的路径。

方法

核心思路:在像素空间对齐动作与视觉

Masked Visual Actions 将机器人动作表示为像素空间中的部分揭示轨迹,将其作为条件注入预训练视频生成模型,实现统一的前向与逆向世界建模。

条件形式与模型范式

  • 动作表征:对任意实体(机器人末端、物体关键点),在连续视频帧上绘制其未来运动轨迹(如稀疏点序列),并随机 mask 掉部分时空区域(包括实体自身像素)。
  • 生成目标:模型以未遮挡的帧和历史轨迹为条件,预测被 mask 区域的视觉内容,本质上是 掩码视频预测(masked video prediction),迫使模型从轨迹线索中推断场景动态。

统一的前向与逆向动力学

  • 前向模型:输入当前观测 + 机器人末端轨迹(masked),预测场景对动作的响应(物体移动、接触变化)。
  • 逆向模型:输入当前观测 + 物体目标轨迹(masked),预测为实现该物体运动所需的机器人动作。 同一模型通过切换被揭示的实体即可切换功能,无需额外模块。

训练策略

  • 数据:混合少量真实机器人操作视频与大规模仿真数据,仅需约 15 小时训练时长。
  • 基础架构:基于预训练视频扩散模型(如 Stable Video Diffusion),冻结骨干权重,仅微调新增的条件注入层(如交叉注意力或拼接通道)。
  • 损失函数:标准扩散噪声预测损失,但仅计算被 mask 像素区域,引导模型专注生成未知动态。

与同类方法的差异

相比 UniPi、SuSIE 等方法将动作抽象为离散 token 或文本,Masked Visual Actions 在像素空间直接利用视频模型已有的运动先验,避免学习独立的动作编码器,在物理交互的视觉连贯性与跨 embodiment 泛化上更具优势。

实验

实验设计概述

实验围绕 Masked Visual Actions 这一像素空间动作控制接口展开,目标是验证其在统一视频世界模型中的视觉保真度、可控性及下游机器人任务的实用性。

  • 数据构造:从真实机器人操作视频和仿真环境中采集约 15 小时的交互片段,通过分割或渲染方式生成掩码示例,使模型学习在部分揭示实体轨迹的条件下进行视频补全。
  • 模型基础:基于大规模预训练视频扩散模型微调,保持其原有的视觉交互先验,只需少量掩码数据即可注入动作条件。
  • 评估维度
    1. 可控视频生成质量,对比不同视觉动作表示(如稀疏点、边界框等)下的 FVD 等指标。
    2. 下游机器人应用:策略评估(想象 rollout 与实际执行结果的相关性)、基于模型的规划(候选未来排序的决策提升)、以及动作提取(从期望物体运动合成机器人运动)。

关键发现

  • 统一前向/逆向建模:单一模型既可以作为前向动力学模型(给定机器人在像素空间的轨迹预测场景变化),也可作为逆向模型(给定物体运动反推机器人行为),这种对称性大幅降低了多模型维护成本。
  • 高数据效率与泛化:仅 15 小时数据微调,模型在未见过的场景和多种具身性(机械臂、环境布置等)上仍保持强视觉一致性,缓解了传统世界模型所需的大量配对数据问题。
  • 像素空间动作的自然对齐Masked Visual Actions 直接在视觉域表达意图,无需额外的编码器或语言中介,使模型能复用预训练视频模型中的接触、碰撞等物理先验,生成的 rollout 在视觉上更逼近真实交互。

与基线对比的深度解读

与常见的基于语言指令或低维关节空间的视频条件方式相比,Masked Visual Actions 展现出关键差异:

  • 表达粒度的优势:语言条件往往抽象,难以刻画精确运动轨迹;低维关节动作则需要为每种具身性定制编码。像素掩码轨迹是一种“所见即所得”的中间表示,既保留空间细节,又能跨具身性迁移。
  • 数据消耗:代表性工作如 UniPi 或 SuSIE 依赖大量带标签的机器人视频或特定模拟器数据,而本文方法仅需少量掩码视频即可适应新场景,工程上更具可部署性。
  • 下游性能:在策略评估和规划中,模型生成的想象帧与真实执行结果的语义一致性显著超过使用文本条件的基线,这表明视觉动作空间对物理交互的预测更可靠。

行业影响

Masked Visual Actions 将动作信号以像素掩码形式融入预训练视频模型,使同一模型既能前向预测场景响应,又能逆向推断机器人行为,为工业界提供了一种轻量、统一的视觉世界建模方案。

落地场景

  • 机器人操作仿真与规划:在虚拟环境中生成高保真物理交互视频,用于策略评估、模型预测控制,以及从目标图像规划动作序列。
  • 自动化仓储与物流:在包裹分拣、拆垛等任务中,通过指定物体运动掩码,反向合成机器人运动轨迹,或前向预测操作后果,辅助抓取规划。
  • 自动驾驶仿真:预测车辆动作后的场景演化,为感知-规划系统提供低成本闭环测试环境。
  • 视频内容生成:通过实体运动掩码控制生成符合物理规律的视频,用于影视预演、游戏资产动态合成等。

商业价值

  • 降低数据采集与标注成本:仅需 15 小时混合数据微调,即可获得跨场景、跨机器人形态的通用世界模型,避免了大量真实操作数据的采集与标注。
  • 缩短开发与测试周期:在仿真中完成决策评估与规划迭代,减少真实世界试验次数,尤其对高风险场景(如大负载搬运)意义显著。
  • 增强泛化与新任务适应:单个模型在新场景和新型号机器人上直接复用,无需重新训练物理引擎或专用模型,提升自动化产线切换效率。
  • 提升操作成功率与吞吐量:更准确的动作预测和规划直接转化为更高的任务完成率和设备利用率,带来可量化的降本增效。

与现有产品/工作流接口

该模型可作为世界模型插件集成到现有机器人软件栈中:

  • 仿真器集成:与 Isaac Sim、MuJoCo 等仿真器配合,替代或加速物理引擎执行“思维实验”,为模型预测控制(MPC)提供快速 rollout。
  • 逆动力学模块:模型输出的像素轨迹可接轻量逆动力学网络,将视觉预测映射回低维关节动作,直接对接 ROS 控制器。
  • API 化与服务部署:封装为 REST/gRPC 服务,供边缘或云端推理,支持远程遥操作界面或策略学习模块的异步调用。

具体落地 Use Case

  1. 电商仓储混合料箱抓取:给定杂乱料箱的图像和目标物体运动掩码,模型生成物体移动的中间帧,再由逆动力学输出夹爪轨迹。相比传统抓取规划器,该方法能处理非预定义接触和复杂堆叠,并在仿真中以 1000 倍速度生成训练数据用于策略蒸馏。实际部署时,可直接与 NVIDIA Isaac Manipulator 的任务执行引擎结合,将规划结果作为参考轨迹下发给控制器。
  2. 服务机器人直观遥操作:操作员在界面中绘制物体移动的像素掩码,模型实时合成机器人行为视频,经确认后直接驱动执行。这比传统编程示教或 kinesthetic 拖拽更直观,降低专业门槛。该功能可作为“意图到动作”的转换层,集成到现有的远程操作 GUI 平台中。

局限

  • **依赖精确分割与渲染**:通过掩码方式生成视觉动作,需要准确提取场景中机器人或物体的像素级轨迹。这依赖于高质量的分割模型或渲染数据,对于透明物体、严重遮挡或动态背景等复杂场景,分割误差会直接影响动作条件的可靠性。在真实世界部署时,构建此类标注的成本较高,可能限制大规模应用。
  • **逆动作提取的隐式局限**:虽然该模型统一了前向和反向建模,但从期望物体运动到机器人动作的提取仍依赖附加的逆动力学模型。这个模型可能难以捕捉物理交互中的不确定性,导致在多物体或接触密集的任务中,合成动作的准确性和泛化性不足。论文未深入分析逆模型在分布外场景下的鲁棒性。
  • **2D 像素轨迹缺失深度线索**:视觉动作以 2D 轨迹形式编码,缺乏深度和 3D 空间关系。这可能导致生成的视频中出现几何不一致,例如物体缩放或遮挡关系错误。对于需要精确 3D 推理的操作任务(如插入、堆叠),仅靠 2D 条件可能不够充分,造成策略评估或规划时的性能瓶颈。
论文Hadi Alzayer2026-07-21原文

相关内容