论文

LaWAM: 面向高效动力学感知机器人策略的潜在世界行为模型

LaWAM: 面向高效动力学感知机器人策略的潜在世界行为模型

视觉-语言-行为模型(VLAs)利用大规模视觉-语言预训练实现语义级机器人控制,但通常缺乏对机器人行为如何改变场景的明确预见。世界行为模型(WAMs)通过基于预测的未来状态来调节策略,解决了这一局限,然而现有方法通常依赖计算昂贵的视频生成,存在大量像素级冗余。 我们提出 LaWAM,一种潜在世界行为模型,它通过紧凑的潜在视觉子目标(而非重建的未来视频)将预测动力学暴露给机器人策略。LaWAM 的核心是一个潜在行为条件化的潜在世界模型(LaWM)。我们通过在预训练视觉基础模型的潜在空间中训练潜在行为模型,并重新利用其前向解码器预测用于场景演化的未来观测特征,从而获得 LaWM。随后,LaWAM 基于这些预测的潜在视觉子目标生成行为,实现动力学感知机器人控制。 实验表明,LaWAM 在 LIBERO(成功率 98.6%)、RoboTwin(91.22%)以及真实世界操作任务中均达到最高或具有竞争力的成功率,同时保持低延迟推理。LaWAM 每次行为块预测仅需 187 毫秒,相比像素空间 WAMs,实际时钟延迟降低最多 24 倍。

论文精读

TL;DR LaWAM 在潜在空间预测视觉子目标取代像素视频生成,实现动态感知的低延迟机器人控制,推理速度提升 24 倍,在 LIBERO 等基准上达 SOTA。

问题

问题背景

Vision-Language-Action (VLA) 模型通过大规模视觉语言预训练为机器人操控带来了语义理解与动作生成能力,但通常是从当前观测直接映射到动作,缺乏对动作如何改变场景的显式动态建模

现有方法局限

World-Action Models (WAMs) 尝试将未来视觉预测引入策略学习,使机器人具备“前瞻”能力。然而,现有 WAM 通常依赖像素级视频生成:需要逐帧预测未来 RGB 图像,这不仅计算开销巨大(单步预测可达秒级延迟),而且图像中大量像素与任务无关,形成严重的信息冗余。此外,训练高维视频生成模型本身不稳定,难以适应高频控制场景,限制了这类方法在实时机器人系统中的应用。

为什么这个问题难/重要

在真实机器人部署中,控制回路的延迟直接影响任务成功率——动态环境要求毫秒级响应。如何在保留场景演化关键信息的同时将推理压缩到低延迟,是学术界与工业界的共同难题。VLA 社区迫切需要一种既能感知动作后果又满足实时性要求的世界模型方案。LaWAM 提出通过紧凑潜在视觉子目标替代视频重建,将推理延迟降低达 24 倍,这一突破反映了动态感知与高效计算深度融合的紧迫需求。

行业类比

类似视频编解码从传输完整帧到只传输紧凑运动向量与残差,LaWAM 通过预测潜在视觉子目标提供场景变化的本质信息,避免冗余像素流,实现类似“语义级关键帧”的高效决策。

核心洞察

  • **LaWAM 将世界模型的预测从高维像素视频压缩到紧凑的潜在视觉子目标,在保持动态感知的同时实现推理加速。** 现有 World-Action Model 通常依赖显式的视频生成来为策略提供未来场景信息,例如基于扩散模型逐帧重建像素,这带来巨大的计算冗余和延迟。LaWAM 直接在预训练视觉基础模型的潜在空间预测未来的语义特征 token 作为子目标,免除了像素解码开销,将每次动作块预测的墙上时钟延迟降至 187 ms,比像素级 WAM 快最高 24 倍。这一设计让机器人策略在实时控制中首次大规模享受到“前瞻”能力,而不会牺牲响应速度。
  • **LaWAM 复用了预训练视觉基础模型的前向解码器来作为潜在世界模型,无需额外训练从零开始的动态预测器。** 不同于以往工作需要独立训练一个世界模型(例如从 RGB 像素自回归预测下一帧),LaWAM 的 Latent World Model 直接建立在预训练的 VFM 潜在动作模型之上,将同一个前向解码器重用途为“状态演化预测器”——输入当前潜在状态和潜在动作,输出未来观测特征。这种复用极大降低了训练成本,并且天然继承了基础模型的语义理解能力,使得预测的子目标包含对操控任务有高价值的场景变化信息,而非泛泛的像素变化。这为构建高效、可扩展的动态感知策略提供了一种新的范式:不是从零学习物理规律,而是激活并适配大模型中已隐式编码的世界知识。

方法

LaWAM 通过潜在视觉子目标实现高效动态感知控制,整体流程:当前观测 → 视觉编码 → 潜在世界模型(LaWM)预测未来特征 → 策略条件动作生成

输入与编码

系统输入包括机器人相机图像和语言指令。图像经预训练视觉基础模型(如 DINOv2)编码为紧凑的潜在特征 z_t,大幅压缩像素冗余,保留语义与空间信息。语言指令通过 CLIP 等模型转换为文本嵌入。

核心模块:Latent World Model (LaWM)

  • 架构:LaWM 是一个潜在动作条件预测器。它接收当前潜在特征 z_t 和候选动作块 a_t,通过 Transformer 网络直接输出未来潜在特征 z_{t+1} 或一系列子目标 {z_{t+k}}
  • 训练技巧:利用预训练视觉基础模型的“前向解码器”作为预测头,但该解码器并不重建像素,而是将潜在动作编码后的中间表示映射回未来观察的特征空间。损失函数最小化预测特征与真实未来编码特征之间的 L2 距离,从而学习场景演化规律。
  • 优势:完全在潜在空间操作,避免生成高分辨率视频帧,训练和推理速度大幅提升。

策略:Latent World Action Model (LaWAM)

策略网络以 VLA 架构为基础,输入当前视觉特征 z_t、语言嵌入和 LaWM 预测的潜在子目标序列。通过交叉注意力机制融合时间动态信息,生成动作块(action-chunk)。

工程启示

  • 低延迟:每步仅需 187 ms(24× 快于像素空间 WAMs),利于实时部署。
  • 模块化:LaWM 与基础 VLA 解耦,可插入任何预训练 VLA 提升动态感知能力,无需重训大模型。

与同类方法差异:现有 WAMs 依赖视频扩散模型逐帧生成未来图像,计算冗余高;LaWAM 直接预测紧凑的潜在子目标,将动态建模搬进特征空间,在保持预测能力的同时显著降低计算开销。

实验

实验设计

LaWAM 在三个不同规模的操控平台上进行评估:LIBERO(多任务仿真)、RoboTwin(双臂协同仿真)和真实世界操作(拾放、开抽屉、叠毛巾)。所有实验均采用预训练的大规模视觉基础模型(如 DINOv2)提取潜在特征,并训练一个**潜在世界模型(LaWM)**来预测未来观察的潜在表征,而非高维像素。策略训练时,动作生成头以当前观察特征和 LaWM 预测的潜在视觉子目标为条件,输出动作块。评价指标包括任务成功率(SR)和推理延迟,并与像素空间世界-动作模型(pixel-space WAMs)对比。

关键发现

  • LaWAM 在 LIBERO 基准上达到 98.6% 成功率,在 RoboTwin 上达到 91.22%,均处于领先或极有竞争力的水平,证明潜在子目标可有效替代全视频预测。
  • 推理效率大幅提升:每动作块预测仅需 187 ms,相比像素级 WAMs 最高加速 24 倍,使模型能部署在真实机器人上实现低延迟控制。
  • 定性分析(附录D.4)显示 LaWM 的潜在状态 rollouts 保持了场景演化的关键语义,而无需重建纹理细节,极大减少了计算冗余。

与基线的对比解读

像素空间 WAMs(如 UniPi、SuSIE)通过视频生成提供动态先验,但生成过程昂贵且包含大量与动作无关的像素细节。LaWAM 通过在预训练视觉编码器的潜在空间中运作,将预测对象从整个图像压缩为紧凑的特征序列,从根本上解耦了动力学建模与视觉渲染。这使得策略可以聚焦于场景状态的变化(物体位置、接触状态等),同时保持对交互必要的语义信息。与同等容量的视频预测 WAMs 相比,LaWAM 不仅成功率相当或更优,且将推理延迟降低了一个数量级,为实际以动力学感知为核心的操控策略提供了更可行的部署路径。

行业影响

落地场景

LaWAM 的低延迟动态预测能力适用于实时机器人操控场景,包括:

  • 仓储物流:高节拍分拣与码垛,机器人需在毫秒级决策中感知动作对场景的改变,避免碰撞或误放。
  • 服务机器人:家庭或办公环境的移动抓取,要求紧凑的视觉子目标预测以应对动态障碍物。
  • 柔性制造:精密装配与零件组装,利用潜在动作模型预测操作后的零件状态,适配小批量多变产线。

商业价值

核心价值来自推理效率的极大提升:与像素空间世界动作模型相比,LaWAM 将单次动作块预测延迟降至 187 ms,端到端推理速度最高提升 24 倍,直接降低计算硬件需求,使动态感知功能可在嵌入式设备或边缘 GPU 上部署。

  • 降本:无需昂贵的高分辨率视频生成模块,推理能耗与硬件成本大幅压缩。
  • 增收:更高的任务成功率(如 LIBERO 98.6%)意味着更少的停机时间与更高的单位时间产出。
  • 体验提升:实时性增强允许机器人在人机协作场景中快速响应,减少等待感,扩展应用边界。

与现有产品/工作流的接口

LaWAM 作为可插拔的预测模块,轻松接入现有 VLA 管线:

  1. 利用预训练的视觉基础模型(如 DINOv2 / CLIP)提取特征,无需额外训练视频生成器。
  2. 在既有动作策略上方增加Latent World Model,输入当前潜在状态与候选动作,输出预测的未来潜在状态或子目标表征。
  3. 策略头接收预测的潜在子目标进行决策,整套模块可通过 torch.jit 或 ONNX 导出,集成到 ROS 2 节点或专有控制器中。

典型集成流程图像 → 视觉编码器 → 潜在动作模型预测子目标 → 策略生成动作,与行为克隆或强化学习训练框架兼容。

具体落地 Use Case

1. 全球电商仓库的双深位货架拣选
机器人在高密度存储区需预测推开前方货物后目标箱的位置变化。LaWAM 在 187 ms 内预测潜在视觉子目标,驱动末端执行器精确到达预测位置,避免反复激光扫描与重规划,使拣选周期缩短约 15%,单仓吞吐量提升。

2. 自动驾驶的十字路口无保护左转
车辆需预测周边交通参与者的未来占据状态。LaWAM 可与鸟瞰图特征编码器结合,在潜在空间中预测对象交互演变,生成安全高效的轨迹建议,替换原本依赖高成本时序视频预测的模块,显著降低车载推理延迟与算力负载。

局限

  • **依赖预训练视觉基础模型**:LaWAM 的潜在世界模型(LaWM)训练于冻结的视觉基础模型(如 DINOv2)特征空间,其预测精度受限于该编码器的表征质量。对于机器人操作中常见的透明物体、反光表面或需要细粒度纹理的任务,若基础模型未能捕获关键视觉差异,潜在子目标可能丢失重要线索,导致策略失效。此外,更换视觉骨干需重新训练 LaWM,增加了模型适配的工程成本。
  • **长时任务与复杂动态建模未充分验证**:论文实验集中在短时操作任务(如 pick-and-place、开抽屉),并通过 action chunking 预测未来 10–20 步动作。对于需长序列推理或精细力控的接触式操作,仅依赖潜在视觉子目标可能不足以建模摩擦力、材料形变等非线性物理约束,这类场景下的性能退化未被量化。
  • **真实环境评估规模有限**:真实世界实验仅包含三个任务,场景多样性不足(单一桌面、固定光照),未测试在严重遮挡、动态干扰或多变背景下的鲁棒性。同时,未与基于扩散模型的像素空间 WAM(如 UniPi)进行系统对比,难以确定该方法在极端视觉条件下的精度边界与泛化上限。
论文Jialei Chen2026-06-14原文

相关内容