Light-WAM: 基于状态融合动作解码的高效世界动作模型
World Action Models (WAMs) 通过将未来预测作为额外训练目标来扩展机器人策略学习,促使策略在其表示中编码与任务相关的时间结构。然而,当前的 WAMs 通常依赖大规模生成式架构,导致高训练成本和推理延迟,难以部署为高效的闭环策略。 Light-WAM 是一种轻量级世界动作模型,专为高效机器人操作设计。具体而言,它采用紧凑的视频骨干网络,并在降采样潜在空间中进行未来视频监督,从而降低视频协同训练成本,同时保留其对表示学习的益处。对于动作预测,Light-WAM 引入 StateFusionActionExpert,该模块从多个骨干层读取适应后的状态,通过 learned-query pooling 融合这些状态,并在单次前向传播中直接预测动作块。这种设计为视频骨干表示与机器人动作之间提供了高效接口,避免了重型生成式动作专家的需求。 实验表明,Light-WAM 在 LIBERO 基准上保持强性能,在 RoboTwin 2.0 上实现了可用的多任务性能,同时仅使用 0.44B 可训练参数。此外,其推理延迟仅为 72.03ms,峰值 GPU 内存为 4.1GiB,并提升了训练吞吐量。
论文精读
TL;DR **Light-WAM** 以紧凑视频骨干与状态融合动作解码,将世界动作模型压缩至 0.44B 参数、72ms 延迟,在维持 LIBERO 高性能的同时大幅降低训练和推理成本。
问题
问题背景
世界行动模型(World Action Models, WAMs)将未来预测作为额外的训练目标,使机器人策略学习到任务相关的时序表征,在复杂操控中展现出潜力。
现有方法的局限
当前 WAMs 普遍采用大规模生成式架构,存在以下核心瓶颈:
- 高昂的训练成本:需要同步训练视频编解码器与动作预测模块,参数量大,训练吞吐量低。
- 推理延迟过高:生成式动作专家(如扩散模型或自回归解码器)导致闭环控制中每步决策延迟达数百毫秒,无法满足实时控制需求。
- 视频共训练代价大:直接在像素空间或高维潜空间预测未来帧,计算开销与内存占用极高,削弱了其在实际部署中的可行性。
问题的难度与重要性
该问题的技术挑战在于同时实现三个目标:
- 维持未来视频监督带来的表征学习优势,使策略隐式建模环境动态与物体交互;
- 去除笨重的生成式动作解码器,实现高效的单步前馈动作预测;
- 保证闭环推理的实时性,这对机器人操作的安全性与成功率至关重要。
业界关注度高,因为 VLA 模型虽多,但端上部署效率始终是落地瓶颈。Light-WAM 的思路——用轻量视频骨干提取特征、在降采样潜空间进行视频共训练、并通过 StateFusionActionExpert 直接输出动作块——正是对该挑战的系统性回应。
行业类比
这一设计思路类似于在自动驾驶感知-规划模型中,用共享的轻量 CNN backbone 提取时序视觉特征,然后分头输出未来轨迹预测和控制指令,既保留预测信号的辅助作用,又避免引入大型生成模型带来的延迟。
核心洞察
- - **在低维潜在空间中执行未来视频联合训练**,使得轻量级世界动作模型能够保留时序结构编码的优势,同时避免了大规模生成架构的高昂计算开销。这与依赖扩散模型或 Transformer 来生成未来帧的路线(如 UniPi、SuSIE)不同,Light-WAM 将视频预测压缩至下采样后的潜在空间,仅用 0.44B 参数就在 LIBERO 和 RoboTwin 上保持了强性能,且推理延迟仅 72ms,为实时闭环部署提供了实用方案。
- - **StateFusionActionExpert 提供了一种直接、非生成式的动作解码器**,它从视频骨干的多层适应状态中提取信息,通过可学习的查询池化进行融合,并一次性输出动作块。该设计取代了常见的自回归生成或扩散动作预测头,消除了逐 token 解码带来的推理延迟和额外参数量,实现了视频表征到机器人动作的高效映射,证明了简洁的融合与映射足以支撑复杂操控任务。
方法
Light-WAM 的输入为机器人多视角视觉观测(RGB 图像序列)与任务指令(语言 / 目标状态),输出为直接驱动末端执行器的 动作块(action chunks),实现端到端闭环控制。方法围绕三个关键模块展开:
轻量视频主干与潜在空间协同训练
模型采用紧凑的 ViT 变体作为视频主干,在多个层级同时编码时空表征。为引入未来预测这一辅助训练目标,Light-WAM 并非在像素空间生成未来帧,而是在 降采样潜在空间 中进行视频监督:主干提取的当前隐变量被用于预测下一时间步的潜在状态,计算 latent reconstruction loss。这种设计将视频协同训练的计算量大幅削减,同时保留了鼓励策略学习时序结构的收益。
StateFusionActionExpert 与查询瓶颈融合
动作预测由 StateFusionActionExpert 模块完成。它从主干不同层抽取已适配的视觉状态(adapted states),通过一组 可学习查询向量(learned-query pooling) 执行跨层特征聚合——查询与多层特征交互,产生紧凑的融合表征。随后,一个轻量解码头直接将该融合表征映射为未来多个时间步的动作块,单次前向传播即完成决策,无需重型生成式动作专家(如扩散模型)。
与同类方法的差异
现有世界动作模型多采用大型生成架构(如视频扩散模型)同时预测未来帧和动作,训练成本高、推理延迟大。Light-WAM 用 主干共享的潜在空间协同训练 + 查询瓶颈动作解码 替代像素级生成,在保持表征学习效果的同时将可训练参数控制在 0.44B,推理延迟仅 72ms,兼顾性能与部署效率。
实验
实验设计采用 LIBERO 与 RoboTwin 2.0 两个多任务操作基准,评估未来预测共训练对策略表征学习的增益。LIBERO 侧重多样化操作序列,RoboTwin 2.0 提供更丰富的任务变体,二者共同测试模型泛化能力。评估维度除任务成功率外,重点考察可训练参数规模、推理延迟、GPU 内存峰值与训练吞吐量,并辅以消融实验和可视化分析。
关键发现:Light-WAM 在 LIBERO 上保持强竞争力性能,同时仅需 0.44B 可训练参数,远低于常规生成式 WAM(常 >1B)。推理延迟 72.03ms、峰值内存 4.1GiB,满足实时闭环部署需求。在 RoboTwin 2.0 上亦达到可用多任务水平,证明轻量化设计未牺牲泛化性。核心模块 StateFusionActionExpert 通过多层级状态融合与可学习查询池化,单次前向即输出动作块,消除了重生成式专家的延迟瓶颈。下采样潜在空间视频共训练保留时序结构学习优势,同时大幅压缩训练计算量,提升吞吐。
与基线对比:传统 WAM 依赖扩散或 Transformer 等大规模生成架构,虽能较好建模未来视频与动作,但参数量庞大、推理缓慢,难以形成闭环策略。Light-WAM 以紧凑视频骨干替代生成模型,并用 StateFusionActionExpert 直接桥接视觉表征与动作空间,实现高效解耦。这一设计在参数量与延迟上形成数量级优势,表明有效表示学习无需昂贵生成监督,为资源受限机器人场景提供了新的效率-性能权衡范式。
行业影响
工业落地场景
Light-WAM 以 0.44B 参数实现 72ms 推理延迟与 4.1 GiB 显存占用,直接指向 边缘端机器人操控 场景,尤其适合需实时闭环控制的 工业机械臂、移动操作机器人 和 自动驾驶车辆。其轻量设计使模型可部署在低算力嵌入设备上,用于分拣、装配、家庭服务等任务,而不依赖云端 GPU。
商业价值
- 降本:大幅降低推理算力需求与训练开销,使中小型企业或初创团队也能训练与部署高性能机器人策略,减少硬件采购与运维成本。
- 增效:高推理吞吐与低延迟提升产线节拍,同时多任务能力(如 RoboTwin 2.0 结果)让单一模型覆盖更多工位,减少模型切换时间。
- 体验提升:在服务机器人场景,低延迟带来更流畅的人机交互,视频预测能力可辅助遥操作或远程监控中的状态预览。
与现有技术栈的集成
Light-WAM 以 视频骨干 + 动作专家 解耦设计,可无缝替换现有 VLA(Vision-Language-Action)模型中的动作预测部分,或作为 ROS 2 节点 集成进标准机器人中间件。其 StateFusionActionExpert 直接输出动作块,避免生成式专家带来的延迟,易于与现有感知模块(如目标检测、跟踪)对接,只需提供连续的观测帧与状态输入。训练流程中采用 下采样潜在空间视频协同训练,可与现有模仿学习或强化学习框架结合,作为辅助任务提升表征质量。
具体落地用例
- 电商仓储拣选:在 AGV 或机械臂上部署 Light-WAM,实时处理 RGB 视频流直接输出抓取动作块,替代传统“视觉感知→轨迹规划→控制”的多阶段流水线,降低系统复杂度并提升对动态物品的抓取成功率。
- 手术机器人辅助:用于内窥镜操控或器械跟踪,模型接收手术区域视频,预测后续动作序列,帮助医生在精细操作中抵消手部震颤,因为低延迟与低显存特性使模型可集成于手术台旁的嵌入式计算单元,满足实时性与安全要求。
局限
- - **任务与场景覆盖有限**:实验主要在 **LIBERO**(桌面操作)和 **RoboTwin 2.0**(双臂协同)上完成,这二者均为实验室环境下的标准基准,与现实世界中的非结构化、遮挡严重、光照变化等场景仍有较大差距。论文虽然提供了 `Real-World Evaluation` 段落,但未给出系统的泛化实验,无法评估模型对视觉域偏移的鲁棒性。
- - **下采样潜在空间的表达能力边界**:为了降低视频协同训练的计算开销,Light-WAM 在 **downsampled latent space** 进行未来帧监督。这种做法隐含假设任务相关时序信息主要存在于低频特征中,当需要细粒度动作(如精密插拔、柔性物体操作)时,丢失的高频视觉细节可能成为瓶颈,论文尚未分析该设计对精细操作的性能影响。
- - **StateFusion 的架构依赖性**:`StateFusionActionExpert` 通过 **learned-query pooling** 从多尺度 backbone 特征中融合信息并直接预测动作块,避免了生成式解码器。然而该设计高度依赖视频 backbone 的特征质量,如果更换 backbone(例如从 compact 模型切换到 ViT 变体),fusion 模块可能需要重新设计或调优,其通用性尚未在论文中验证。