Latent Action as Intention Enables Efficient Future Imagination for World Action Models
世界动作模型 (WAMs) 通过建模观察演化来提升机器人控制,但测试时生成未来观察会产生大量延迟。Fast-WAM 为追求效率移除了该过程,然而我们的对照实现显示,在机器人演示稀少和分布外场景下,Fast-WAM 的泛化性低于未来感知的替代方案。为弥合这一差距,我们提出 LAWA,一种 WAM 架构,利用紧凑的 潜在动作 (latent actions) 作为未来意图的操作性表征,从而在测试时无需生成未来观察即可实现高效未来想象。 具体而言,LAWA 采用经 无动作预训练 (action-free pre-training) 增强的离散分词器,生成以操控为中心的码本目标。在推理时,LAWA 联合去噪一个锚定到这些目标的连续潜在状态与可执行动作块,同时省略未来视频分支。在 RoboCasa 上,LAWA 在少样本和全数据设置下分别达到了 65.6% 和 80.8% 的平均成功率,优于匹配的 Fast-WAM 基线 9.6 和 4.5 个百分点。它还保持了匹配的 Joint-WAM 变体的性能水平,同时推理延迟降低了 42.9%。 此外,LAWA 在 LIBERO-Plus 上展现了有竞争力的零样本鲁棒性,并在真实世界任务中表现出优越性能。这些结果表明,未来想象不必被舍弃:以紧凑潜在动作保留它,能够在性能、泛化和延迟之间取得有效权衡。代码和模型将发布。
论文精读
TL;DR LAWA 用紧凑潜在动作作为未来意图表示,在推理时省去未来视频生成,以低 42.9% 延迟保持 Joint-WAM 性能:RoboCasa few-shot 成功率 65.6%,较 Fast-WAM 提升 9.6 个点。
问题
问题背景
世界动作模型(WAM) 通过显式建模未来观测演化来提升机器人控制表现,但推理时生成未来视频帧会引入不可忽视的延迟。近期工作转向 Fast-WAM 范式,放弃未来观测生成以换取实时性。
现有方法局限
然而,匹配实现显示:Fast-WAM 在稀缺演示(few-shot)和分布外场景下泛化显著劣于 future-aware 变体。根本原因在于:显式未来观测流提供丰富的监督信号,帮助模型学习环境动力学与任务结构;单纯移除该分支虽然降低延迟,却也丢失了未来意图的语义锚点,导致策略过度依赖当前观测,难以应对未见状态。具体表现为 RoboCasa 基准上 Fast-WAM 成功率明显低于 Joint-WAM,且差距在少量数据下进一步扩大。
为什么这个问题难/重要
核心挑战是同时权衡性能、泛化与推理延迟:生成像素级未来观测成本高,但完全丢弃未来信息会削弱模型理解长期后果的能力。业界对机器人基础模型既要求实时性,又期望在少量数据下保持鲁棒,这种矛盾在真实部署中尤为突出。LAWA 证明可使用紧凑 latent action 作为意图表示,在推理时无需生成观测即可保留未来想象,提供了一种新折中。
行业类比
类似自动驾驶中从显式视频预测模型转向可微分规划的轨迹 latent 表示,在降低计算开销的同时保持对未来的推理能力。
核心洞察
- 未来想象可以压缩为离散意图码,而不必生成高维视频帧。LAWA 的核心创新在于用离散 tokenizer 将未来观测映射为紧凑的 codebook 索引,作为“意图”表示;这一表示在训练时引导连续 latent state 去噪,推理时直接预测该意图码对应的 latent state,完全省略未来视频解码。相比 Fast-WAM 完全丢弃未来信息导致泛化下降,以及 Joint-WAM 生成完整未来观测带来高延迟,LAWA 证明中间粒度(隐式意图)即可保留大部分未来信息,同时将推理延迟降低 42.9%。这种“以码代帧”的思路对需要未来预测但受实时性约束的具身智能系统有直接工程借鉴意义。
- 通过 action-free 自监督预训练注入操控先验,使 latent action 与任务相关变化对齐。LAWA 的离散 tokenizer 在预训练阶段不依赖动作标签,而是在海量 egocentric 视频上学习重建被掩蔽或变换的观测,从而学习到针对“物体移动、接触、遮挡”等操控事件的紧凑表示。这样得到的 codebook 天然聚焦于场景中与操控相关的动态,而非背景或无关纹理。在少量机器人演示或 OOD 场景下,这种先验帮助模型快速抓住任务关键变化,解释了 LAWA 在 few-shot 和 LIBERO-Plus 上的鲁棒性。工程上,这提示我们:在标注稀缺时,无动作自监督是构建有效表示的高效途径。
方法
输入与总体流程
LAWA 接收当前观测与机器人状态,通过一个 离散 tokenizer 将未来意图压缩为紧凑的 latent actions,并与可执行 动作块 联合建模。推理时只需 latent action 先验和当前状态,省略未来视频生成分支。
关键模块
Latent Action Tokenizer
利用 action-free egocentric pre-training 增强离散编码器,生成 manipulation-centric codebook targets。该 tokenizer 将未来视觉变化映射到离散码本索引,作为意图锚点。Latent Action as Intention
通过 multi-model joint attention 将离散码本目标与连续潜在状态融合,形成“意图表征”。这一连续潜在状态被进一步去噪,并与 executable action chunks 联合训练,而不是直接预测未来观测。Training Objective
训练包含三部分:tokenizer 的码本重建损失、意图对齐损失、以及潜在状态与动作块的去噪回归损失。辅助监督强调操作相关性,避免背景干扰。
输出与推理
推理阶段仅使用去噪后的潜在状态和动作块,不再生成未来视频帧,因此推理延迟显著低于 Joint-WAM(低 42.9%),同时保留未来意图信息,优于纯 Fast-WAM 的泛化表现。
与同类方法的差异点
LAWA 用离散潜在动作取代未来视频生成作为意图载体,在性能、泛化和延迟之间取得平衡,不同于 Fast-WAM 丢弃未来想象或 Joint-WAM 保留昂贵视频分支。
实验
实验设计
在 RoboCasa 与 LIBERO-Plus 两个仿真基准上评估,覆盖 few-shot 与 full data 两种数据规模;并在真实世界任务上验证。对比基线包括 Fast-WAM(丢弃未来分支)与 Joint-WAM(保留未来视频分支)。指标为平均成功率与推理延迟。
关键发现
- RoboCasa few-shot: LAWA 成功率 65.6%,较 Fast-WAM 提升 +9.6 points;
- RoboCasa full data: 成功率 80.8%,提升 +4.5 points;
- 推理延迟: 相比 Joint-WAM 降低 42.9%,同时保持同等成功率水平;
- LIBERO-Plus 零样本迁移表现 competitive,真实世界任务 superior。
未来想象无需被丢弃:以紧凑潜在动作表示未来意图,即可在性能、泛化与延迟之间取得有效折中。
基线对比解读
Fast-WAM 在数据稀缺与 OOD 场景下泛化明显弱于未来感知方法,说明完全去掉未来建模会损失对动态环境的预测能力。LAWA 通过离散 tokenizer 产生的 manipulation-centric codebook 目标,将连续潜在状态锚定到未来意图,联合去噪执行动作块,但在推理时省略未来视频分支。这一设计保留了未来想象的信息增益,同时规避了观测生成的高延迟。对比 Joint-WAM, LAWA 在性能上持平,但在延迟上大幅优化,验证了“潜在动作即意图”的架构假设:未来信息应被压缩为可操作的隐式表示,而非原始观测。
行业影响
落地场景
LAWA 针对世界动作模型 (WAM) 的推理延迟问题,提供高效未来想象。适合需要实时机器人操作的产品:电商仓储的机器人拣选与分拣、家庭服务机器人、医疗手术辅助、工业自动化装配等。在少样本和全量数据训练下,LAWA 提升成功率与泛化,适合快速部署到新任务。
商业价值
降本:减少对大量演示数据的依赖(few-shot 提升 9.6 点),降低数据采集成本;推理延迟降低 42.9%,可降低硬件算力要求或提升吞吐。增收/体验:更高成功率和 OOD 鲁棒性提升机器人可靠性,减少人工干预,在电商订单履约、物流等场景可提升订单处理速度和准确性,直接增加营收;同时低延迟改善交互体验。
与现有产品/工作流的接口
LAWA 可作为现有机器人控制 stack 中的世界模型模块替换或增强。其离散 tokenizer 和 action-free 预训练权重可发布,供团队微调。与现有模仿学习、强化学习框架兼容,输出可执行动作块,便于集成到 ROS 2 等机器人中间件。训练时保留未来视频分支以提供监督,推理时裁剪,适合边缘部署。代码和模型发布后,可直接作为 baseline 集成到现有训练流水线,通过 HuggingFace 等共享权重。
具体 use case:在电商订单履约中心的机械臂拣选场景中,LAWA 可减少因视觉生成延迟导致的抓取等待,同时保持对新物品的泛化,降低对海量演示视频的依赖。另一个场景是家庭服务机器人的操作任务,LAWA 的 latent action 设计可在有限计算资源下实现实时未来想象,提升复杂家居环境中的操作成功率。
局限
- 方法依赖大规模无动作的自我中心视频预训练以获得有效的离散 tokenizer。尽管论文展示了预训练可扩展性,但此类视频数据的采集与清洗成本较高,且预训练目标与下游操作任务之间可能存在分布偏移。此外,离散 codebook 的大小和训练稳定性会直接影响潜在动作的表达能力,需要额外调参,这在实际工程部署中增加了复杂度和不确定性。
- 潜在动作的语义可解释性有限。LAWA 通过离散 tokenizer 产生 codebook targets,但学习到的潜在动作与高层任务意图之间的对齐并不直观,缺乏可读的语义标签。这给模型调试和人类理解决策过程带来困难,尤其在安全敏感的机器人应用中,可解释性不足可能阻碍其实际采用。与 end-to-end 动作回归方法相比,潜在动作的抽象层级更高,但透明性有所降低。
- 实验主要在仿真 benchmark(RoboCasa、LIBERO-Plus)和少量真实世界任务上验证,尚未覆盖更复杂、长时序、多阶段操作任务,或不同机器人平台及传感器配置。与 Fast-WAM 的延迟优势仅来自推理时省略未来视频分支,但训练阶段引入的联合去噪和多模态注意力会增加计算开销,导致整体开发成本上升。此外,在 OOD 场景下的鲁棒性虽优于 Fast-WAM,但仍受限于离散 tokenizer 的泛化边界,极端环境变化下的表现未知。