基于渐进式视觉规划的 World Action Modeling
World action models (WAMs) 通过从初始观测与指令中联合预测未来视觉动态与动作,已成为机器人控制领域一种颇具前景的范式。然而,现有 WAMs 难以应对长时程预测,因为生成密集视频 rollout 的效率极低。近期一些 WAMs 通过只预测单张未来帧、不生成完整视频来规避该问题,但这一做法忽略了如何逐步向目标推进。 我们提出 ProWAM,一种渐进式世界动作模型,能够联合预测动作与有序的稀疏视觉子目标序列,为动作生成提供显式视觉引导,从而在任务执行全过程中形成锚点。该设计天然具备可扩展性:子目标预测可从大规模无动作视频中学习,使视频主干网络能够替动作策略分担复杂的视觉规划。为高效生成动作,ProWAM 仅执行一次视频主干前向传播以缓存稀疏子目标特征,从而免去迭代式全视频生成,重规划阶段只需轻量的动作去噪。 在大量评测中,ProWAM 展现出更优的分布外鲁棒性。在仿真基准上,它于 LIBERO-Plus(85.8%)与随机化 RoboTwin(75.7%)上刷新了 state-of-the-art,相对最强基线提升幅度最高达 +35.9%;在 RoboCasa365 上取得 48.1% 成功率,并在颇具挑战的 Composite-Unseen 划分上达到 18.2%,总排名第 4。 更为关键的是,在零样本真实世界实验中,ProWAM 在新场景下取得 70.0% 成功率,超越最强基线 +15.0(从 55.0% 提升至 70.0%,相对增益 +27.3%)。这些结果证明,进度索引的视觉前瞻对闭环控制具有重要价值。项目主页:https://sii-ferenas.github.io/ProWAM-page。
论文精读
TL;DR ProWAM 通过预测有序稀疏视觉子目标序列显式引导动作生成,仅需单次视频骨干前向即可缓存特征,避免密集视频生成,在多个基准和零样本真实世界任务中显著超越现有方法。
问题
问题背景
World Action Models(WAM)成为机器人操控的新范式,通过从初始观测和指令联合预测未来视觉动态与动作,试图将视觉预测与物理控制统一在生成式框架下。
现有方法局限
当前 WAM 在长时程任务中面临两难:
- 密集视频 rollout:需要逐帧生成完整未来视频,推理成本高、延迟大,难以用于实时闭环控制。
- 单帧目标预测:只预测一个未来帧,不生成中间帧,虽提高了效率,但完全忽略了到达目标的渐进过程,导致动作策略缺乏中间视觉锚点,容易在复杂环境中产生错误或偏离。
为什么这个问题难/重要
长时程操控要求模型在时间维度上同时解决视觉规划(往哪走)与动作生成(怎么走)两个耦合问题。如果视觉骨干承担全部规划负担,会迫使动作策略依赖极稀疏的终态信息,难以应对分布外场景。
此外,机器人数据稀缺,但人类或互联网上有大量无动作视频,如何将这些视频中蕴含的渐进式任务知识迁移到动作模型,是通用机器人模型规模化训练的关键挑战。业界对能在真实世界零样本泛化的 WAM 有强烈需求。
行业类比
类似视频生成模型中用潜空间关键帧规划替代逐像素生成,用稀疏子目标序列降低长序列推理成本。
核心洞察
- 把视觉规划压缩为稀疏子目标序列,而非单帧或密集视频,是过程引导与效率的关键折中。现有 WAM 要么生成密集视频 rollout 导致低效,要么预测单一未来帧忽略中间步骤;ProWAM 引入有序的稀疏视觉子目标,在动作生成时提供显式视觉锚点,同时避免高成本视频生成。这个中间表示使长程任务的视觉规划可学习,且与动作策略解耦,允许从大规模无动作视频中预训练子目标预测,减轻策略学习负担。
- 单次视频骨干前向 + 子目标特征缓存,实现重规划时零额外视频生成,大幅降低实时控制算力。ProWAM 推理时只执行一次视频骨干前向,将稀疏子目标特征缓存,后续动作去噪仅需轻量计算,无需迭代生成全视频。相比需要每步重新生成未来视觉的 WAM,该方法将视觉推理与动作采样分离,更适合闭环高频控制;在 LIBERO-Plus 和 RoboTwin 上取得 SOTA,验证了缓存中间表示对实时性的重要性。
- 视频生成知识迁移到动作预测:子目标规划可完全从无动作视频中预训练,动作策略参数更少、泛化更好。ProWAM 的视频骨干通过 action-free 视频学习子目标预测,从而卸载复杂视觉规划,动作策略仅需学习从子目标特征到动作的映射,降低了策略对任务特定视觉细节的依赖,提升 OOD 鲁棒性;在 RoboCasa365 和真实世界零样本中展现出更强泛化,表明分解视觉规划与动作执行是有效的架构模式。
方法
输入与总体框架
ProWAM 接收初始观察(图像或视觉 token)与语言指令,目标是在长时程任务中输出动作序列和有序稀疏视觉子目标序列。整体采用渐进式视觉规划:先由视频 backbone 生成子目标序列作为显式视觉引导,再基于这些子目标特征生成动作。
关键模块与流程
- 视觉子目标预测:利用预训练于大规模无动作视频的视频 backbone,从初始观察和指令中预测一组进度索引的子目标帧(sparse sub-goals),而非密集视频帧。子目标序列编码了任务的关键中间状态。
- 进度条件调制:动作策略在生成每个动作时,以对应的子目标特征作为条件信息,通过 progress-conditioned modulation 将视觉规划注入动作解码过程,使动作与阶段性目标对齐。
- 训练目标:联合优化子目标预测和动作预测,由于子目标学习可以利用无动作视频数据,视频 backbone 可从海量视觉数据中获取规划能力,减轻动作策略的学习负担。
- 高效推理:推理时对视频 backbone 做单次前向传播,缓存所有子目标特征;重规划时只需运行轻量级动作去噪模块,避免反复生成完整视频,显著降低计算开销。
输出与差异点
最终输出动作序列与子目标序列,用于闭环控制。与已有的仅预测单一未来帧的 WAM 相比,ProWAM 提供逐步可执行的视觉锚点,明确“如何逐步接近目标”;与生成密集视频 rollout 的方法相比,它通过稀疏子目标大幅提升效率。
实验
实验设计
ProWAM 在三个仿真基准与零样本真实场景进行评估:LIBERO-Plus、randomized RoboTwin、RoboCasa365(含 Composite-Unseen 难分割),以及新场景的真实机器人实验。模型采用渐进式稀疏视觉子目标,训练目标包含 action denoising 与 sub-goal prediction,推理时单次视频主干前向缓存子目标特征,重规划仅需轻量动作去噪。这考察了长程任务、域随机化、组合未见任务与 sim-to-real 泛化。
关键发现
- LIBERO-Plus 成功率 85.8%,randomized RoboTwin 75.7%,相对最强基线提升最高 +35.9%(相对)。
- RoboCasa365 总体成功率 48.1%,在最具挑战的 Composite-Unseen 分割上 18.2%,总排名第4。
- 零样本真实世界成功率达 70.0%,较最强基线提升 +15.0 个百分点(相对 +27.3%)。
结果证明显式渐进视觉引导能有效锚定动作生成,提升 OOD 鲁棒性。
与基线的深度对比
现有 WAM 分为两类:稠密视频 rollout 推理低效;单帧目标忽略中间过程。ProWAM 通过稀疏子目标序列 将视觉规划迁移到视频主干,动作策略只需关注短期控制,实现了效率与目标导向的平衡。真实世界 +27.3% 的相对提升远超仿真基准,表明该设计对视觉分布偏移更鲁棒。RoboCasa365 排名第4(非第一)提示在复杂组合任务上仍有差距,可能需要更强的视频先验或更长规划视野。
行业影响
落地场景
ProWAM 主要面向长时程机器人操作任务,适合需要多步视觉推理与闭环控制的场景:
- 仓储/电商订单拣选:从货架取物、装箱、贴标等多步操作,可利用视频子目标序列强化路径规划。
- 服务机器人:家庭清洁、物品整理等需要理解空间顺序的任务,ProWAM 的稀疏子目标可减少中间视频生成开销。
- 工业装配/质检:流水线中的精密操作与异常恢复,零样本泛化能力有助于应对新工位或新零件类型。
商业价值
ProWAM 的核心价值在于效率与泛化的平衡:
- 降本:单次视频主干前向即可缓存子目标特征,后续仅需轻量动作去噪,避免逐帧生成视频的巨大算力消耗,降低了机器人部署时的推理成本。
- 增效:在 LIBERO-Plus 上达到 85.8%,随机化 RoboTwin 上 75.7%,零样本真实场景 70.0%,成功率提升直接减少人工干预与重试。
- 体验提升:显式视觉子目标为操作过程提供了可解释的中间状态,便于远程监控与故障分析。
与现有产品/工作流的接口
ProWAM 可作为 策略模块 嵌入现有机器人软件栈,与感知、规划、控制层解耦:
- 视频预训练基础:子目标预测可从大规模无动作视频中预训练,适合已有视频数据资产的企业进行迁移。
- 模块化替换:将现有 VLA 或 WAM 策略替换为 ProWAM 头部,保留原视觉编码器与动作解码器,仅增加子目标调制分支。
- 实时系统集成:缓存子目标特征后,高频重规划只需执行轻量扩散去噪,可接入 ROS 2 等实时控制框架。
具体落地 Use Case
- 电商仓储机器人:处理“从混合料箱中按订单拣选三件不同商品并打包”任务。ProWAM 先预测子目标(定位商品 A→抓取→定位商品 B→…),再在每个子目标间输出连续动作,显著提高长任务成功率,减少对人工补拣的依赖。
- 医疗康复辅助机器人:帮助患者完成“拿水杯→递到嘴边→放回”等多步动作。子目标序列可结合治疗师预设的关键姿态,提升动作连贯性与安全性。
局限
- 子目标预测依赖大规模 action-free 视频,此类数据可能无法覆盖需要精确接触与力控的细微操作(如旋钮、插拔),导致预测的子目标在物理上不合理或缺乏可执行性。论文未讨论子目标预测错误或执行偏离时的在线修正机制,一旦缓存特征后仅做动作去噪,对实时环境突变(如物体被移动、新障碍出现)的重规划能力可能不足。
- ProWAM 的推理效率来自单次视频 backbone 前向并缓存稀疏子目标特征,但这也固化了子目标序列,动作策略无法根据执行过程中的实际状态动态调整后续子目标。对于需要频繁重规划或目标在线变更的任务,该设计可能牺牲灵活性。子目标数量与时间间隔是超参数,论文未提供自动选取策略,不同任务时长和复杂度下可能需要大量调参。
- 实验方面,真实世界评测报告 70.0% 成功率,但未展示高度动态场景、多物体交互或长期任务表现;RoboCasa365 的 Composite-Unseen 仅为 18.2%,离实际部署仍有距离。尽管强调 zero-shot,但真实场景数量和变化有限,sim-to-real 差距分析不足。此外,未与基于模型预测控制或闭环重规划的方法进行对比,难以证明缓存机制的独特优势。