论文

DeltaWAM: 面向双臂操作的 Delta World Action Models

DeltaWAM: 面向双臂操作的 Delta World Action Models

World-action models(WAMs) 通过联合建模视觉动态与动作,将预训练视频生成器中的视觉与运动先验迁移到机器人控制。然而现有 WAM 在训练时需要预测密集的未来帧,反复建模大部分未变化的内容,并让动作条件动态与无关的外观变化耦合;推理时又需用沉重的视频专家处理每个完整观测,成为少步动作生成的瓶颈。 为此,我们提出 DeltaWAM,它通过 dense-anchor、sparse-delta 与 action 三条流联合预测视觉增量与动作,并给出三种在表征与计算共享方式上不同的架构。我们进一步设计了 Streaming Delta Memory(SDM),用紧凑的观测增量更新缓存的 anchor 上下文,从而减少沉重的视频专家处理。 在 RoboTwin 上,带 SDM 的 DeltaWAM 相比 Fast-WAM 将平均成功率从 81.3% 提升至 85.4%(clean 设置),在视觉随机化下从 75.8% 提升至 83.9%。三种架构使训练 FLOPs 降低 17.78-23.77%;SDM 使单步推理延迟与 FLOPs 分别降低 36.57% 与 31.55%。真实世界评测中,该策略在所评估方法里取得了最高的总体成功率与归一化进度。代码:https://github.com/AIGeeksGroup/DeltaWAM,网站:https://aigeeksgroup.github.io/DeltaWAM。

论文精读

TL;DR DeltaWAM 用视觉差值预测代替稠密帧生成,结合流式记忆更新缓存,在双手操作中将成功率提升至 85.4%,同时降低训练与推理计算。

问题

问题背景

机器人操作领域正通过世界-动作模型(WAMs)联合建模视觉动态与动作,从预训练视频生成模型迁移视觉和运动先验,以提升操控策略的泛化能力。

现有方法局限

现有 WAMs 在训练时预测密集未来帧,重复建模场景中大量未变化内容,造成显著计算冗余。同时,动作条件动态与外观扰动(如光照、纹理变化)耦合,迫使模型学习无关变化,降低学习效率。推理阶段,每一步需用重型视频专家处理完整观测,形成低延迟动作生成的瓶颈。作者指出,这些缺陷导致模型难以同时保持精度与实时性。

为什么这个问题难/重要

挑战在于如何在保留视频先验带来的视觉动态理解的同时,减少冗余计算并解耦动作动态与外观外观。对于双手操控等高维动作空间任务,推理延迟直接关系到部署可行性;业界对轻量、低延迟的机器人策略模型需求强烈。因此,改进 WAM 的计算效率与动态建模解耦能力,兼具学术与工程价值。

行业类比

这类似于视频压缩中采用关键帧加残差编码,只传输变化区域而跳过未变背景,从而大幅降低带宽和计算开销。

核心洞察

  • 用视觉 delta 替代密集未来帧预测,将动作条件与场景稳定内容解耦。现有 WAM 在训练时生成完整未来帧,反复建模大量不变背景,同时将动作相关的动态变化与光照、纹理等表象变化纠缠在一起。DeltaWAM 只预测稀疏的视觉变化区域,不仅减少了冗余计算,还让动作学习更专注于真实的对象交互和状态变化。这一设计直接带来视觉随机化下成功率从 75.8% 到 83.9% 的提升,验证了 delta 表示在视觉泛化上的优势。
  • Streaming Delta Memory (SDM) 将重型视频专家从每步推理中解放,实现基于缓存的流式动作生成。Fast-WAM 虽然避免了逐帧生成,但推理时仍需对每一帧完整观测调用重量级视频编码器,成为延迟瓶颈。SDM 维护一个 anchor 上下文缓存,仅用紧凑的观测 delta 更新,大幅减少重型编码器的调用次数。结果显示一步推理延迟和 FLOPs 分别降低 36.57% 和 31.55%,同时保持成功率提升,为实时操控提供了可落地的工程路径。
  • 多流架构在视觉 token 表示与计算共享上的灵活设计,提供了训练与推理效率的权衡空间。DeltaWAM 的三种架构变体在 dense-anchor、sparse-delta 和 action 流之间采用不同的共享策略,允许根据任务需求在参数效率、表示容量和计算成本之间取舍。训练 FLOPs 减少 17.78–23.77%,证明并非所有视觉信息需要同等强度的处理。这种模块化共享思路为其他视频生成模型迁移到机器人控制提供了可复用的架构设计范式。

方法

输入为双机械臂操作场景的视觉观测(RGB 图像)与历史动作序列,输出为动作预测和视觉增量预测,用于实时控制。

DeltaWAM 的核心由三个并行流组成:dense-anchor stream、sparse-delta stream 和 action stream。dense-anchor 流以较低频率维护全局场景上下文(锚点帧),sparse-delta 流仅预测相邻帧间的稀疏视觉变化(delta),action 流则直接输出动作。三个流共享视觉 Transformer 主干,但存在三种架构变体,差异在于每层特征共享方式和计算分配,以在精度与效率间权衡。训练目标联合优化视觉增量重建和动作预测,避免逐帧重建稠密未来帧带来的冗余计算和对无关外观变化的耦合。

Streaming Delta Memory (SDM) 在推理时维护一个缓存锚点上下文,每次仅计算当前观测的稀疏增量,将其压缩后更新缓存,无需对完整历史帧重新运行重型视频专家。训练阶段采用因果记忆增强策略模拟流式更新过程,保证推理一致性。

与 Fast-WAM 等现有 WAM 相比,DeltaWAM 首次将视觉预测对象从稠密未来帧改为增量表示,并引入流式缓存机制,显式分离动作流与视觉流,从而大幅降低训练 FLOPs 和推理延迟,同时提升操作成功率。

实验

实验设计

  • 使用 RoboTwin 基准,评估 bimanual manipulation 任务;比较 DeltaWAM 与 Fast-WAM 基线。
  • 两种评测设置:clean 和 visual randomization(视觉扰动);另加 real-world 实验。
  • 消融研究分析三种架构变体(dense-anchor、sparse-delta、action streams 的不同共享方式)与 Streaming Delta Memory (SDM) 的影响。

关键发现

  • DeltaWAM + SDM 在 clean 设置下平均成功率从 Fast-WAM 的 81.3% 提升到 85.4%;在 visual randomization 下从 75.8% 提升到 83.9%,对视觉扰动更鲁棒。
  • 三种架构训练 FLOPs 降低 17.78–23.77%;SDM 使单步推理延迟降低 36.57%、FLOPs 降低 31.55%。
  • 真实世界评估显示最高总体成功率和归一化进展。

与基线对比解读

  • 相比 Fast-WAM 逐帧预测稠密未来帧,DeltaWAM 的 delta 表示 只建模视觉变化,避免重复建模不变内容,并解耦动作条件动力学与外观变化。
  • SDM 缓存 anchor 上下文并仅用压缩 delta 更新,将重型 video expert 从每次完整推理中解放,实现推理加速。
  • 视觉随机化下的提升更明显(+8.1% vs +4.1%),说明 delta 建模对无关外观变化具有更强鲁棒性,适合真实场景部署。

行业影响

落地场景

DeltaWAM 面向 双手操控机器人,适用于需要实时视觉伺服与复杂接触操作的场景。典型如 电商仓储 中的双臂拣选与打包:机器人需快速识别物品姿态变化,动作生成延迟直接决定吞吐量。例如双臂从料箱中抓取透明包装物品,视觉干扰多,DeltaWAM 的 visual randomization 鲁棒性(成功率 83.9% vs 75.8%)能保证稳定运行。另外 实验室自动化 中的双臂移液、开盖等操作,以及 医疗辅助机器人 的精细操作,均可受益于低延迟世界模型。

商业价值

核心是 降本增效:通过预测视觉增量而非完整帧,减少重复计算,训练 FLOPs 降低 17.78–23.77%,推理延迟和 FLOPs 分别降低 36.57% 和 31.55%。这意味着同样硬件可支持更多并发机器人任务,降低云端推理成本;同时更快的控制回路提升操作成功率(RoboTwin 上平均成功率从 81.3% 提升到 85.4%),减少错误重试带来的物料和时间损耗。

与现有工作流集成

DeltaWAM 可作为 动作生成模块 嵌入现有机器人控制栈:上游接视觉编码器或原始图像流,下游输出关节空间动作。Streaming Delta Memory 天然适配流式推理框架,可与 ROS 2 的 topic 机制结合,将稀疏 delta 作为轻量消息更新缓存,避免每步重推视频 expert。部署时可采用 混合推理:高频控制用 delta 流,低频 anchor 刷新用大模型,平衡精度与算力。

局限

  • - 该方法在 **RoboTwin** 和自建真实世界任务上验证,任务集中于**双臂操作**(bimanual manipulation),未在更通用的操作基准(如 **LIBERO**、**RLBench** 或单臂抓取等)上系统性评估,泛化能力有待进一步验证。同时,对比方法主要聚焦于 **Fast-WAM** 及少数基线,缺少与近期其他 WAM 变体或主流模仿学习方法的全面比较,难以确立绝对优势。
  • - **Streaming Delta Memory (SDM)** 依赖 delta 表示的稀疏性与准确性,当场景发生大幅变化(如物体大位移、严重遮挡、新物体进入)时,增量更新可能累积误差或丢失长期视觉上下文,导致策略退化。论文未提供针对这些极端情形的失败案例分析与恢复机制,实际部署中的鲁棒性仍需检验。
  • - 论文提出三种架构变体,但未给出清晰的选择准则或根据任务特性进行自动架构搜索,工程实践中如何根据硬件资源、场景动态性等选择合适架构存在不确定性。此外,方法仍建立在**预训练视频生成器**之上,初始训练和推理对 GPU 内存及算力要求较高,限制了在低资源环境中的直接应用。
论文Han Yan2026-09-23原文

相关内容