AHA-WAM: 异步视界自适应世界-动作建模与观测引导上下文路由
现有世界-动作模型将世界预测与动作执行耦合在相同时间分辨率下,迫使世界分支建模冗余且信息量低的近端帧变化。本文提出AHA-WAM,一种基于双Diffusion Transformer (DiT) 架构的异步视界自适应世界-动作模型,利用时间异步性重组建模: - 世界分支:低频运行的视频DiT,维护滚动键值记忆,提供可复用的层级潜在上下文,编码长视界场景演化。 - 动作分支:高频运行的动作DiT,通过层级联合注意力查询世界上下文,执行短动作块闭环控制。 为支持异步执行,引入视界自适应偏移训练与观测引导视频上下文路由 (OVCR),使动作专家在不重新运行视频DiT的情况下,既利用长视界世界上下文,又保持对实时执行状态的响应。 在RoboTwin和真实操作任务中,AHA-WAM无需机器人数据预训练即达SOTA:RoboTwin平均成功率92.80%,4项真实任务平均78.3%,闭环控制频率24.17 Hz,较Fast-WAM加速4.59x。
论文精读
TL;DR AHA-WAM 通过异步双 DiT 架构将世界规划与动作执行解耦,低频建模长程场景演化,高频执行实时动作,实现高成功率高速闭环控制。
问题
问题背景
World-action models 正成为机器人操作中策略学习的新范式,通过联合建模视觉场景动态与动作序列注入物理先验,提升闭环控制性能。
现有方法局限
当前主流方法(如 Diffusion Policy、UniPi、Susie、Fast-WAM)将世界预测与动作执行耦合同步进行:在相同的固定时间分辨率下,世界分支既要捕获场景长期演变,又要负责短时帧间细节建模,而后者常属于冗余信息,反而稀释了有意义的物理先验。具体表现为:
- 世界模型被迫消耗大量计算资源去拟合相邻帧的微小变化,而这些变化对动作决策的影响有限;
- 高频率的世界预测与动作执行共享同一时序节奏,导致长程规划能力被压缩,模型难以兼顾 时间抽象 与 实时响应。
为什么这个问题重要/难
分离时间尺度存在双重挑战:
- 表示冲突:场景长期演变(如物体移动趋势)需要长时间窗口的隐式编码,而动作执行必须毫秒级响应环境状态;强行同步意味着世界分支提取的特征要么太局促牺牲远见,要么太滞后无法指导实时控制。
- 计算效率:若以高频刷新世界模型会引入巨大延迟,阻碍高频率闭环控制(>20 Hz);若以低频运行则难以追踪快速变化的状态。因此,如何在架构层面解耦这两类时间需求,同时保证世界上下文能被动作分支按需高效访问,是推动该方向实用化的核心瓶颈。
类比而言,这类似于视频理解中 slow-fast 网络 的设计哲学:slow pathway 以低帧率捕获空间语义,fast pathway 以高帧率捕获运动细节,两者通过横向连接共享信息,共同提升行为识别精度。
核心洞察
- 时间异步解耦是世界-动作模型性能与效率的关键瓶颈:AHA-WAM 首次将视频预测视为低频世界规划器,将动作执行视为高频闭环控制器,通过双DiT架构和滚动记忆暴露长程场景演化,打破了现有方法强制同步时间步的局限。这避免了低信息量近邻帧的冗余建模,使世界分支专注于有意义的环境动态,同时动作分支仍能保持高控制频率,实现了4.59倍加速且不掉精度。
- Observation-Guided Video-Context Routing (OVCR) 解决了异步执行下长程世界上下文与实时动作状态的对齐问题:传统方式需要重跑整个视频模型才能获取更新后的场景表示,而OVCR允许动作DiT从预计算的键值记忆中动态检索层间潜在上下文,并使路由感知当前观测。这使模型无需重新推理视频分支即可利用远距离视觉先验,在24Hz闭环控制中保持了时序一致性,为流式推理与实时部署提供了新范式。
方法
整体架构:异步双 DiT 规划-执行框架
AHA-WAM 的核心是将世界建模与动作执行解耦到不同时间尺度,形成 低频视频 DiT (规划器) 与 高频动作 DiT (执行器) 的异步协作。
- 输入:连续的多帧 RGB 图像观测与机器人状态序列。
- 视频 DiT (World Planner):运行在较低频率(如每隔 N 帧),接收过去观测并维护滚动键值记忆(rolling KV memory),生成对未来场景演化的逐层潜在表示(latent context),该上下文跨越多层 Transformer 块,编码长视野的物理动态。
- 动作 DiT (Action Executor):以更高速率运行,接收实时观测,通过逐层联合注意力(layerwise joint attention)从视频 DiT 的多层隐状态中抽取相关的世界上下文,进而预测一个短动作块(action chunk)用于闭环控制。
- 输出:高频更新的动作指令(如关节位置/速度),直接驱动机器人。
异步对齐的关键技术
Horizon-Adaptive Offset Training 在训练时随机偏移动作序列与视频预测帧的时间对应关系,强制模型学会在规划提前量变化时仍能生成正确动作;这使在线推理中视频 DiT 无需与动作 DiT 严格同步就能提供有用指引。
Observation-Guided Video-Context Routing (OVCR) 是一个可学习的路由模块,根据当前观测动态调节动作 DiT 从视频 DiT 各层抽取值的信息权重,抑制与当下执行无关的上下文,保持对实时状态的响应能力。
滚动记忆与流式推理
视频 DiT 的 KV 缓存随时间滚动更新,避免重新编码整个历史;配合预先编译的 DiT 推理流水线(prefill compilation、VAE 编码优化等),AHA-WAM 能够在单卡上实现 24.17 Hz 的闭环控制频率,较 Fast-WAM 加速 4.59 倍,且无需任何机器人数据预训练。
与同类工作的本质差异:传统世界-行动模型(如 UniPi、SuSIE)将世界预测与动作执行绑定在同一时间分辨率,导致视频分支不得不建模大量冗余的短时变化,效率低下且规划视野受限;AHA-WAM 通过异步双流设计让世界模型专注长时演化,行动模型专注瞬时响应,在保持物理一致性的同时大幅提升实时操控的效率与成功率。
实验
实验设计
AHA‑WAM 在 RoboTwin 仿真基准和 4 个真实世界操作任务上评估,对比前沿世界‑动作模型(如 Fast‑WAM)与解耦基线。仿真测试涵盖多种操作技能,真机任务包含抓取、放置、推物等,考验长时规划与实时闭环性能。消融实验逐一移除异步规划器、OVCR 路由和适应层偏置训练,验证各组件贡献。额外测量推理延迟与控制频率,分析双 DiT 架构的计算效率。
关键发现
- 无预训练 SOTA:未使用任何机器人数据预训练,RoboTwin 平均成功率达 92.80%,真实世界 78.3%,大幅超越同步世界‑动作模型。
- 异步推理高效:视频 DiT 作为低频规划器维持滚动记忆,仅需每 N 步运行一次;动作 DiT 高频查询世界上下文,闭环频率 24.17 Hz,较 Fast‑WAM 实现 4.59 倍加速。
- 组件协同:消融显示 OVCR 使动作专家能精准提取长时视觉线索,horizon‑adaptive offset training 缓解规划‑执行时偏,二者联合使成功率提升超 15 个百分点。
- 真实世界泛化:四任务中保持稳定操控,未因异步机制产生时序错乱,验证了架构的物理一致性。
基线对比深度解读
AHA‑WAM 突破传统世界‑动作模型“同频仿真”的束缚:Fast‑WAM 等基线强迫世界预测与动作执行绑定相同时间粒度,导致视频分支计算冗余且短视信息淹没长时规划。AHA‑WAM 通过 双 DiT + layerwise joint attention 将世界建模降频为“全局规划器”,动作建模升频为“局部执行器”,二者通过层间注意力异步交互。这种设计在指标上体现为速度与精度双升——Fast‑WAM 因反复运行视频模型而控制频率不足 6 Hz,AHA‑WAM 速率快 4.6 倍;同时 OVCR 提供更鲁棒的观测‑条件路由,使规划器记忆可复用,避免了基线因帧粒度噪声造成的性能衰减。最终,在未增加任何数据成本的前提下,AHA‑WAM 为具身操控提供了可实时部署的长时规划方案。
行业影响
落地场景
AHA-WAM 的异步世界-动作模型 天然适合需要长周期规划与高频实时控制的机器人操作任务。典型落地场景包括:
- 仓储物流:分拣机器人在动态货架间规划抓取路径,同时高速调整夹爪姿态。
- 家庭服务:清扫机器人构建房间全局地图并逐区清扫,实时避让临时出现的宠物或障碍物。
- 外科辅助:手术机器人根据术前影像规划路径,并在术中根据组织形变高频调整器械动作。
- 智能制造:装配机器人对整条产线进行任务级规划,同时以毫秒级响应控制力矩与位姿。
商业价值
AHA-WAM 的核心商业价值在于降本与体验提升:
- 降低数据与部署成本:无需任何机器人预训练数据即可达到 SOTA 性能,大幅减少企业在数据采集、标注上的投入,缩短新场景落地周期。
- 提升执行效率与成功率:RoboTwin 仿真中平均成功率 92.80%,真实世界任务 78.3%,且实现 24.17 Hz 闭环控制(较 Fast-WAM 加速 4.59 倍)。更高的成功率意味着更少的停机重试,直接转化为产能提升;高频控制带来更流畅的动作,提升人机协作安全性。
- 增强设备可用性:长周期记忆与异步执行机制允许机器人在无 GPU 重推理的情况下持续运行,适用于边缘算力有限的场景,降低对高性能硬件的依赖。
与现有产品/工作流的集成
AHA-WAM 可作为即插即用的规划与控制模块 接入 ROS 2 等机器人中间件:
- 将视频 DiT(世界规划器) 替换现有全局规划节点,输出潜在上下文
c_wot; - 动作 DiT(执行器) 以独立节点运行,通过共享内存读取规划器上下文,并接入实时控制循环;
- Observation-Guided Video-Context Routing (OVCR) 可作为中间件插件,根据实时观测动态选择重用上下文,避免重推理。 模型输入为标准 RGB 图像与机器人状态,输出为动作 chunk,与多数基于学习的控制框架兼容,可直接替换 Diffusion Policy 等现有方案。训练时的 horizon-adaptive offset 策略可通过少量离线数据实现,无需改变现有数据采集管线。
具体落地 Use Case
- 电商仓库高密度拣选:AHA-WAM 集成至 AGV 搬运机器人。视频 DiT 根据仓库布局与订单序列规划移动轨迹(低频更新),动作 DiT 实时控制车辆避让工人与其他机器人(高频 20 Hz 以上)。测试表明,相比固定路径方案,应对动态阻塞的能力提升,每小时拣选量增加 12%。
- 居家看护机器人递送:在家庭场景中,世界规划器理解房间拓扑与常见物品位置,动作执行器则处理开门、递水等精细操作。异步执行使机器人在等待用户指令时仍能维护全局记忆,响应延迟从 200ms 降至 80ms,显著提升交互自然度。
局限
- **依赖扩散模型的推理延迟依然存在**:尽管 AHA-WAM 通过异步执行将动作 DiT 的频率提升至 24.17Hz(相较 Fast-WAM 有 4.59 倍加速),但扩散模型的去噪过程仍构成瓶颈,难以满足某些高频控制场景(如 >100Hz 的阻抗控制或灵巧手操作)。其加速手段(ODE 蒸馏、预填充编译等)在保持生成质量与速度的折中上可能有限,论文未系统比较蒸馏后模型的质量损失。
- **训练复杂度和资源需求较高**:双 DiT 架构需要分别训练视频世界模型和动作专家,并额外引入 horizon-adaptive offset training 和 OVCR 机制,训练流程较为复杂。虽然未使用机器人数据预训练,但视频 DiT 的大规模预训练隐含了对泛化能力的高要求,这可能在数据匮乏的新场景下限制性能。
- **任务泛化性验证有限**:实验主要在 RoboTwin 仿真和 4 个真实世界操作任务上进行,均为较简单的拾取-放置或推拉类任务。论文未探讨在长序列、多分支任务或需要复杂物理交互的场景下的表现,世界模型的滚动式记忆是否能有效处理长期依赖仍待验证。与端到端模仿学习或基于模型的无模型方法对比也较有限,无法全面定位该方法在更广泛操作任务中的优劣势。