ImageWAM: 世界行动模型真的需要视频生成,还是只需要图像编辑?
世界行动模型(World Action Models, WAMs)通常依赖视频生成来连接视觉世界建模与机器人控制,但存在三个耦合限制:密集的多帧未来令牌导致推理成本高昂;全视频预测将模型容量浪费在与动作无关的时间与外观细节上;长时程未来想象可能引入误差,误导动作预测。这引出一个简单问题:世界行动模型真的需要视频生成吗? 我们提出 ImageWAM,一个简单的 WAM 框架,重新利用预训练的图像编辑模型进行机器人动作预测。与视频生成不同,图像编辑提供了更匹配的先验:只需建模目标帧的变换,聚焦于与动作相关的当前到目标视觉差异,并通过编辑预训练将任务指令 grounding 到局部视觉变化。实践中,ImageWAM 在推理时不解码目标帧,而是以图像编辑去噪产生的 KV 缓存 作为条件,输入到流匹配动作专家(flow-matching action expert),作为紧凑的世界-动作上下文。 ImageWAM 在多种模拟器和真实世界实验中,性能优于标准 VLA 基线和竞争性 WAM,且无需额外的策略预训练。同时,其计算量(FLOPs)降至视频基 WAM 的 1/6,延迟降至 1/4。注意力分析进一步表明,编辑缓存聚焦于任务相关变化区域,支持图像编辑作为基于视频的世界-动作建模的有效替代。
论文精读
TL;DR ImageWAM 质疑世界动作模型必须用视频生成的主流范式,改用图像编辑模型仅预测动作相关变化,以 1/6 计算量、1/4 延迟获得更优动作预测性能。
问题
问题背景
世界行动模型(World Action Models, WAMs)旨在通过视觉预测手段桥接感知与行动,为机器人控制提供可推广的未来状态表征。当前主流方法利用视频生成模型(如扩散 Transformer)从历史观测中采样多帧未来,再从中解码动作指令。
现有方法局限
视频生成驱动的 WAM 面临三重耦合瓶颈:
- 推理密度过高:解码多帧未来需处理密集的时空 token,FLOPs 与延迟随预测步长线性增长,难以满足实时控制需求。
- 表征容量浪费:模型被迫建模任务无关的纹理、光照等时序细节,稀释了对行动关键变化(如物体位移)的感知。
- 长时域误差累积:多步未来想象易引入幻觉或物理不一致,这些伪影会误导下游行动预测器做出错误决策。
为什么这个问题难/重要
技术挑战源自视觉生成与行动预测之间的根本性失配:视频预训练的大规模数据并未显式编码“行动导致变化”的因果先验,致使模型将大量计算投入静态背景复现。业界关注度持续提升,因为 WAM 是通往通用机器人操作体的关键路径,而算力效率是量产部署的硬约束。能否在保留世界理解能力的同时剥离冗余生成,直接决定模型能否从实验室进入真实场景。
行业类比
这类似于 NeRF 早期直接渲染整张高分辨率图像用于 SLAM,而后续工作发现只需隐式场景特征即可完成定位——ImageWAM 正是将视频生成压缩为针对性图像编辑先验,用更少算力获得更精准的行动上下文。
核心洞察
- **将图像编辑重新定位为机器人世界动作建模的先验能力,而非视频生成**。视频生成模型需要预测密集的未来多帧 token,导致高计算开销且容易引入与动作无关的时空细节,而图像编辑模型仅需建模当前帧到目标帧的变换,其预训练目标天然聚焦于任务指令驱动的局部视觉变化。这种先验与动作预测的核心需求高度对齐:只关心动作导致的状态差异,不关心全帧重建。相比现有视频 WAM,ImageWAM 在推理时甚至无需生成目标图像,直接利用编辑去噪过程的 KV 缓存作为紧凑上下文,极大降低了模型容量浪费,并在多个仿真与真实世界实验中以 1/6 计算量、1/4 延迟超越了标准 VLA 基线。
- **流匹配动作专家利用图像编辑的隐式变换表示(KV 缓存)进行动作预测,避免了解码未来帧的累积误差**。典型视频 WAM 通过生成未来视频再馈入策略网络,容易受长期预测误差的级联影响。ImageWAM 不生成显式帧,而是将编辑模型的多步去噪注意力缓存作为条件,输入到轻量的流匹配动作专家中,直接输出动作轨迹或目标姿态。这种设计使得世界建模和动作推理在表示层面紧密耦合,同时规避了昂贵且易出错的视频解码步骤。注意力分析证实,编辑缓存高亮了任务相关的变化区域,表明其内部特征已经隐式编码了动作语义,使动作专家能从更本质的视觉差异中学习,而非从像素级未来帧中抽取信息。这为机器人学习提供了一种更经济且鲁棒的世界动作建模范式。
方法
输入与任务设定
给定当前观测图像 I_t 和任务指令 T(如“打开抽屉”),ImageWAM 的目标是直接输出末端执行器动作 a_t,而不生成任何中间视频帧。
核心模块:图像编辑去噪的 KV 缓存
ImageWAM 基座为预训练图像编辑模型(如 OmniGen2、FLUX.2 或 Ovis-U1)。与传统图像编辑不同,模型在去噪过程中并不将隐空间表示解码为编辑后的目标图像,而是提取每层 Transformer 去噪步骤产生的键值对缓存(KV caches)。这些缓存封装了从当前帧到目标帧的变换语义,聚焦于动作相关的局部视觉差异,天然过滤了背景、纹理等无关细节。
动作预测:Flow-Matching 动作专家
以提取的 KV caches 为条件,引入一个轻量的 Flow-Matching 动作专家。该专家本质是一个连续归一化流模型,通过最小化 flow matching loss 来学习从标准高斯分布到动作分布的映射,使动作采样更稳定、多模态。推理时,只需输入 KV caches 并执行 ODE 求解,即可直接输出高精度动作,无需解码图像。
训练策略
训练阶段同时优化两个目标:
- 图像编辑目标:保持编辑模型对任务指令与视觉变化的理解能力,避免灾难性遗忘。
- 动作流匹配目标:让动作专家学会利用编辑去噪过程中的中间表示预测动作。 预训练编辑模型参数可冻结或微调,这使 ImageWAM 无需额外的策略预训练即可直接适配下游机器人任务。
与视频生成类 WAM 的差异
相比基于视频生成的 WAM,ImageWAM 将未来想象的负担从“生成密集多帧像素”降维为“利用紧凑 KV 缓存进行条件动作预测”,从根本上消除了伪影传播、算力浪费(FLOPs 降至 1/6,延迟降至 1/4)等固有缺陷,实现了更直接、高效的世界-动作建模。
实验
实验设计
ImageWAM 使用预训练图像编辑模型(如 OmniGen2、FLUX.2、Ovis‑U1)作为视觉‑动作骨干,在模拟器和真实世界机器人任务上与标准 VLA(视觉‑语言‑动作)基线及基于视频生成的 WAM 进行对比。评估覆盖多种操作场景,不依赖额外的策略预训练。
关键发现
- 计算效率大幅提升:通过复用扩散去噪过程的 KV cache 而非解码目标帧,ImageWAM 将 FLOPs 降至视频 WAM 的 1/6,推理延迟降至 1/4。
- 性能与成本平衡:在无需额外策略预训练的情况下,ImageWAM 超越匹配的竞争 WAM 和标准 VLA 基线,证明图像编辑先验足以替代视频生成。
- 注意力机制验证:编辑 cache 的注意力聚焦在与任务相关的视觉变化区域,而非全帧无关细节,这解释了为何图像编辑比完整视频生成更适合世界‑动作建模。
与基线的深度对比
传统基于视频生成的 WAM 需要处理密集的多帧未来 token,导致推理成本高、容易引入与动作无关的时序和外观误差。ImageWAM 仅建模当前→目标帧的变换,利用编辑预训练中的局部变化对齐,在保持任务指向性的同时,规避了长程视频预测的误差累积。与 VLA 相比,ImageWAM 不依赖语言‑动作对齐的额外预训练,从编辑 cache 中直接提取紧凑的世界‑动作上下文,使策略学习更高效。这从根本上挑战了“世界动作模型必须依赖视频生成”的假设,展示了以图像编辑为核心的全新范式。
行业影响
落地场景
ImageWAM 对实时性要求严苛的机器人任务有直接价值,尤其适合 仓储物流分拣、家庭服务机器人 与 自动驾驶仿真 等场景。凡是需要根据当前观测与指令预测动作,且动作后果能以单帧状态变化刻画的系统,都可复用该范式。
商业价值
- 降本:推理 FLOPs 降至视频类方法的 1/6,延迟为 1/4,允许在边缘端低功耗芯片上部署,硬件成本与能耗显著下降。
- 增收:更快的动作预测周期直接提升机器人吞吐量(如每小时拣选件数),并减少因长时视频生成误差导致的动作失败,降低返工与停机损失。
- 体验提升:低延迟响应改善人机协作自然度;注意力集中到任务相关变化区域,提高操作安全性与可解释性。
与现有产品 / 工作流的接口
ImageWAM 设计为可插拔的 世界动作模型,替换视频生成模块。其核心接口是:
- 输入观测图像与任务指令,输出动作(如末端位姿增量)。
- 中间产物是去噪过程中累积的 KV 缓存,可无缝馈入 流匹配动作专家(Flow-matching Action Expert),与扩散策略类框架天然兼容。
- 可直接加载现有图像编辑模型的预训练权重(如 FLUX.2、OmniGen2),无需大规模策略预训练,大幅降低领域适配成本。
实际用例
- 电商履约仓库:拣选机器人接收“抓取红色盒子”指令与当前货架图像,ImageWAM 通过编辑缓存直接预测抓取姿态,跳过未来帧解码,在 NVIDIA Jetson 等边缘设备上实现实时闭环控制。
- 自动驾驶仿真:在行为规划模块中,根据前车位置变化要求,ImageWAM 快速预测自车下一时刻的合理位姿,替代传统视频渲染+决策流水线,加速仿真迭代,并降低对 GPU 集群的依赖。
局限
- **对多步动态建模的局限性**:ImageWAM 仅通过单帧目标图像编辑捕捉动作后果,忽略了执行过程中的中间状态和时序动态。当任务需要连续操作(如旋转阀门、推动物体到指定路径)时,缺乏中间帧可能导致动作预测的上下文不足,难以精确控制力度或速度。视频生成模型虽然在计算上昂贵,但天然提供丰富的时序过程,而图像编辑模式在这方面存在结构性盲区。
- **对预训练编辑模型的依赖与域适应风险**:方法直接复用预训练图像编辑模型(如 OmniGen2、FLUX.2),这些模型主要在自然图像数据上训练,对机器人场景的视觉分布(如夹爪、特定背景)可能不适应。虽然 KV 缓存提供了一种紧凑表示,但底层特征提取仍受制于源域偏差,在极端光照、遮挡或非典型视角下可能失效,需要额外的微调或数据增强来保证鲁棒性。
- **任务复杂性和泛化边界尚不明确**:实验主要在桌面操作和简单抓取场景中进行,尚未在灵巧操作、长周期任务或动态物体交互(如移动目标、弹性形变)等更具挑战性的场景中验证。此外,与基于视频的 WAM 先进变体(如结合 3D 先验、层次化规划)的对比有限,可能高估了图像编辑范式的相对优势。