论文

超越未来预测:去噪作为机器人控制的生成式适配

超越未来预测:去噪作为机器人控制的生成式适配

预训练的生成式 Diffusion Transformers (DiTs) 通过大规模图像与视频生成训练,捕获了丰富的像素级视觉与语言条件结构。已有一系列机器人策略建立在这一生成先验之上,但如何把它迁移到控制仍不明确,现有方法通常借助未来视觉预测来完成这种迁移。我们提出一个更基本的问题:预训练的生成式 DiT 究竟为动作学习贡献了什么,这一先验又该如何适配控制? 为此我们提出 NowWAM,一种无需未来目标的协同训练框架:它对当前观测去噪,并从同一视觉流预测机器人动作,从而在整条去噪轨迹上把原生生成目标与面向动作的表征直接耦合。 在匹配的受控设置下,过去与未来的视觉目标表现相当,而把训练限制在干净的端点会显著降低鲁棒性,说明独立的未来目标并非生成式适配的必需,而去噪轨迹仍是控制的有效接口。在 LIBERO-Plus 上,NowWAM 搭配 FLUX2-Klein 达到 87.7%,较未来目标协同训练基线提升 6.1 个点,同时将训练视觉 token 减半(784 到 392),单步时间从 2.85 s 降至 1.63 s,实现 1.8x 加速。 在使用纯文本到图像的 Z-Image 主干时,NowWAM 进一步提升至 87.8%,表明强控制适配并不依赖视频生成或图像编辑主干。

论文精读

TL;DR NowWAM 证明机器人控制无需未来预测:对当前观测去噪并直接预测动作,在 LIBERO-Plus 上以更少 token 和更快速度达到 87.7%,超越未来目标协同训练基线。

问题

问题背景

当前机器人控制策略从预训练生成式 Diffusion Transformer (DiT) 迁移视觉与语言先验时,普遍采用生成-动作协同训练,即同时优化一个辅助的视觉生成目标和动作预测目标。这类方法通常以未来视觉预测作为辅助目标,期望生成任务能引导出对动作学习有益的表征。

现有方法局限

现有方法将未来帧生成作为协同训练的默认接口,但推理阶段常剥离该目标,导致训练与推理目标不一致;同时,未来预测要求模型额外输出视觉 token,增加计算与内存开销。已有工作虽尝试在推理时移除预测,却未系统回答:预训练 DiT 对动作学习的真正贡献是什么?未来视觉目标是否必要? 此外,仅使用干净图像特征训练动作头会损失去噪过程中的中间表征,而这些中间状态可能蕴含更丰富的控制相关信息。

为什么这个问题难/重要

该问题位于生成模型与具身智能的交叉点,难点在于:如何在不依赖未来帧的情况下,将原生生成目标(去噪)有效迁移到动作表征,同时保持鲁棒性和训练效率。业界关注度高,因为机器人数据稀缺、标注昂贵,若能直接利用大规模预训练 DiT 而无需视频生成或图像编辑骨干,将大幅降低策略训练门槛。本文 NowWAM 证明:仅对当前观测去噪并预测动作,即可达到与未来目标相当甚至更优的性能,且将视觉 token 减半、步时提速 1.8 倍。

行业类比

类似于 BERT 通过掩码语言模型自监督构建通用文本表征,NowWAM 表明:去噪轨迹本身即可作为机器人控制中生成先验迁移的有效接口,不依赖于显式的未来预测模块。

核心洞察

  • 去噪轨迹是比未来预测更本质的生成适应接口。现有方法普遍将未来视觉预测作为生成先验迁移到机器人控制的手段,但本研究通过受控实验表明,使用过去帧作为目标与未来帧性能相当,而仅使用干净端点(无噪声)会显著降低鲁棒性。这说明真正起作用的是从纯噪声到干净图像的去噪过程本身,它提供了丰富的中间表征,让动作学习与生成目标在连续状态上对齐,而不需要单独的时序预测任务。
  • 纯文本到图像生成模型足以支撑机器人控制适应,无需视频生成或图像编辑能力。许多工作倾向于使用视频扩散模型作为 backbone,认为时序建模对控制至关重要。然而 NowWAM 在纯 T2I 模型 Z-Image 上达到 87.8%,与 FLUX2-Klein 相当,证明通用像素级生成先验(如结构理解、语言对齐)才是关键,时序建模并非必需。这一发现为选择更轻量、更易获取的图像生成模型提供了依据,同时避免了视频模型的高计算开销。
  • 生成目标与动作预测在同一视觉流中耦合,可以同时提升性能和训练效率。NowWAM 将训练视觉 token 从 784 减半到 392,步时从 2.85 秒降至 1.63 秒(1.8× 加速),且性能反而提高 6.1 个百分点。这打破了增加生成目标通常带来额外计算负担的直觉,表明合理的联合训练设计能消除冗余视觉信息,使表征更聚焦于动作相关特征,为实际机器人部署提供了低延迟、高精度的策略训练范式。

方法

输入与任务设定

NowWAM 接收当前观测图像与可选的语言指令,不再构造未来帧作为辅助监督。训练时,模型对当前观测施加扩散噪声,然后在去噪轨迹的多个中间状态上同时执行两个任务:原生去噪重建与机器人动作预测。

关键模块

  • DiT backbone:复用预训练的生成扩散 Transformer(如 FLUX2-Klein 或纯文生图 Z-Image),保留其视觉-语言表征能力。
  • 噪声调度:标准扩散过程,训练时采样不同噪声级别,推理时直接使用干净观测(无噪声端点)。
  • 动作专家头:从 DiT 的中间特征(而非仅最终重建)提取动作 logits,与去噪任务共享同一视觉流。

训练与推理流程

  1. 训练阶段:随机加噪当前观测 → DiT 前向 → 计算去噪损失(预测噪声或干净图)与动作损失(行为克隆/回归)的联合目标,反向更新 backbone 与动作头。
  2. 推理阶段:输入干净观测,经 DiT 单次前向,直接输出动作,省去多步去噪与未来帧生成。

原文指出:过去与未来视觉目标在匹配设置下表现相当,但仅训练干净端点会显著降低鲁棒性,说明去噪轨迹的连续状态才是有效的控制接口。

工程启示

NowWAM 的轨迹条件训练、干净端点控制设计将生成先验的迁移成本从视觉 token 数(从 784 降至 392)与推理步数(1.8 倍加速)两方面降低,适合部署在实时性要求高的机器人系统。

与同类方法的差异:将生成辅助目标从未来预测替换为当前观测去噪,避免依赖视频生成或图像编辑 backbone,同时保留去噪轨迹的中间表征用于动作学习,实现更高效的控制适配。

实验

实验设计

  • 基准 LIBERO-Plus,覆盖 in-distribution 操作、few-shot cross-benchmark 迁移和分布偏移鲁棒性。
  • 主干网络:FLUX2-Klein(视频生成)和 Z-Image(纯文生图),对比 future-target co-training baseline。
  • 输入视觉 token 从 784 降至 392,推理步时从 2.85s 降至 1.63s。

关键发现

  • NowWAM 在 LIBERO-Plus 达到 87.7% 成功率(FLUX2-Klein),比未来目标 co-training baseline 提升 6.1 个百分点。
  • 使用 Z-Image 主干也达到 87.8%,表明无需视频生成或图像编辑 backbone,纯文生图 DiT 同样有效。
  • 消融显示:仅用 clean endpoint(无 denoising trajectory)会显著降低鲁棒性;过去与未来视觉目标表现相当,未来目标非必需。

与基线对比解读

  • 与 future-target co-training 相比,NowWAM 去掉了独立未来视觉目标,避免了未来预测与动作学习的目标不一致,但保留了完整 denoising trajectory 作为控制接口。
  • 效率收益来自视觉 token 减半与推理加速,对实时机器人控制部署更友好。
  • Z-Image 的成功暗示生成先验的迁移主要来自去噪过程本身,而非视频时序建模能力。

行业影响

落地场景

NowWAM 的核心是让预训练生成式 DiT 直接通过去噪当前观测来输出动作,无需预测未来帧。这适用于机器人操作、自动化仓储、服务机器人等需要在线闭环控制的产品。例如:

  • 电商仓储分拣机器人:利用 NowWAM 可从预训练文本-图像 DiT(如 Z-Image)快速适配到货架抓取任务,无需视频生成或图像编辑能力。
  • 自动驾驶/高级辅助驾驶:将 DiT 作为视觉骨干,对当前传感器数据进行去噪并输出控制信号,减少对未来帧的依赖,提升延迟敏感场景的实时性。

商业价值

  • 降本:训练视觉 token 减半(784 → 392),单步推理时间从 2.85 s 降至 1.63 s(1.8× 加速),直接降低云端推理算力成本与端侧硬件门槛。
  • 体验提升:在 LIBERO-Plus 上成功率 87.7%,比未来目标 co-training baseline 高 6.1 点,且对分布偏移更鲁棒,减少部署后因环境变化导致的任务失败率。
  • 增收:更快的推理速度允许同一硬件承载更多并发任务,提高机器人集群的吞吐量,利于规模化商业落地。

跟现有产品/工作流的接口

NowWAM 可作为即插即用的控制适配层,替换现有机器人学习 pipeline 中的未来视觉预测模块。

  • 基于 HuggingFace Diffusers 或 PyTorch 生态,加载预训练 DiT(如 FLUX2-Klein、Z-Image)作为视觉编码器。
  • 在现有模仿学习或强化学习框架中,将策略头(action expert)挂在去噪轨迹的中间表示上,无需改动底层生成模型。
  • 训练时只需当前观测-动作对,无需构建未来帧数据集,可直接接入 ROS2、Isaac Sim 等仿真-实机迁移栈。

实际工程中,可用 NowWAM 对已有预训练文生图模型做轻量微调,快速产出针对特定操作任务的策略,缩短从模型选型到现场部署的周期。

局限

  • 论文仅在 **LIBERO-Plus** 基准上进行了评估,该基准虽然包含多种任务,但主要面向桌面级语言条件操作,缺乏真实机器人部署验证或更复杂的接触丰富任务(如精密装配、移动操作)。因此,NowWAM 在更广泛机器人控制场景中的泛化性尚未得到证实。此外,使用的 backbone(FLUX2-Klein、Z-Image)规模较大,尽管推理速度有所提升,但训练时的显存占用和算力需求未与其他方法定量对比,可能限制其在资源受限环境下的应用。
  • 虽然消融实验表明去噪轨迹是有效的控制接口,且**干净端点**(clean endpoint)训练鲁棒性显著下降,但这一现象背后的机理(为何中间去噪状态比干净输入更有利于动作学习)缺乏深入分析。论文没有探究不同噪声调度或去噪步数对控制性能的影响,也未从表征角度解释去噪轨迹中编码了哪些有利于动作预测的信息,导致方法的理论支撑相对薄弱。
  • 与近期同类的生成式 co-training 方法(如 future prediction 范式)相比,NowWAM 虽然移除了未来视觉目标,但本质上仍依赖预训练的生成式 DiT 作为视觉编码器。若缺少大规模图像/视频生成预训练,仅用去噪目标从头训练是否仍然有效?论文未对此进行消融。另外,NowWAM 的动作预测部分仍是一个额外的轻量专家网络,其与生成主干的耦合方式是否最优也需要进一步探索。
论文Zanyi Wang2026-09-23原文

相关内容