论文

AnyStep-WAM:面向世界动作模型的预算对齐蒸馏与自适应推理

AnyStep-WAM:面向世界动作模型的预算对齐蒸馏与自适应推理

World-action models(WAMs) 将预测式视觉建模与动作生成相耦合,通常依赖固定去噪步数的迭代去噪。然而操控任务中的 action chunk 对生成误差的敏感度差异很大:关键动作需要高精度,不敏感动作则可用更少步数快速生成。 本文提出 AnyStep World Action Model,一个面向可调预算预测与场景自适应算力分配的通用框架。其 budget-aligned teacher-trajectory distillation 利用显式冻结的教师转移与共享 low-rank adapters 训练 interval-conditioned flow maps,支持从单步预测到多步精修的动作生成。在此基础上,轻量的 risk-benefit scheduler 仅凭一次单步预览即可预测基于 teacher-curvature 的难度与各预算下的学生-教师保真度,选出满足风险自适应保真度要求的最小预算。 在 RoboTwin 2.0 上对三种主流 WAM 评测,平均去噪步数大幅下降且保持基线任务成功率: - Motus:去噪步数减少 60.2%,单步预算下成功率提升 7.07% - FastWAM:减少 49.8%,单步成功率提升 12.08% - LingBotVA:减少 85.28%,单步成功率提升 8.94% 六个真实世界操控任务的实验进一步验证了该框架的有效性。

论文精读

TL;DR AnyStep-WAM 提出预算对齐蒸馏与自适应推理,让世界动作模型根据场景难度动态分配去噪步数,在保持成功率的同时大幅减少计算量。

问题

问题背景

世界动作模型(World Action Models, WAMs)已成为机器人操作中同时预测视觉动态和生成动作的主流框架,例如 Motus、FastWAM、LingBotVA。当前领域高度关注在保证任务成功率的前提下降低推理计算开销,以支撑更复杂的长期操控。

现有方法局限

主流 WAMs 依赖迭代去噪生成动作块,且对所有场景、所有时间步固定统一去噪步数。这带来三个具体技术问题:

  • 动作块内不同动作对误差敏感度差异巨大:抓取、插入等关键动作需要高精度去噪,而平移、接近等粗粒度动作即使少步数去噪也能满足需求。
  • 固定预算导致简单片段被过度计算、关键片段可能因预算不足而精度受损,无法在“精度-计算”之间做场景级权衡。
  • 现有训练往往在单一去噪步数下优化,切换到低步数(如 1 步)时任务成功率显著下降,模型缺乏步数泛化能力。

为什么这个问题难/重要

让 WAM 支持任意预算的难点在于:

  1. 模型需同时保持高步数下的精度与低步数下的可接受性能,这本质上是多目标一致性蒸馏问题。
  2. 推理时如何仅凭一次前向结果预测当前动作块的难度和不同预算下的保真度,需要额外学习风险-收益评估器,而不能靠人工规则。
  3. 将蒸馏与调度器合并进现有 WAM 骨干需要轻量、可插拔的设计,否则会抵消计算收益。

业界对此高度关注,因为机器人操作对实时性要求高,边缘设备算力有限,动态分配去噪步数能显著降低平均延迟而不牺牲成功率。

行业类比

与 LLM 推理中的 adaptive early exit 或 speculative decoding 类似:根据 token/动作难度动态决定计算深度,避免对简单实例浪费固定计算预算。

核心洞察

  • 将去噪步数从固定超参数转变为可调预算,使世界动作模型在推理时能为每个动作块分配不同计算量,从而在不牺牲成功率的前提下大幅降低平均计算成本。与现有 WAMs 依赖固定步数或简单早停不同,AnyStep-WAM 通过预算对齐蒸馏训练区间条件流映射,让模型在训练阶段就学会在不同步数下保持动作质量,而不是仅靠截断推理过程;这种显式的预算建模为动作生成提供了新的效率-精度权衡轴。
  • 通过教师轨迹蒸馏而非仅匹配最终输出,AnyStep-WAM 让学生模型学习从一步到多步的完整积分路径,从而在极低预算(如一步)下仍保持高成功率。对比传统蒸馏目标(如直接回归教师最终动作),该方法对齐了中间去噪状态,配合共享低秩适配器实现参数高效的任意步数推理,在多个 WAM 骨干(Motus、FastWAM、LingBotVA)上一致提升一步推理成功率 7%~12%,证明了轨迹级蒸馏对低步数场景的关键价值。
  • 轻量风险-收益调度器仅用一次单步预览即可预测动作块的难度与预算-保真度关系,进而在推理时实时选择最小可行预算,无需多次试运行或引入额外复杂模块。与常见自适应推理方法需要多次前向或独立评估网络不同,该调度器利用教师曲率作为难度信号,直接反映流形弯曲程度,比基于方差或启发式的预算分配更贴合流匹配的几何特性;这一设计使得动态计算分配的开销保持在极低水平,适合部署在实时机器人控制回路中。

方法

输入与整体流程

AnyStep-WAM 建立在 世界动作模型 (WAM) 之上,输入通常是当前视觉观测或状态,输出未来动作块。与固定步数去噪不同,本方法支持从 1 步预测 到 多步精炼 的可变预算。

关键模块

  1. 预算对齐教师轨迹蒸馏
    冻结教师 WAM,显式生成从噪声到动作的流匹配轨迹;学生模型使用 interval-conditioned flow maps 和 共享 LoRA 适配器 学习这些轨迹在不同去噪预算区间下的映射。训练时强制学生单步/少步输出对齐教师轨迹的对应过渡,从而在预算降低时仍保持精度。

  2. 自感知风险-收益调度器
    推理时先用 单步预览 生成粗糙动作。轻量调度器根据预览特征预测 基于教师曲率的场景难度 和 预算特定的学生-教师保真度,再按风险收益准则选择满足保真要求的最小去噪步数。

输出与差异点

最终输出是动态预算下的动作序列,计算量随场景自适应分配。与固定步数蒸馏或纯静态预算方案不同,AnyStep 同时保留一步生成能力与多步精炼能力,并通过在线调度降低平均计算成本。

实验

实验设计

在 RoboTwin 2.0 仿真环境上评估了三种主流 WAM(Motus、FastWAM、LingBotVA),并在六个真实世界操作任务上进一步验证。方法通过 budget-aligned distillation 训练 interval-conditioned flow maps,引入 risk-benefit scheduler 实现自适应推理。实验覆盖从 one-step 到多步的去噪预算,与固定步数基线对比。

关键发现

AnyStep-WAM 显著降低平均去噪步数:三个模型分别减少 60.2%、49.8%、85.28%,同时保持任务成功率。尤其在一去噪预算下,成功率提升 +7.07%、+12.08%、+8.94%,说明模型在极少步数下仍能保持动作精度。自适应调度器能根据场景难度动态分配计算,平衡计算量与精确度。

与基线对比解读

与传统固定步数去噪相比,AnyStep-WAM 通过蒸馏 teacher 轨迹和风险-收益预测,在几乎所有预算下均优于或持平基线。低预算场景的性能提升尤为明显,证明方法的鲁棒性。在三个不同 backbone 上均有效,显示通用性。调度器轻量级设计易于集成,对实际部署有显著优势。

行业影响

落地场景

AnyStep-WAM 主要适用于 机器人操作 与 具身智能 场景,例如 电商仓储机器人 的抓取分拣、家庭服务机器人 的物体操作、工业机械臂 的精密装配。这些场景中动作序列的敏感性不同,框架可对关键步骤分配更多去噪步数,对简单步骤一步生成,从而在保证任务成功率的同时降低延迟。另一个直接场景是 自动驾驶 中的轨迹预测与规划,但论文主要针对操作任务。

商业价值

  • 降本:平均去噪步数降低 60.2% 至 85.28%,直接减少 GPU 推理时间与能耗,提升机器人响应速度,降低云端推理成本。
  • 体验提升:对于需要实时交互的服务机器人,低延迟可减少等待,改善用户体验。
  • 模型性能:在 one-step 预算下成功率提升 7.07% 至 12.08%,表明训练策略本身增强了单步生成能力,可支持更极端的部署条件。

与现有工作流接口

AnyStep-WAM 以 插件式训练 方式融入现有 WAM 栈:它基于 预算对齐教师轨迹蒸馏 与 共享低秩适配器,无需改变主干架构。对 Motus、FastWAM、LingBotVA 等框架,只需添加蒸馏损失与调度器模块,即可沿用原有推理管线。推理时,风险-收益调度器 从单步预览预测预算,可无缝嵌入实时控制循环。

局限

  • **教师模型依赖与蒸馏成本**:框架的核心是 budget-aligned teacher-trajectory distillation,需要先训练或选定一个高质量的固定教师 WAM,并显式提取其在不同去噪预算下的过渡轨迹。这增加了额外的训练阶段和计算开销,且最终性能受限于教师模型本身的表达能力。若教师模型在某些任务上不够鲁棒,蒸馏得到的区间条件流图可能继承其偏差。此外,共享低秩适配器虽然降低了参数量,但也可能限制学生在极端预算下逼近教师的能力。论文未系统讨论教师模型选择对整体结果的敏感性。
  • **调度器泛化风险**:自适应调度器基于单步预览预测 teacher-curvature-based difficulty 和 budget-specific fidelity,从而选择最小预算。这一预测器在训练分布内表现良好,但面对分布外场景(如新物体、新光照、新动力学)时,单步预览可能不足以捕捉任务难度,导致预算分配不当,影响成功率。论文仅在 RoboTwin 2.0 模拟和六个真实任务上评估,未涉及更极端的泛化测试,且调度器本身也需要额外训练数据。
  • **一步预算的边界性能**:尽管 AnyStep 训练大幅提升了 one-step denoising 下的成功率(Motus +7.07%, FastWAM +12.08%, LingBotVA +8.94%),但绝对成功率仍显著低于多步基线(如 10 步或 20 步)。这意味着在极端低预算下,系统仍以牺牲部分精度换取速度,对于高精度操作任务可能不满足要求。论文未报告一步预算下的失败模式分析,也未给出最小可接受预算的理论下限。
论文Rui Wang2026-09-27原文

相关内容