论文

迈向实时 VLA:阶段感知两步流去噪与系统级评估

迈向实时 VLA:阶段感知两步流去噪与系统级评估

Vision-Language-Action (VLA) 模型面临低速率推理与高速率机器人执行之间的时序失配。本文通过端到端延迟测量刻画了模型推理与机器人执行链路上的这一差距:重复的 Flow Matching 去噪是推理开销的主要来源,而机器人侧延迟主要来自感知采集、通信调度与物理响应。对速度场的分析显示,早期积分阶段速度的幅值与方向相对稳定,而在临近末端步骤时出现更强的方向修正。 基于这一阶段性异质性,作者提出两阶段非均匀去噪,将去噪步数从 10 步降至 2 步,模型推理时间从 61.557 ms 降至 21.956 ms。(注意:此处必须保持原义,上面是模型生成内容,不能自行改写。) 同时,作者构建了一个分布式实时 VLA 框架,支持独立的推理、动作发布与机器人控制速率,模块化观测采集以及动作溯源日志。 以 π0.5 为基线,在长时序物理衣物折叠任务上评估了六种实时执行方法: - Legato 在基于训练的方法中综合表现最佳 - Temporal Smoothing 在免训练方法中领先 - 两者在任务成功率、完成时间、动作连续性与加速度平滑度上均表现强劲 将两步去噪与代表性执行方法结合,可显著降低推理开销,仅带来小幅任务性能下降。这些结果说明,模型推理效率与机器人系统时序需要联合优化。

论文精读

TL;DR 针对VLA推理与机器人执行的时序缺口,该文测量端到端延迟定位Flow Matching去噪为瓶颈,提出两阶段去噪将推理步数从10降至2、延迟从61.6ms降至22.0ms,并构建分布式框架在叠衣任务上验证其性能几乎不降。

问题

问题背景
视觉-语言-动作(VLA)模型正成为机器人操作的核心组件,但其低速率推理与高速率机器人执行之间存在显著的时序鸿沟,影响实时操控性能。

现有方法局限
主流 VLA 推理采用 Flow Matching 等多步迭代去噪,典型配置约 10 步,导致单次动作块生成耗时较高(如 π0.5 的 61.557 ms),难以匹配机器人控制周期。现有异步执行框架通常固定推理、动作发布与机器人控制的频率,未针对模型推理内部阶段进行优化,导致动作块间不连续、响应滞后与加速度抖动。训练侧方法(如 Legato)改善连续性但增加训练开销;无训练方法(如 Temporal Smoothing)仅对动作后处理,无法降低推理延迟。

为什么这个问题难/重要
该问题横跨模型推理效率与机器人系统调度:Flow Matching 速度场在不同积分阶段呈现异构特性——早期方向与幅度相对稳定,末端方向校正显著增强,这为减少去噪步数提供了理论依据,但压缩步数需兼顾任务成功率与动作平滑性。同时,机器人侧延迟来自感知采集、通信调度和物理响应等多个环节,单一层面优化难以奏效。业界对长时序、多步操作的实时执行(如衣物折叠)关注度高,端到端延迟累积会直接影响成功率与运行安全。

行业类比
类似自动驾驶中多传感器感知-规划-控制链路,必须对不同速率节点进行多速率调度与时钟对齐,否则控制指令滞后将造成轨迹振荡与不稳定。

核心洞察

  • VLA 实时性瓶颈不仅是模型推理,机器人侧非模型延迟同样关键。本文通过端到端测量分解,指出感知获取、通信调度、物理响应等环节占显著比例。传统工作往往只优化模型推理频率或单独改进执行算法,缺少对系统全链路的延迟归因。这一测量驱动的方法促使联合优化模型效率与系统时序,而不是单点突破。
  • Flow Matching 去噪过程存在阶段异质性,早期步骤方向稳定、后期方向校正显著,允许用极低 NFE 近似。基于速度场分析,作者提出两阶段非均匀去噪,将 10 步降到 2 步,推理时间减少 64%,同时保持任务性能小幅下降。相比均匀减少采样步数,该策略利用了 VLA 动作分布的流形结构,并与实时执行机制兼容,为扩散策略提供高效采样范式。
  • 分布式实时 VLA 框架通过解耦推理、动作发布和机器人控制速率,支持可插拔策略与公平评测。现有实时执行方法常与特定模型或控制频率耦合,难以横向比较。本文框架将三部分独立运行,并加入模块化观测获取和动作来源日志,在真实衣物折叠任务上评估六种方法。这种系统级设计不仅降低推理延迟影响,还为后续策略集成与性能追踪提供基础设施。

方法

方法详解

输入与核心问题

VLA 模型(以 π0.5 为基线)的动作生成依赖 Flow Matching 去噪,原始需 10 步推理,单次模型推理耗时 61.557 ms,与高频率机器人执行之间存在明显时序缺口。端到端延迟不仅来自模型,还包含感知获取、通信调度、物理响应等机器人侧开销。

关键模块
  1. 速度场分阶段分析:对去噪速度场进行观测,发现早期积分阶段速度幅值与方向相对稳定,而接近末端时发生较强的方向校正。据此将 10 步压缩为两阶段非均匀划分:早期大步推进,后期集中细化。
  2. 两阶段 2-NFE 去噪:训练时通过 SnapFlow 终端细化与联合训练,使 2 步推理即可逼近原始 10 步效果,模型推理时间降至 21.956 ms。
  3. 分布式实时执行框架:将推理、动作发布、机器人控制解耦为独立速率运行;采用模块化观测获取与动作溯源日志,支持 Legato、Temporal Smoothing 等六种实时执行方法灵活接入。
输出

低延迟动作 chunk,在长时域衣物折叠任务中,联合两阶段去噪与代表性执行方法后,推理成本显著降低,任务成功率仅小幅下降,动作连续性与加速度平滑度保持良好。

与同类方法的差异:现有工作多分别优化模型推理效率或系统时序,本方法联合 stage-aware 去噪压缩与多速率分布式解耦,实现模型与机器人时序的协同优化。

实验

实验设计

论文以 π0.5 作为基线,在长周期物理衣物折叠任务上评估六种实时执行方法,区分基于训练与无需训练两类。实验集成所提出的两阶段非均匀去噪到分布式实时 VLA 框架中,并测量端到端延迟、任务成功率、完成时间、动作块连续性和加速度平滑度。

关键发现

  • 两阶段 2-NFE 去噪将去噪步数从 10 步降至 2 步,模型推理时间由 61.557 ms 降至 21.956 ms,约降低 64.3%。
  • 与代表性执行方法结合时,推理成本大幅降低,任务性能仅有小幅下降。
  • 在基于训练的方法中 Legato 综合表现最优;在无需训练的方法中 Temporal Smoothing 领先。

与基线对比解读

与标准 10 步 Flow Matching 相比,两阶段去噪利用早期速度场稳定、后期方向校正的阶段异质性,实现了接近 3 倍的推理加速,同时保持可接受的任务成功率。与现有执行方法相比,Legato 和 Temporal Smoothing 分别在各自类别中表现最佳,表明时序平滑与训练对齐是弥合低频推理与高频执行差距的有效路径。该结果支持对模型推理效率与机器人系统时序进行联合优化的方向。

行业影响

落地场景

该方法直接适用于实时机器人操作领域,尤其是对推理延迟敏感、需要高频动作执行的场景。典型产品形态包括:

  • 仓储与物流机器人:货物分拣、包装、装卸等需要快速响应和连续动作的任务,可在电商履约中心、第三方物流仓库中部署。
  • 服务机器人:家庭或商用场景中的衣物折叠、桌面整理等长周期精细操作,结合视觉语言指令实现端到端控制。
  • 工业柔性装配:小批量、多品种的组装任务,通过对动作去噪过程的阶段感知优化,在不牺牲成功率的前提下大幅降低模型推理开销。

商业价值

  • 降本:将 VLA 模型推理时间从 61.557 ms 压缩到 21.956 ms(约 64% 降低),意味着同一块 GPU 可以服务更多机器人,或可采用更低成本的边缘设备,直接降低单台机器人的硬件与能耗成本。
  • 体验提升:更低的延迟带来更连续、更平滑的动作轨迹,减少机器人抖动和停顿,提升任务成功率和操作安全性。在长周期任务中,动作连续性指标改善可减少重试与人工干预。
  • 增收:对于自动化服务提供商,实时性提升可扩大机器人可执行的任务范围(如更快速的分拣节拍),提高单位时间产出,从而提升服务单价或吞吐量。

与现有产品/工作流的接口

  • 推理后端替换:将原有 Flow Matching 多步采样替换为两阶段非均匀去噪 + SnapFlow 终端细化,可直接嵌入现有 VLA 模型(如 π0.5)的推理管线,无需改动模型架构,仅调整采样策略和训练微调。
  • 分布式执行框架:论文提出的独立推理、动作发布、机器人控制速率解耦框架,可与 ROS 2 等机器人中间件集成,作为独立节点运行,记录动作来源日志用于调试与性能分析。
  • 执行方法插件化:支持 Temporal Smoothing、Legato 等现有实时执行方法作为插件接入,便于在已有机器人系统中快速测试与迭代。

具体 use case

  1. 电商仓储自动化:在大型电商履约中心,使用 VLA 驱动的机械臂进行服装折叠与打包。通过两阶段去噪将模型推理延迟降至 20ms 级别,使机械臂能够以接近人工作业的节奏连续折叠多种衣物,动作平滑度提升减少衣物损坏,同时节省 GPU 资源,支持单卡控制多台机械臂。
  2. 医疗康复机器人:辅助患者进行上肢康复训练时,机器人需要实时响应患者动作并施加柔顺力。利用低延迟 VLA 推理生成平滑辅助轨迹,可提升训练安全性与患者舒适度,并降低设备计算成本,推动家用康复设备普及。

局限

  • **任务性能存在小幅下降**:论文明确承认将两步去噪与代表性实时执行方法结合后,任务性能出现 small reduction。将 Flow Matching 去噪步数从 10 步压缩到 2 步,虽然大幅降低推理延迟,但可能损失动作生成的细节精度,特别是在需要精细力控或高精度轨迹跟踪的操作中可能不可接受。对于长时域、接触丰富的任务,这种性能折衷是否可容忍仍需在更多场景下验证。
  • **实验基线与任务覆盖有限**:所有实验仅基于 π0.5 单一 VLA 模型,且只在长时域物理衣物折叠任务上评估。不同 VLA 模型在去噪动态、动作空间和推理开销上差异显著,所观察到的速度场阶段异质性以及两阶段非均匀划分的有效性可能不具备跨模型泛化能力。此外,衣物折叠任务的动作连续性要求较高,但无法代表抓取、移动操作、工具使用等更广泛的操作类型。
  • **两阶段非均匀去噪依赖的假设可能不通用**:方法的核心依据是速度场在早期积分阶段幅度和方向稳定、终端步骤出现强方向校正的经验观察。这一特性可能受模型架构、训练数据分布、动作表征方式等因素影响。在其他 VLA 或不同的 Flow Matching 训练策略下,阶段边界可能漂移或消失,导致固定两步划分失效。论文尚未分析该假设的边界条件或给出自适应选择策略。
论文Di Wu2026-10-03原文

相关内容