论文

Kinematic MeanFlow:面向机器人基础模型的单步动作生成策略

Kinematic MeanFlow:面向机器人基础模型的单步动作生成策略

本文研究如何在 Robotic Foundation Models (RFMs) 中实现 单步动作生成,以克服多步 flow matching 的高推理延迟问题。MeanFlow 为实现该目标提供了颇具前景的框架,但其直接应用会导致性能崩溃。我们发现,这源于 RFM 速度场中表现出的两种独特动态特性: 1. 局部加速度 (local acceleration) 在早期保持稳定,但在去噪过程接近尾声时急剧上升; 2. 其幅度在样本间的分布随去噪推进而不断扩大。 为此,我们提出 Kinematic MeanFlow (K-MF),一种为 RFMs 量身定制的全新单步动作策略。具体而言,K-MF 以一个运动学恒等式为基础,将 MeanFlow 公式中的时间导数项解耦为被中间点分隔的两个子区间项。这种解耦形式使两项能够分别捕捉早期与后期的去噪动态,同时缓解整个过程中的误差放大。 由此,我们的 K-MF 让 RFMs 在从零训练与微调两种范式下、跨多种任务均能实现单步动作生成,并在多数设置下优于多步 flow matching。在推理效率方面,K-MF 在 L40 与 Jetson Orin 上(eager 与 compiled 模式)将 GR00T-N1.6 的动作头延迟降低 67.5%74.4%,端到端延迟降低 30.3%54.9%。代码将发布于 https://github.com/IntelChina-AI/K-MF。

论文精读

TL;DR 针对机器人基础模型多步流匹配推理延迟高,提出 Kinematic MeanFlow (K-MF),基于运动学解耦实现一步动作生成,解决 MeanFlow 直接应用的性能崩溃,多数任务超越多步流匹配,GR00T-N1.6 动作头延迟降低 67.5%–74.4%。

问题

机器人基础模型(RFMs)追求通用操作策略的实时推理,但动作生成的高延迟是部署的核心障碍。

现状局限

当前 RFMs 广泛采用 流匹配(flow matching)作为动作生成器,需多步迭代去噪,带来显著推理开销。MeanFlow 作为一步生成框架提供了加速思路,但直接迁移到 RFMs 会导致性能崩溃。本文发现根本原因在于 RFM 速度场的两类动态:

  • 局部加速度在去噪早期保持稳定,但在后期急剧攀升
  • 跨样本的速度场幅度离散度随去噪进程不断增大

这些特性使 MeanFlow 的一步近似在后期产生较大误差,且误差在整个去噪轨迹中传播放大。

挑战与重要性

一步动作生成对实时机器人控制至关重要,尤其在边缘设备(如 Jetson Orin)上,多步流匹配的延迟难以接受。然而,直接压缩去噪步数会破坏速度场的物理一致性,导致策略精度显著下降。如何在保证动作质量的同时实现单步推理,是 RFMs 落地的关键技术瓶颈。

这种矛盾类似于扩散模型从多步采样到一步蒸馏(如 LCM)的挑战,但机器人动作的速度场动态更复杂,无法直接套用。本文提出的 Kinematic MeanFlow 通过运动学恒等式解耦时间导数项,为 RFMs 的一步生成提供了针对性的解决方案。

核心洞察

  • 该工作揭示 **RFM 速度场的非均匀动态** 是 MeanFlow 直接应用导致性能崩溃的根本原因。通过定量分析,发现局部加速在去噪后期急剧攀升,且样本间幅度散布随过程扩大,这打破了 MeanFlow 基于线性 ODE 轨迹近似的核心假设。与将 MeanFlow 视为通用加速器的工作不同,本文深入机器人动作生成的特定场景,定位了失效的动力学根源,为针对性设计提供了明确依据。
  • 基于运动学恒等式的解耦策略将时间导数项拆分为两个子区间,分别捕捉早期和晚期去噪动态,从而在不增加推理步数的情况下抑制误差放大。相比知识蒸馏或直接单步训练等方法,K-MF 利用物理结构先验进行显式分解,而非黑箱近似,具有更好的可解释性和泛化能力。在训练 from scratch 和 fine-tuning 两种范式下均有效,并在多数任务上超越多步 flow matching,同时显著降低推理延迟,验证了其实用价值。

方法

输入

  • 多模态观测:机器人 RGB 图像、语言指令、本体感受状态,经 RFM 主干(如 GR00T-N1.6)编码为条件向量。
  • 动作目标:末端执行器位姿或关节角序列,作为流匹配的去噪对象。

关键模块:解耦时间导数的 Kinematic MeanFlow

  • 基线 MeanFlow 利用条件流匹配学习速度场,可一步近似生成动作,但直接应用于 RFM 时性能骤降。
  • 分析 RFM 速度场发现两个特性:局部加速度 在早期稳定、后期骤升;样本间速度幅值分布随去噪进程变宽。
  • K-MF 引入中间时间点,将原 MeanFlow 中的时间导数项分解为两个子区间项,分别对应早期与晚期去噪阶段。
  • 两个子项由网络并行预测,各自捕获不同阶段的动态特征:早期子项负责平滑区域,晚期子项负责高加速度区域。
  • 训练时对两个子项分别优化,避免单步近似中误差跨阶段放大。

输出

  • 单步生成的动作指令,直接用于机器人控制,无需多步积分。

与普通 MeanFlow 的差异:K-MF 通过结构化解耦显式建模速度场的非平稳特性,而非依赖单个全局导数近似。

实验

实验设计

作者在多种机器人操作任务上验证 K-MF,涵盖从零训练与微调两种范式。对比基线包括多步流匹配、原始 MeanFlow 及其变体。评估指标包括策略成功率与推理延迟,延迟测试覆盖 NVIDIA L40 和 Jetson Orin,并分别测试 eager 与 compiled 模式。

关键发现

  1. 直接应用 MeanFlow 到 RFM 会导致性能崩溃,原因是速度场存在两个动态:局部加速度后期剧增、样本间幅度分布逐渐展宽。
  2. 提出的 K-MF 通过运动学恒等式将时间导数项解耦为两个子区间项,分别捕捉早期与晚期动态,缓解误差放大。
  3. K-MF 在多数任务设置下超越多步流匹配,且只需一步生成。动作头延迟降低 67.5%–74.4%,端到端延迟降低 30.3%–54.9%。

与基线对比解读

相比原始 MeanFlow,K-MF 针对 RFM 速度场的特殊动力学进行了适配,避免了直接应用的退化。与多步流匹配相比,K-MF 以一步生成达到或超过其性能,同时大幅降低推理延迟,这对实时机器人控制具有重要意义。工程启示:对于边缘部署,一步策略可显著减少计算开销,但需注意速度场动态的复杂性。

行业影响

落地场景

K-MF 针对机器人基础模型(RFM)推理延迟高的痛点,实现一步动作生成。典型应用包括:

  • 电商仓储拣选机器人:在高速分拣场景中,视觉-语言指令驱动的机械臂需要毫秒级响应,K-MF 可将动作头延迟降低 67.5%~74.4%,显著提升吞吐量。
  • 服务机器人(如医疗辅助、酒店配送):实时交互要求低延迟,一步生成策略可改善用户体验与安全性。

商业价值

  • 降本:减少推理步数允许在边缘设备(如 Jetson Orin)上部署原本需要高端 GPU 的模型,降低硬件与能耗成本。
  • 增收/体验提升:更快响应直接提升机器人单位时间作业量,在仓储场景中增加订单处理能力;服务场景中提升客户满意度。

与现有产品/工作流接口

  • K-MF 作为 RFM 动作头部的即插即用替代模块,支持从零训练与微调,可无缝嵌入现有训练管线。
  • 推理侧兼容 TensorRT、ONNX Runtime 等优化框架,已在 L40 与 Jetson Orin 上验证 eager/compiled 模式。
  • 可与 ROS 2 等机器人中间件集成,作为低延迟策略节点,无需重构上层控制逻辑。

局限

  • **泛化性依赖特定动态假设**:K-MF 的设计基于对 RFM 速度场中“局部加速度晚年飙升”和“幅度分布变宽”现象的观察,这些特性可能与训练数据、模型架构或任务类型相关。论文在 GR00T-N1.6 等特定设置下验证有效,但尚未证明在更广泛的 RFM(例如不同 backbone 或不同机器人数据分布)上同样能触发并利用这两个动态。若其他模型的速度场行为不同,解耦策略和中间点选择可能需要重新设计,限制了方法的普适性。
  • **一步生成的性能平衡未完全论证**:摘要提到 K-MF 在大多数设置中优于多步 flow matching,但暗示仍有少数场景不如后者。论文未提供 Performance-Latency 的完整 trade-off 曲线,也未阐明在哪些具体任务或精度要求下一步模型可能不适用。对于要求亚毫米级精度的操作,多步采样可能更具优势,K-MF 的一步近似可能带来不可忽略的误差,这在高精度工业场景中可能成为瓶颈。
  • **方法复杂度与训练开销未充分说明**:K-MF 将 MeanFlow 的时间导数项分解为两个子区间项,并引入中间点分隔,这增加了公式和实现的复杂度。论文没有讨论中间点的选择机制(固定、可学习或启发式),也没有报告训练时间、显存占用或超参敏感性与 MeanFlow 的对比。在实际部署中,额外的解耦结构可能要求更精细的调参,且从零训练时收敛速度未知,这增加了落地成本。
论文Jiawei Fan2026-10-01原文

相关内容