论文

在潜在空间中学习高频连续动作块

在潜在空间中学习高频连续动作块

现代机器人策略越来越依赖 action chunking 以在物理世界中执行复杂任务。尽管 action chunking 在中等动作频率下改善了时序一致性,但当动作频率进一步提高(例如到 60 Hz)时,它变得不足。在这样的高频下,策略通常无法生成既时序平滑又空间一致的动作。我们通过将高频动作学习从动作空间转移到使用变分自编码器(VAE)的潜在空间来解决这一挑战。这种公式显著改善了高频控制的时序和空间一致性。为了实现平滑的实时执行,我们进一步引入了 Reuse-then-Refine,一种在异步推理下改善相邻动作块之间连续性的块级细化策略。因此,由我们的策略控制的机器人可以连续执行复杂的接触丰富任务,减少停顿和抖动运动。 在三个真实世界的接触丰富机器人任务上的实验表明,我们的方法能够一致地以平滑运动完成任务。我们的代码和数据可在 https://github.com/tars-robotics/RTR 获取。

论文精读

TL;DR 使用 VAE 将高频动作学习转移到潜在空间以增强时空一致性,并通过 Reuse-then-Refine 策略确保异步推理时的动作块连续,实现机器人接触密集型任务的平滑连续执行。

问题

机器人模仿学习领域正从低频离散决策转向高频连续动作生成,以实现精细接触操作。核心挑战在于在高频率下(如60 Hz)生成既平滑又精准的动作序列。

主流的 动作分块 (action chunking) 策略通过同时预测未来多步动作来改善时间一致性,但在高频下效果衰减明显。直接在高维动作空间生成高频动作会导致严重的 时间不一致 (动作抖动) 与 空间不一致 (末端轨迹偏离),因为高频动作序列的相邻步差异小、噪声大,策略难以拟合连续运动规律。此外,异步推理下,相邻动作块之间的衔接处常出现不连续,引发机器人停顿或抽搐,影响任务成功率。

高频控制对实时性和平滑性的要求极高,传统方法在动作空间直接建模难以平衡精度与连贯性。将动作学习压缩到 潜在空间 (latent space) 有利于捕捉运动本征维度,降低过拟合风险,但需保证重构精度不损失。业界对高动态任务(如灵巧手操作、高速抓取)的可靠性控制需求迫切,平滑执行不仅提升效率,也避免机械冲击与物体损坏。

这一思路与 潜在扩散模型 (Stable Diffusion) 在图像生成中通过在潜在空间去噪提升连贯性的做法异曲同工,均为高频连续输出场景提供了压缩感知的解决方案。

核心洞察

  • 高频动作学习从动作空间迁移到潜在空间,通过VAE压缩动作序列,策略预测潜在向量,再由解码器生成平滑的动作序列。这解决了高频控制下时序抖动和空间不一致的问题,因为潜在空间自然过滤了高频噪声,且解码器施加了平滑先验。与传统在动作空间直接预测的方法(如ACT、Diffusion Policy)相比,本方法显著提升了复杂接触式任务的执行成功率和平滑度,且无需修改策略架构,具有即插即用的特性。
  • 针对异步推理引入的Reuse-then-Refine机制,在推理延迟内重用上一动作块,然后在获得新动作块后通过细化步骤无缝衔接,无需额外插值或等待。这解决了动作块间不连续导致的暂停和抖动,实现了真正的实时平滑控制。与现有时间集成方法相比,它避免了计算开销和延迟累积,更适用于高频控制场景。

方法

输入与预处理

策略输入为历史观测序列(图像、本体感知),输出为高频动作片段(chunk),频率可达 60 Hz。传统方法直接在动作空间预测,面临时间平滑性与空间一致性的矛盾。

核心模块一:潜在空间动作学习

  • 使用 变分自编码器(VAE) 将原始动作片段编码到低维潜在空间,该空间通过 KL 散度正则化,保证连续性与紧凑性。
  • 策略(如扩散模型或 Transformer)在 潜在空间 中预测动作的潜在表示,而非直接输出原始动作。
  • 预测得到的潜在向量经 VAE 解码器恢复为完整动作序列,解码器可被设计为平滑的先验,强制生成动作的高频部分保持时序。
  • 优势:潜在空间天然滤除高频噪声,且 VAE 的重构损失使解码动作保持数据集中的的空间结构(如末端位姿的几何连续性)。

核心模块二:Reuse-then-Refine(RTR) 策略

异步推理下,新动作片段计算完成前,控制器需持续下发指令。RTR 分两步:

  1. Reuse:当前控制周期若新片段未就绪,则复用上一片段对应时间步的动作(或基于状态外推),避免停顿。
  2. Refine:一旦新片段推理结束,将上一片段的末尾动作与当前片段的初始动作在 潜在空间 进行加权融合或微调。具体地,将新片段的潜在变量与旧片段的重叠部分联合优化,最小化邻接帧的动作跳变,再解码执行。

输出

最终下发到机器人控制器的是一系列平滑、连续的动作指令,无明显停顿或抖动,即使推理延迟波动也能保持轨迹质量。

与同类方法的差异:现有异步执行(如 Action Chunking with Transformer)仅复用或插值,未在潜在层级联动历史与未来信息,而 RTR 直接在压缩表示层面确保片段间的全局一致性,对接触丰富任务(如擦拭、插入)的实时平滑控制更鲁棒。

实验

实验设计

实验在三项真实世界接触丰富(contact-rich)的机器人操作任务上验证,重点评估高频控制(60 Hz)下的动作时序平滑性、空间一致性与任务成功率。对比基线包括主流动作分块(action chunking)方法:Diffusion Policy (DP)OpenVLA-OFT (OFT)PI0.5。评估分为同步推理(synchronous inference)和异步推理(asynchronous inference)两种场景,后者更贴近真实部署,但会引入相邻动作块之间的不连续问题。

关键发现

  • 高频动作的平滑性:在 60 Hz 下,基于 VAE 的潜在动作表示显著提升了时序平滑性与空间一致性,机器人运动中的停顿和抖动明显减少。
  • 异步推理下的连续性:所提出的 Reuse-then-Refine 策略通过复用前一动作块并细粒度修正,有效缓解了异步执行中的动作块跳变,确保了实时控制的流畅性。
  • 任务成功率:在三个接触丰富任务上,本方法均能持续完成任务,而基线方法在高频下常出现动作震荡或任务中断。

与基线的深度对比

传统动作分块方法(如 DP)将原始动作作为学习目标,在高频控制时原始动作空间的高维噪声与微小扰动被放大,学习难度剧增。OFT 和 PI0.5 虽借助 VLA 架构提升泛化,但未专门针对高频一致性进行设计。本工作将动作学习从原始空间转移到 VAE 的平滑、低维潜在流形,从根源上降低了对噪声的敏感度。这一设计使得策略在同步推理时已具优势,而在异步推理中通过 Reuse-then-Refine 进一步保持了块间连续性,最终在流畅性任务完整性上超越所有基线。

行业影响

落地场景

该方法直接适用于高频率精细操控的机器人系统,尤其在需要连续接触和力反馈的场景。典型产品 / 业务包括:

  • 柔性材料装配(如线束插接、布料折叠)—— 需 60 Hz 以上频率保持力控平滑。
  • 手术机器人—— 高频动作生成可提升缝合、打结等精细操作的时空一致性。
  • 人形机器人灵巧手操作—— 多指运动需要动作块潜在空间解耦,保证频响与协调。
  • 自动驾驶远程操控—— 高频率动作预测使远程操作更跟手、减少抖动。

商业价值

  • 降低开发成本:通过在潜在空间(VAE)学习动作,大幅减少对高频动作数据精确标注的依赖,训练数据可来自遥操作低频采集后升频。
  • 提升任务成功率与连续性:在接触密集型任务(如插拔、打磨)中,平滑运动减少停顿和抖动,直接提高产线节拍和良率。
  • 硬件成本优化:模型在异步推理下保持动作块连续,允许使用更低算力边缘芯片(如 Jetson SoM)部署,降低 BOM。
  • 体验提升:在服务机器人、医疗机器人等交互场景,动作更拟人、延迟更低,显著改善用户信任与接受度。

与现有产品 / 工作流的接口

  • 与 VLA(Vision-Language-Action)模型堆叠:该方法作为动作执行后端,接收 VLA 输出的低频目标动作,上采样为高频平滑指令,无缝集成现有模仿学习框架。
  • 异步推理架构:通过 Reuse-then-Refine 策略,可插入多数异步控制回路(例如 ROS 2 控制节点),只需缓存前一块动作并实时微调,不改变上游高频规划的接口。
  • 硬件加速兼容:VAE 编解码轻量,可部署在主流推理引擎(ONNX、TensorRT),支持 CUDA 及 NPU 加速,适合现有机器人中间件(如 isaac_ros)。

具体落地案例

  • 电商仓储拣选:在抓取易碎品或异形件时,模型驱动夹具以 60 Hz 连续调整角度和力度,避免碰撞停机;与现有视觉抓取 pipeline 配合,替换传统梯形速度规划,实现零损伤拣选。
  • 远程超声诊断:操作者通过力反馈手柄低频率输入(如 20 Hz),由模型实时生成探头接触力的高频动作块,保证超声图像切面稳定,使远程专家获得接近现场操作的体验。

局限

  • **信息瓶颈与任务覆盖度不足**:将高频率动作序列映射到 VAE 潜在空间虽能提升平滑性,但压缩过程可能丢失对接触密集任务至关重要的细粒度力控或高频位置误差信息。论文仅在三个相对静态的桌面任务(如插拔、擦拭)上验证,未涉及动态移动操作或干扰下的鲁棒性,泛化边界不清晰。此外,与基于注意力机制的序列平滑方法(如 ACT 的时序编码器)缺乏直接对比,难以判断性能提升是源于潜在表示还是架构改进。
  • **Reuse-then-Refine 的响应迟滞风险**:该策略通过复用前一个动作块的首帧来维持块间连续性,在环境突然变化(如物体滑动)时,对历史动作的依赖可能导致策略反应滞后。论文仅展示异步推理下的收益,同步推理时无明显优势,说明其适用场景局限于推理频率低于控制频率的工况。当动作块长度与任务动态不匹配时,复用机制可能引入累积偏差,需要更系统的延迟-平滑性权衡分析。
  • **实验设置的代表性局限**:训练数据仅来自少量人类演示,且未探索 VAE 在不同演示质量下的重建偏差对下游策略的影响。真实机器人实验由同型号单臂执行,未测试跨实体或跨场景的迁移能力。论文未分析长任务序列下累积误差的传播,当执行时间远超训练动作块长度时,潜在空间中的漂移可能使后续动作块失效。这些限制削弱了方法在大规模部署中的可靠性。
论文Kunyun Wang2026-05-24原文

相关内容