论文

条件轨迹峰:面向动作块的单次前向多模态策略

条件轨迹峰:面向动作块的单次前向多模态策略

多模态模仿学习 要求在同一观测下具备多样且可执行的未来,同时在重规划循环中保持行为一致。本文提出 Conditional Trajectory Peaks (CTP),一种单次前向(单次推理)的策略框架,联合预测完整的 动作块 候选、概率质量以及轨迹尺度。 方法上包含两个核心组件: - Distribution-Aware Peak Specialization (DAPS):利用轨迹级后验责任度对轨迹峰进行专门化,并施加质量与尺度调制的重叠约束。 - Evidence-Gated Trajectory Belief Transport (ETBT):通过可交换候选集之间的几何对应关系维持跨块一致性,同时允许当前策略证据覆盖历史约束。 实验结果表明:CTP 在 Push-T 上取得 91.40% 的覆盖率得分;在 D3IL 的 Avoiding、Aligning 与 Sorting-2 任务上成功率分别为 100.0%、79.72% 与 84.44%;在 LIBERO 上平均成功率达 97.25%。在真实双臂实验中,CTP 在两盘任务中同时保留两种放置模式,50 次试验全部成功;在立瓶与将笔放入笔架任务中,其成功率与 π{0.5} 相当,同时将策略推理延迟从 218.24 ms 降至 75.80 ms。 这些结果说明,单次前向轨迹建模能够同时兼顾多模态行为、闭环一致性与高效推理。

论文精读

TL;DR CTP 通过单次传递联合预测动作块候选、概率与轨迹尺度,用 DAPS 和 ETBT 保持多模态行为与跨块一致性,在 Push-T、LIBERO 等基准上取得高成功率,并将推理延迟降低约 2.9 倍(218→76 ms)。

问题

问题背景

机器人模仿学习需在相同观测下产生多个可执行未来(多模态),并保证重规划周期之间行为一致。

现有方法局限

  • 扩散策略 (Diffusion Policy) 通过迭代去噪生成动作块,虽能覆盖多模态,但推理延迟高,难以满足高频闭环控制;典型如 π0.5 的 218.24 ms 延迟。
  • 单遍多假设生成方法(如 BeT 使用 k-means 离散化、VQ-BeT 使用 VQ-VAE)虽有速度优势,但离散化会丢失连续多模态分布的细节,导致模式覆盖不足或坍塌。
  • 跨动作块一致性通常依赖额外后处理或时序平滑,这又增加延迟或引入不自然约束。

为什么难且重要

同时满足多样性与一致性是核心矛盾:多样性要求轨迹峰值分布充分覆盖不同可执行路径,一致性要求相邻动作块之间几何对应、避免抖动。单遍推断还要求模型在一次前向中显式建模多模态轨迹分布,而非依赖采样近似。这在双臂操作、多目标放置等任务中尤为关键,业界正追求低延迟多模态策略以嵌入实时控制回路。

行业类比

类似自动驾驶预测模块需要一次前向输出多个可能轨迹并保持时序稳定,以避免下游规划器跳变。

核心洞察

  • - 单次前向传播同时输出多峰动作候选、概率质量与轨迹尺度,将多模态策略的推理成本从多次采样/集成降低到一次推理,同时保持高覆盖率。 传统多模态策略(如扩散策略、VAE 集成)需要多次去噪或多个模型来表征多峰分布,导致延迟高;CTP 通过 DAPS 在轨迹级别用后验责任和重叠约束专门化峰值,避免模式坍缩,并直接预测尺度以控制动作块范围,在 Push-T 上覆盖率 91.40%,真实机器人推理延迟从 218.24 ms 降至 75.80 ms,证明单次多峰建模的工程可行性。
  • - ETBT 通过交换候选集之间的几何对应实现跨重规划周期的一致性传输,并用证据门控允许当前观测推翻历史约束,解决动作块执行中“多模态与闭环一致性”的核心矛盾。 与固定时间窗口重规划或简单滤波器不同,ETBT 将候选轨迹视为集合,计算最优传输代价来传播历史信念,同时引入证据阈值动态调整权重,使策略在维持连贯行为(如双臂放置到两盘任务中保持两种模式)的同时,能对任务阶段性变化做出响应,在 D3IL 和 LIBERO 上取得高成功率,表明该机制对长时程多模态任务具有泛化价值。

方法

CTP 将多模态模仿学习建模为单遍轨迹峰值预测:输入当前观测 o_t,前向网络一次输出 K 个完整动作块候选,每个候选是一个轨迹峰值(完整动作块)并附带概率质量与轨迹尺度,分别表示该模式的置信度和不确定性。

关键模块

  • DAPS(Distribution-Aware Peak Specialization):训练阶段,使用轨迹级后验职责将演示轨迹分配给不同峰值,并通过质量与尺度调制的重叠约束抑制候选间重叠,保证每个峰值捕获不同可执行模式。
  • 单遍解码与滚动时域执行:推理时一次性生成所有候选,无需迭代去噪或多步采样;执行时根据概率质量选择或融合候选,并在每个控制周期重新规划。
  • ETBT(Evidence-Gated Trajectory Belief Transport):在相邻规划周期之间,对可交换候选集做几何对应(如最优传输匹配),将历史轨迹信念传递到当前候选,同时允许当前策略证据覆盖历史约束,避免过时信息阻碍新模态出现。

输出与差异

输出为动作块候选及其概率质量,执行模块滚动选取动作块。与扩散策略等迭代生成方法相比,CTP 以单遍计算同时获得多模态覆盖、跨块一致性和低推理延迟,兼顾行为多样性与闭环稳定性。

实验

实验设计

CTP 在 Push-T、D3IL、LIBERO 和真机双臂任务上评估。覆盖分数、成功率和推理延迟为主要指标。

关键发现

  • Push-T 覆盖分数 91.40%
  • D3IL:Avoiding 100.0%、Aligning 79.72%、Sorting-2 84.44%
  • LIBERO 平均成功率 97.25%
  • 真机双臂两盘放置任务全部 50 次成功,保持两种模式
  • 瓶子立起与笔放置成功率与 π_{0.5} 相当,推理延迟从 218.24 ms 降至 75.80 ms

基线对比解读

CTP 以单遍推理实现现有多模态策略的覆盖水平,无重规划循环;对比 π_{0.5},在成功率持平下推理延迟降低约 65%,说明 DAPS 与 ETBT 的设计能在不牺牲多模态行为与闭环一致性的前提下大幅提升效率。

行业影响

落地场景

CTP 适用于需要多模态动作选择 与低延迟重规划 的机器人操作场景。例如:电商仓储分拣 中,机械臂面对同一料箱可预测多种抓取与放置候选,并快速切换;双臂协作装配 中,单次生成多个末端轨迹峰值,保留吸盘/夹爪等多模式;自动驾驶轨迹规划 中,对动态障碍物输出多候选并保持时间一致性。主要替代现有扩散或多头策略中的多次采样。

商业价值

  • 降本:推理延迟从 218 ms 降至 76 ms,单次前向即可生成候选,降低 GPU 占用与能耗,提高机器人节拍。
  • 增收/体验:多模态覆盖(Push-T 91.4%)和成功率高(LIBERO 97.25%)减少失败重试与人工接管,提升自动化率与服务质量。
  • 一致性:ETBT 保证跨 chunk 行为稳定,减少抖动导致的物料损耗。

与现有产品/接口集成

  • 策略头替换:CTP 可作为 VLA 模型(如 π0.5)的轻量替代,输出格式改为“候选动作块 + 概率 + 尺度”,可与现有动作执行器(如 action chunking)对接。
  • 部署:提供 ONNX/TorchScript 导出,支持边缘设备;与 ROS 2 集成,延迟敏感控制回路可用。
  • 数据管线:训练时需轨迹级后验责任,可复用现有模仿学习数据集,无需额外标注。

具体 use case:全球电商仓库的移动操作机器人,抓取杂货放入不同周转箱;工业 3C 装配线上的双机械臂,将柔性排线插入不同端口,保持多模式轨迹。

局限

  • 论文的实验覆盖了 Push-T、D3IL、LIBERO 以及少量双臂真实任务,这些基准的动作维度相对较低,任务时长较短。对于更复杂的全身控制或长时程精细操作,CTP 联合预测多个完整动作块候选及其概率质量与尺度会显著增加输出维度,可能导致训练不稳定和推理内存开销增大。此外,多峰建模对演示数据分布要求较高,若数据稀疏或噪声较大,DAPS 可能难以准确识别有效轨迹峰,从而生成冗余候选或遗漏关键行为模式,影响实际部署的可靠性。
  • ETBT 通过证据门控允许当前策略证据覆盖历史约束,但论文未深入分析在需要强时间一致性的任务中,历史信息被过度覆盖的可能性。当当前观测受到部分遮挡或传感器噪声影响时,证据门控可能错误地削弱历史约束,导致跨块动作切换不稳定。同时,与迭代精炼的扩散策略相比,CTP 的单次前向推理虽然大幅降低延迟,但无法在推理阶段对候选进行逐步细化,对初始峰估计的误差较为敏感,可能在分布外场景下出现性能下降。
  • 论文未系统报告在分布外(OOD)条件下的鲁棒性,例如未见物体、视角变化或外力扰动。DAPS 的重叠约束和轨迹尺度调制引入了额外超参数(如重叠惩罚系数、温度),这些参数可能需要针对不同任务进行调优,但论文缺少灵敏度分析,增加了实际调参负担。对于需要高成功率和高安全性的工业应用,这种调参复杂性和 OOD 性能不确定性可能阻碍快速部署。
论文Di Wu2026-10-05原文

相关内容