论文

无需显式轨迹,为 3D Diffusion Policies 学习前瞻能力

无需显式轨迹,为 3D Diffusion Policies 学习前瞻能力

3D diffusion policies 擅长从当前观测生成几何上可落地的动作,但成功操作不仅要知道此刻什么运动可行,还要预判交互将走向何处。现有策略大多把这种前瞻留给动作学习去隐式涌现。 本文提出 Movement Trend Guidance,一种简单却有效的显式前瞻注入方式,且不引入任何显式规划。策略从短观测历史中学习一个紧凑的 latent 表示,用以刻画交互演化;训练时由稀疏的未来 gripper 状态监督该表示,推理时只保留 latent,与当前观测一同作为面向未来的 conditioning。latent 为动作生成提供全局条件,额外的 gated FiLM 分支仅在 UNet bottleneck 处使用。相比 DP3 只增加 3.52% 参数,方法保留了原有的 dense-action 与 receding-horizon 形式。 实验上,该方法在 RoboTwin2.0、LIBERO-40 和 DexArt 上稳定优于 DP3: 1. 50 任务 RoboTwin2.0 混合训练:62.8% vs. 56.1% 2. LIBERO-40:71.93% vs. 37.08% 3. 五个真机任务:72.0% vs. 49.0% 结果表明,diffusion policy 只需知道交互正走向何处,而无须被告知具体该往哪移动,即可获得显著收益。

论文精读

TL;DR Movement Trend Guidance 从观测历史学习潜在运动趋势(未来夹爪状态监督),注入 3D 扩散策略,无需显式轨迹。仅增 3.52% 参数,DP3 在 LIBERO-40 上成功率 37.08%→71.93%。

问题

问题背景

机器人操作领域正从单步动作策略转向能够推理任务长期演化的方法。3D diffusion policies(如 DP3)基于点云观测生成几何一致的动作序列,在抓取和灵巧操作上表现突出,但缺乏对交互趋势的显式建模。

现有方法局限

当前策略主要让前瞻性从动作学习中隐式涌现,或引入显式未来轨迹作为条件。隐式方式在长程任务中前瞻不足,导致中间步骤错误累积;显式轨迹方案则需要额外的高质量未来状态标注,且容易过拟合精确路径,破坏扩散模型的生成多样性。此外,显式规划模块往往与稠密动作、滚动时域优化不兼容,增加工程复杂度。

为什么这个问题难/重要

定义和监督“前瞻性”本身很困难:未来交互状态是稀疏、高维且多模态的,直接回归容易模糊;同时必须保持原始扩散策略的结构优势,不牺牲生成质量。工业界对减少显式规划依赖、提升数据效率的机器人策略有强烈需求,因为真实数据采集成本高,且精确轨迹标注更难获得。

行业类比

这与视频预测中学习潜在演化表征而不预测逐帧像素类似:只提供全局趋势引导,让生成模型自行理顺局部时序,从而在控制任务中平衡灵活性与目标导向。

核心洞察

  • Movement Trend Guidance 通过隐式趋势表征为 3D diffusion policy 注入对未来交互走向的预见,而无需显式轨迹预测。 与 goal-conditioned 或显式 waypoint prediction 等 future-guided 方法不同,本工作从一段短观察历史中学习紧凑的 latent 表示 interaction evolution,训练时仅用稀疏的未来 gripper states 监督该 latent,推理时则完全丢弃未来状态,只保留 latent 作为未来导向条件。这一设计使模型在保持 DP3 原有 dense-action 与 receding-horizon 公式的同时,仅增加 3.52% 参数,就能在 RoboTwin2.0、LIBERO-40、DexArt 及真实机器人任务上取得显著提升,证明了隐式未来趋势引导的高效性与通用性。
  • 在 UNet bottleneck 处使用 gated FiLM 分支注入未来趋势条件,实现了未来信息与当前观测的多尺度融合。 区别于常见的拼接未来轨迹或交叉注意力融合,该 latent 同时作为全局条件与 bottleneck 局部条件:全局条件影响整体动作生成,而 bottleneck 处的 gated FiLM 对中间特征进行调制。这种双路注入方式既保证了未来趋势对扩散去噪过程的深层影响,又避免了在输入或输出端引入额外序列带来的计算负担,使模型能够保留原始几何动作生成优势,同时获得对未来交互走向的敏感度。

方法

输入:从短观测历史(如最近若干帧点云或状态)提取特征,编码为紧凑的潜在向量 z_trend,表示交互演变趋势。训练时,利用稀疏的未来夹爪状态(如未来几步的末端位置)作为监督信号,使 latent 能够预测交互走向;推理时仅使用 latent,无需未来信息。

关键模块:latent 以两种方式注入扩散策略。一是作为全局条件与当前观测结合,影响整个去噪过程;二是在 UNet 的 bottleneck 处引入 gated FiLM 分支,通过可学习的门控参数对特征进行调制,强化趋势引导并保持原始特征表达能力。

输出:仍输出 dense action 序列,保持 receding-horizon 控制,不改变原有动作空间。训练时在 diffusion 损失之上加入 latent 预测未来状态的辅助损失,整体参数仅增加 3.52%。

与同类方法的差异:不依赖显式轨迹或目标点,仅通过学习隐式运动趋势 latent 提供前瞻性,以极低成本提升策略对交互方向的感知。

实验

实验设计

Movement Trend Guidance 在 RoboTwin2.0(50 任务混合训练)、LIBERO-40、DexArt 及 5 个真实机器人任务上评估,基线为 DP3。方法保持原有稠密动作与滚动时域规划,仅从短观测历史学习紧凑潜在表示,并经 bottleneck-gated FiLM 注入 UNet。

关键发现

  • 在 RoboTwin2.0 50 任务混合训练中,成功率从 56.1% 提升至 62.8%。
  • 在 LIBERO-40 上提升尤为显著:从 37.08% 提升至 71.93%,提升 34.85 个百分点。
  • 五个真实机器人任务从 49.0% 提升至 72.0%。
  • 参数开销仅 +3.52%,计算效率与部署成本几乎不变。

与基线对比解读

DP3 作为强基线,在复杂多任务场景下缺乏对未来交互趋势的显式建模,导致动作局部最优。本方法以潜在趋势表示作为全局条件,推理时不依赖显式轨迹,避免了额外规划器。在 LIBERO-40 上大幅提升表明,长远运动趋势对长程任务成功至关重要;而参数增量极小,证明该方法能以低成本注入有用的前视信息,为 3D 扩散策略的改进提供了实用路径。

行业影响

落地场景

该方法可直接用于机器人操作的模仿学习系统,尤其适合3D 扩散策略(如 DP3)驱动的复杂交互任务,例如:

  • 物流分拣与仓储自动化:机械臂在动态环境中抓取、放置物体,需要预判交互趋势以优化轨迹平滑度与成功率。
  • 工业装配与精密操作:灵巧手或多指夹爪在狭窄空间内执行插拔、拧紧等动作,提前感知运动趋势可减少碰撞与卡滞。
  • 服务与医疗机器人:辅助进食、递送物品或手术器械操控,未来趋势信息有助于生成更符合人类意图的连续动作。

商业价值

  1. 降本:仅需稀疏未来夹爪状态作为监督信号,无需完整轨迹标注,显著降低数据采集与标注成本。
  2. 提效:在多个基准上平均成功率提升约 10–30 个百分点(如 LIBERO-40 从 37.08% 升至 71.93%),减少试错与重规划次数。
  3. 轻量集成:参数量仅增加 3.52%,推理开销微增,适合边缘设备部署,便于现有机器人产品快速升级。

与现有产品/工作流的接口

  • 可作为 即插即用模块 替换现有 3D 扩散策略中的条件编码部分,保留原始 dense-action 与 receding-horizon 框架,无需重构训练 pipeline。
  • 训练时只需在现有模仿学习数据中补充未来时刻的夹爪位姿标签,推理时仅使用学习到的潜在趋势向量,不引入额外规划模块。
  • 该方法与主流机器人学习栈(如 PyTorch、ROS、Isaac Sim)兼容,可集成到远程操作数据采集 + 离线模仿学习的典型工作流中。

具体落地 Use Case

  • 电商仓库拣选机器人:在传送带动态分拣场景中,机器人需要预测抓取后物体的移动趋势以提前调整姿态,该方法可提高抓取稳定性和吞吐量。
  • 医疗手术辅助机器人:如内窥镜持械臂在操作中需跟随组织运动趋势,使用该技术可生成更平滑、更符合生理预期的器械轨迹,降低术者负担。

局限

  • **训练数据依赖未来 gripper states**:虽然推理阶段不引入额外轨迹,但训练需要稀疏未来 gripper states 作为监督信号。在真实机器人数据收集时,这要求记录未来时刻的末端执行器状态,可能增加标注成本或需在数据管道中额外同步;即使未来状态可从轨迹中提取,稀疏步长的选择(论文中通过消融确定)仍是一个任务相关的超参数,对不同操作任务可能需要重新调整,限制了方法在零样本新任务上的即插即用性。
  • **架构泛化性存疑**:方法仅在 **DP3** 上充分验证,虽然提到跨架构迁移实验,但主要结果和消融都围绕 DP3 展开。其 bottleneck-gated FiLM 注入是针对 **UNet** 结构设计的,若策略网络采用 Transformer 或其他非 UNet 骨干,该调制模块无法直接移植;此外,latent representation 从短观察历史压缩而来,可能丢失细粒度空间关系,在需要高精度接触或复杂物体操控的任务中仍可能失败(论文提到 failure cases 但未详细分析)。
  • **在部分基准上增益有限**:在 RoboTwin2.0 的 50 任务混合训练中,提升为 62.8% vs 56.1%,绝对增益 6.7 个百分点,远低于 LIBERO-40 上 34.85 个百分点的跃升。这表明当 baseline 已经较强或任务多样性高时,该方法带来的 foresight 增益可能被稀释;此外,方法增加 3.52% 参数,虽然不大,但与零额外参数的隐式未来学习(如 sequence model)相比,仍存在额外计算和内存开销,在资源受限的嵌入式部署场景下可能需要权衡。
论文Zhongbo Zhang2026-09-17原文

相关内容