DreamTraj: 通过读取未渲染的视频扩散潜变量生成 6-DoF 物体轨迹
物体轨迹预测是连接感知与操控闭环的关键,但现有进展受限于两方面:可用数据集缺乏细粒度的语言-运动标注,且现有预测器要么依赖视频、深度或 CAD 模型等特权输入,要么通过代价高昂且易错的感知流程从生成的视频中恢复运动。为弥补监督鸿沟,我们提出 MOVE 数据集,包含 5,038 条以物体为中心的自我中心轨迹,每条轨迹配套细粒度自然语言指令,而非粗略的动词-名词标签。 进一步提出 DreamTraj,它仅凭单张 RGB 图像和任务指令即可预测 6-DoF 物体轨迹,推理时无需视频、深度或 CAD 模型:不生成视频,而是从冻结的图像到视频扩散模型在早期去噪步骤的内部表示中读取运动。轻量级的 流匹配 Reader 将查询-键注意力轨迹和池化隐藏状态解码为相对 6-DoF 位姿。据我们所知,这是首个直接从中间视频扩散表示而非生成像素中解码物体 6-DoF 轨迹的方法。 在平移和旋转预测上,DreamTraj 相较于消耗多帧或特权输入的预测器均达到新最佳水平,并且比“先生成后提取”流程快 4.6 倍。
论文精读
TL;DR DreamTraj 首次从冻结视频扩散模型的潜在表示中直接解码物体 6-DoF 轨迹,仅需单目 RGB 和指令,免去生成视频的昂贵流水线,速度提升 4.6 倍且精度刷新 SOTA。
问题
问题背景
在机器人操控任务中,从感知输入预测被操作物体的 6-DoF 运动轨迹,是闭合感知-动作回路的关键环节。当前领域高度关注如何仅依靠单帧 RGB 图像与自然语言指令,端到端地推断出物体未来的连续位姿变化,以支撑通用化、语义驱动的操作策略。
现有方法局限
现有方案存在两方面瓶颈:
- 数据标注粗糙:主流数据集仅提供“动词-名词”形式的粗粒度标签,缺乏细粒度的语言-运动对齐,难以捕捉指令中丰富的动作描述与真实轨迹之间的映射。
- 预测器依赖特权输入:已有模型要么需要未来视频帧、深度图或 CAD 模型作为先决条件,在真实场景中无法获取;要么采用“先全量生成视频,再通过感知管线抽取运动”的级联方案,计算开销大且易受重建误差影响,生成的轨迹平滑度与物理合理性均不理想。
为什么这个问题难且重要
从单张图像和指令直接预测 6-DoF 轨迹,本质上要求模型具备极强的物理先验与语义推理能力——既理解物体几何、场景约束,又把握指令隐含的操纵意图。传统方法因缺乏细粒度监督而难以泛化,而视频生成模型虽蕴含丰富运动先验,但被限制在像素空间输出,运动提取需额外后处理。突破点在于直接复用冻结的视频扩散模型中间表示,避免生成像素级视频,这不仅能大幅提升效率(速度比生成-抽取管线快 4.6 倍),更首次证明了扩散模型内部注意力特征已编码可解码的 6-DoF 运动信息,对资源受限的实时操控系统具有重要实用价值。
行业类比
这与从大语言模型中间层隐状态解码结构化知识的思路相似——不依赖最终输出解析,而是直接读取网络内部形成的世界表征,从而降低延迟并避免累积误差。
核心洞察
- DreamTraj 将冻结的视频扩散模型作为一个隐式运动先验库,不生成视频像素,而是直接从去噪早期的查询-键注意力轨迹与池化隐藏状态中解码 6-DoF 物体轨迹。这种“读取而非生成”的思路避免了传统 generate-then-extract 管线中昂贵的像素渲染与结构提取步骤,推理速度提升 4.6 倍,同时消除了像素域误差传播,为机器人操纵中的实时轨迹预测提供了新范式。
- 利用多头注意力轨迹作为连续运动信号,DreamTraj 首次证明扩散模型内部的查询-键关联在时序上编码了物体部件或关键点的相对运动模式。通过轻量流匹配 Reader 直接将注意力轨迹映射到位姿变化,无需额外的 3D 监督或 CAD 对齐,是对视频扩散模型内部表征能力的一次深度挖掘。
- MOVE 数据集以 5,038 条自我中心轨迹并配以细粒度自然语言指令,填补了现有数据集中语言到运动精细标注的空白。相比仅提供粗粒度动词-名词标签的基准,MOVE 让模型能学习更复杂的任务语义与运动关联,为语言驱动操作预测提供了更贴近真实场景的监督信号。
方法
DreamTraj 以单帧 RGB 图像与任务指令为输入,输出物体在未来时窗内的 6‑DoF 轨迹(相对位姿序列)。其核心思路是直接从冻结的视频扩散模型内部表征中“读出”运动,而非先渲染视频再后处理。
输入与条件
- 视觉输入:单张第一人称 RGB 图像,无需深度、多帧视频或 CAD 模型。
- 语言条件:细粒度自然语言指令(如“向左推开抽屉”),通过 CLIP 文本编码器注入扩散模型。
关键模块:冻结的视频扩散先验 + Flow‑Matching Reader
- 视频扩散先验:采用预训练的 图像‑到‑视频扩散模型(冻结权重),以输入图像和文本指令为条件,执行少量正向扩散步骤将图像映射至早期噪声潜变量,然后启动反向去噪过程。在极早期去噪步(如第 2~5 步)即停止,从 Transformer 层中提取两类运动线索:
- Query‑Key 注意力轨迹:跨帧注意力图隐含物体的对应关系与运动趋势。
- 池化隐藏状态:经跨帧池化后的全局时序特征,编码动作上下文。
- Flow‑Matching Reader:一个轻量 Transformer 解码器,以收集到的注意力轨迹和池化状态为条件,通过 流匹配(flow matching)生成一系列相对 6‑DoF 位姿(平移向量与旋转四元数)。训练时以真实动捕轨迹为目标,采用流匹配损失直接回归位姿变化量。
训练策略
- 扩散模型完全冻结,仅优化 Reader 参数,避免灾难性遗忘并保持运动先验的通用性。
- 联合使用注意力特征与隐藏状态两种表示域,增强对局部对应与全局时序的双重捕捉。
与生成‑后提取范式的关键差异:DreamTraj 不生成像素级视频,绕开了费时的渲染与易出错的位姿估计流水线,推理速度提升 4.6 倍,且仅凭单图即达到超越多帧或特权输入预测器的精度。
实验
实验设计
DreamTraj 在自建 MOVE 数据集(5,038 条第一人称物体操纵轨迹,配细粒度自然语言指令)上进行评测。 输入仅为单张 RGB 图像与任务指令,预测 6-DoF 物体位姿序列。 对比基线包括:
- 需要多帧观测或特权信息(深度、CAD 模型)的经典预测器
- 生成视频再提取轨迹的 “generate-then-extract” 流水线 评估指标为平移与旋转的 ADE/FDE,并分析推断速度与不同模块(注意力头、去噪步数)的影响。
关键发现
- 仅靠图像与语言即可超越特权输入方法:DreamTraj 在平移和旋转精度上均达到 SOTA,尤其旋转估计大幅领先基线。
- 从视频扩散潜空间直接读出运动有效且高效:无需生成像素视频,直接解码中间注意力特征与池化隐藏状态,获得平滑的 6-DoF 轨迹,推断速度比 generate-then-extract 方案快 4.6 倍。
- 早期去噪步骤与特定注意力头是关键:实验表明,使用第 5 步去噪产生的注意力跟踪效果最佳,不同头对推测不同运动分量有分工,验证了潜空间内蕴含丰富运动先验。
基线对比解读
传统预测器强依赖多帧时序或几何信息(深度、CAD),限制了部署场景。DreamTraj 消除了这些依赖,直接从冻结的视频扩散模型中提取运动信息,不仅减少感知环节的错误累积,还极大降低了计算开销。 与 generate-then-extract 流水线相比,DreamTraj 避免了逐像素生成未来帧的昂贵过程,也规避了视频生成模型可能出现的结构失真或时间不一致问题。这使其更适用于需要实时规划与闭环控制的机器人操作任务。
行业影响
落地场景
DreamTraj 仅需单张 RGB 图像与自然语言指令即可预测物体 6-DoF 操作轨迹,不依赖视频、深度或 CAD 模型。该能力可嵌入以下产品与业务:
- 机器人操作与物流自动化:为机械臂提供实时运动预测,用于分拣、装配、移动操作等场景。
- 仿真与合成数据生成:快速生成物体操作轨迹以增强仿真环境的多样性,降低人工标注成本。
- AR/VR 内容创建:根据语音或文本指令自动生成虚拟物体的交互动画,简化内容生产流程。
- 人机交互与辅助系统:通过理解用户指令预测物体如何移动,辅助远程操作或培训。
商业价值
- 降本:摆脱对深度相机、CAD 模型或多目视觉的依赖,硬件成本显著降低;同时用冻结的视频扩散模型读取中间特征,避免了昂贵且易错的“生成视频-再解析”管线,推理速度提升 4.6 倍,计算资源消耗更少。
- 增收:制造商可将此技术集成到协作机器人产品中,提供更智能的“指哪打哪”操作体验,提升产品溢价;仿真公司可将其作为自动生成轨迹的工具出售或授权。
- 体验提升:在消费级 AR 眼镜中,用户只需说出指令(如“把杯子推过来”),系统便能实时预测并渲染流畅的物体运动,交互的自然度与即时性大幅改善。
与现有产品 / 工作流的接口
DreamTraj 可作为一个轻量级预测模块,通过标准 API 接入现有视觉-行动循环:
- 输入:单帧 RGB 图像 + 文本指令。
- 输出:未来 T 步的相对 6-DoF 位姿序列。
- 集成方式:可在机器人控制架构中替代基于多帧跟踪或点云的预测器,与运动规划器(如 MoveIt)直接对接,或将预测轨迹作为反馈修正抓取策略。
- 在仿真平台(如 Isaac Sim)中,DreamTraj 可作为数据合成插件,根据指令批量生成多样化的物体运动增强数据集。
具体落地用例
- 电商仓储拣选:移动操作机器人接到“将红色盒子从货架 A 推到传送带 B”的指令后,只需当前相机画面即可预测出盒子被推动过程中的空间轨迹,从而规划自身运动,无需提前扫描物体模型或深度信息。
- 远程手术辅助:在远程操作场景下,医师通过语音描述器械的移动意图(如“向右倾斜镊子并轻推组织”),手术机器人可从二维内窥镜图像中实时推断器械的 6-DoF 微调轨迹,降低延迟与感知负载。
局限
- 对预训练视频扩散模型的依赖性是 DreamTraj 的一个关键局限。该方法依赖于冻结的图像到视频(I2V)扩散模型提供运动先验,该模型在互联网规模的视频数据上训练,可能偏好常见运动模式,对长尾操作任务(如精细工具使用、特殊物体交互)的泛化能力有限。如果扩散模型内部表示缺乏对特定操作动作的准确编码,解码的 6-DoF 轨迹可能不准确或不合物理。此外,预训练模型可能携带数据偏见或不可控的运动生成特性,影响预测的鲁棒性。
- MOVE 数据集虽然提供了细粒度指令标注,但规模仅为 5038 条轨迹,可能不足以覆盖多样化的操作场景。数据集主要关注自我中心视角和有限的物体类别,可能导致模型在第三人称视角或未见过的物体类别上性能下降。此外,数据集的构建依赖于生成式增强和轨迹提取管道,可能引入噪声和系统性误差,影响预测精度和泛化能力。
- DreamTraj 仅使用单张 RGB 图像作为视觉输入,限制了其处理动态场景和部分可观测状态的能力。操作任务中物体的初始速度、受力等动力学信息无法从单帧推断,可能导致轨迹预测在需要精确动力学推理的任务中表现不佳。同时,当物体被严重遮挡或与背景纹理相似时,视觉特征提取可能失败,导致轨迹预测退化。论文未讨论在多对象交互或人机协作等复杂场景下的扩展性。