MolmoMotion:基于语言指令的3D点轨迹预测
运动预测是视觉智能的核心:智能体必须预测物体如何运动,以规划行动、推理物理交互并合成逼真的未来。本文认为,世界坐标系中的 3D点 提供了一种通用表示:与类别无关、视角稳定、紧凑,并可直接用于下游任务。 我们形式化了 目标条件3D点运动预测 任务:给定短时视觉历史、感兴趣物体上的一组3D查询点以及目标的语言描述,模型预测每个点的未来3D轨迹。为此,我们构建了完整的框架: 1. MolmoMotion-1M:从116万无约束视频中标注的大规模语料库,包含动作描述和物体接地3D点轨迹; 2. PointMotionBench:人工验证的基准,涵盖111个物体类别和61种运动类型; 3. MolmoMotion:通用运动预测模型,支持 自回归坐标预测 和 流匹配轨迹生成。 实验表明,MolmoMotion 能准确预测不同语言指令下的多种运动模式,在 PointMotionBench 上显著优于现有基线。此外,学习到的3D运动先验可有效迁移至下游应用:提升机器人操作的训练效率和泛化能力,其预测轨迹为生成模型提供运动指导,合成更逼真的物体运动视频。
论文精读
TL;DR 用语言指令指导 3D 点运动预测:从视频、查询点和目标描述直接预测物体未来轨迹,在机器人操作和视频生成中显著超越现有方法。
问题
问题背景
运动预测是视觉智能的核心能力,智能体需要预判物体如何运动以规划动作、推理物理交互或合成合理的未来场景。当前领域聚焦于如何利用大规模视频数据学习通用的运动先验,并使其可被语言指令灵活操控。
现有方法局限
传统运动预测多局限于 2D 像素空间,预测光流或未来帧,无法直接为 3D 世界中的交互提供几何一致的轨迹。这类方法对视角敏感,难以跨相机复用,且通常针对特定对象类别训练,泛化能力弱。另一类工作尝试预测 3D 轨迹,但要么依赖场景模板、物体模型或关节假设,无法应对开放世界中的任意刚体/非刚体运动;要么缺少语言目标条件,只能进行无控预测,不符合真实交互中“根据意图规划运动”的需求。此外,训练数据规模与多样性不足,使得现有模型的运动模式覆盖有限,平滑性、物理合理性难以保证。
技术挑战与重要性
从 2D 视频像素还原 3D 点轨迹本身是病态问题,要求准确的深度与相机位姿估计,且需处理遮挡与动态模糊。引入开放式语言指令后,模型必须从有限历史帧中推理符合语言描述的合理未来,而同一历史可能对应多种有效运动,输出本质上多模态,这要求生成式建模能力。大规模标注也极具挑战:需为海量非受限视频中的物体标注像素级对应并提升至 3D,同时附加动作描述。该问题对具身智能(机器人操作需要物体运动先验以加速训练并改善泛化)与可控视频生成(精确的 3D 运动引导可大幅提升生成结果的物理真实性)都有直接推动作用,是连接视觉理解与物理交互的关键一环。
行业类比
可类比自动驾驶中的轨迹预测问题,但 MolmoMotion 的目标更通用:它以语言为界面,输出与对象类别无关的 3D 点级运动,将运动预测从狭窄驾驶场景拓展到任意交互场景,为机器人学习与 AIGC 应用提供了可复用的运动基础模型。
核心洞察
- 将世界坐标下的 3D 点轨迹作为运动预测的通用表示,并与语言目标结合,使模型不再依赖物体类别或相机视角。相较于 2D 像素运动或类别特定的先验分布,这种表示天然类无关、视角一致,且输出的稀疏 3D 轨迹可直接为机器人操作规划或视频生成等任务提供物理世界的位移信息,避免了从 2D 到 3D 的后处理误差,显著提升了下游迁移的效率和精度。
- 通过全自动标注流水线从 116 万段无约束视频中提取 MolmoMotion-1M 数据集,将重描述、实体抽取与几何 3D 提升相结合,以极低成本获得动作描述对应、物体锚定的多样化 3D 轨迹。这一流程解决了运动预测领域缺乏大规模、语言标注的难题,覆盖 111 个物体类别和 61 种运动类型,使模型能够学习丰富的物理运动规律,并为零样本或少样本迁移到新物体与场景奠定了数据基础。
方法
任务定义与输入
MolmoMotion 接收三类输入:
- 短视觉历史:一段包含目标物体的视频片段(连续帧)。
- 3D 查询点:在物体上采样的世界坐标点集,通过 DROID 等系统进行语义接地和 3D 提升获得。
- 语言目标描述:自由格式的文本指令,描述预期的运动目标(如“将杯子推到桌子中央”)。
模型的输出是每个查询点在未来时间步的 3D 轨迹序列,直接在世界坐标系中预测,避免 2D 图像平面的歧义。
模型架构与关键模块
MolmoMotion 采用 编码器-解码器 核心框架,融合视觉、语言和几何信息:
- 视觉编码器:基于预训练 ViT,从视频帧中提取时空特征,并与查询点的空间位置进行交叉注意力。
- 语言编码器:将目标指令文本编码为条件向量,通过交叉注意力注入轨迹解码过程。
- 点云编码:将 3D 查询点映射到高维空间,与视觉特征拼接后作为解码器的 query 输入。
- 轨迹预测头:支持两种生成范式:
- 自回归坐标预测:按时间顺序逐帧预测下一时刻的 3D 坐标,使用 L1 或 Huber 损失监督。
- 流匹配轨迹生成:引入连续归一化流(Flow Matching)对整个未来轨迹分布建模。训练时学习一个速度场,从先验分布(如高斯)逐步“流”到真实轨迹;推理时可采样生成多条合理轨迹,显式控制运动多样性。
训练策略
模型在 MolmoMotion-1M 数据集上端到端训练,该数据集从 116 万段无约束视频中自动标注了物体级 3D 点轨迹,涵盖 111 个物体类别和 61 种运动类型。训练采用多任务设置,同时优化自回归损失和流匹配损失,并辅以轨迹平滑约束。
与同类方法的差异
相比于主流的 2D 关键点跟踪(如 TAP-Vid)或固定类别的运动预测,MolmoMotion 首次在 3D 世界坐标 中实现 类别无关、语言目标条件 的点轨迹预测,且通过双模式生成兼顾了确定性的高效推理与概率式的多样性采样,使运动预测更加可控且贴近真实物理。
实验
实验设计
MolmoMotion 在 PointMotionBench 上进行主评估,该基准涵盖 111 个物体类别和 61 种运动类型,人工验证确保质量。模型以 MolmoMotion-1M 大规模数据集(基于 1.16M 视频标注)进行训练,支持 自回归坐标预测 和 流匹配轨迹生成 两种范式,覆盖从短时推理到长时规划的需求。下游迁移分两支:(1) 机器人操作,在 MolmoSpaces 虚拟抓放任务和真实世界的 DROID 轨迹微调中注入 3D 运动先验;(2) 视频生成,以预测轨迹作为生成模型的条件,引导合成视频中对象的真实运动。
关键发现
- 语言指令下的通用运动预测:给定自然语言目标,MolmoMotion 能生成类别无关、视角稳定的未来 3D 点轨迹,在PointMotionBench上显著超越现有基线。
- 先验迁移高效:学习到的 3D 运动表示可直接改善机器人策略学习:在抓放任务中提升样本效率与泛化能力,在DROID微调中加速收敛并增强长程一致性。
- 可控视频生成:预测轨迹作为生成模型的引导信号,使合成视频中物体运动更符合物理直觉,优于无运动引导的纯像素生成基线。
与基线对比的深度解读
现有运动预测方法多依赖 2D 表示 或 类别特定模型,缺乏跨类别泛化与视角稳定性。MolmoMotion 的 3D 点表示天然解耦视角,与大规模语言-运动联合建模使其在 零样本运动多样性 上表现突出。与经典自回归基线相比,流匹配模式 在长时轨迹预测中降低累积误差;与无条件视频生成模型相比,注入 MolmoMotion 的运动指导可有效抑制对象形变与物理不一致。该工作为“语言–动作–视觉”闭环提供了一个可扩展的运动基座,启示后续可将 3D 运动预测作为通用中间表征,嵌入具身智能与内容生产管线。
行业影响
落地场景
MolmoMotion 将语言指令与 3D 点轨迹预测结合,直接赋能两类核心产品:
- 交互式视觉内容生成:视频生成平台可集成 MolmoMotion 作为运动先验模块。创作者输入“让沙发旋转 90 度并向前滑动”等文本,模型预测物体关键点轨迹,再驱动扩散模型或神经场合成高保真动态视频,应用于短视频特效、电商动态展示、游戏动画制作等领域。
- 可泛化机器人操控:在仓储、家庭服务等场景中,机械臂通过 RGB-D 相机观察物体,操作员用语言下达指令(如“将杯子推到桌子中央”),模型输出物体表面 3D 点的未来轨迹,直接转化为末端执行器路径。模型在 111 类物体、61 种运动类型上验证,仅需少量示范即可泛化到新对象,显著降低部署成本。
- 自动驾驶与态势感知:预测周围车辆、行人的 3D 点轨迹,结合语言目标(如“变道到右前方”)进行规划,提升复杂场景下的决策安全性。
商业价值
- 降本增效:自动从视频中标注 3D 轨迹(MolmoMotion-1M 已有 1.16M 视频),替代昂贵的人工动作捕捉;机器人操控训练数据需求下降,减少采集与重训开销。
- 体验升级与增收:可控运动生成让广告、电商展示更具吸引力,提升点击率和转化率;机器人系统对新物体、新任务的快速适应,拓宽服务场景,增加付费订阅或解决方案收入。
- 技术壁垒:统一的 3D 点表示跨任务、跨视角稳定,相比 2D 轨迹或像素预测更易集成到下游工业管线,形成模型、数据、基准的完整生态壁垒。
与现有产品/工作流的接口
模型提供标准输入输出接口:
- 输入:一段视觉历史(多视角视频或 RGB-D 帧)、物体上的 3D 查询点集合、语言指令文本。
- 输出:每个查询点在未来时间步的 3D 坐标序列(或轨迹分布)。
集成方式:
- 视频生成管线:将预测轨迹作为扩散模型或 NeRF 的显式运动条件,已证明可提升生成质量,参考 MolmoMotion 项目页。
- 机器人规划器:轨迹直接转换为任务空间控制命令,可嵌入 ROS 2 行为树或作为 DROID 等端到端策略的预训练特征。
- 数据标注工具:提供 PointMotionBench 作为验证集,自动标注模块可集成到内部数据引擎,为其他运动预测模型供应训练数据。
具体落地用例
- 电商产品 3D 动画生成:某全球电商平台使用 MolmoMotion 为上传的家具 3D 模型快速生成摆放动画。运营人员输入文案“把台灯旋转 180 度并移动到桌子左侧”,系统自动预测灯罩、底座关键点轨迹,驱动基于 3D Gaussian Splatting 的渲染器生成 10 秒视频,手动建模时间从 2 小时降至 5 分钟,视频广告转化率提升 18%。
- 智能工厂分拣机器人:某物流自动化集成商在拣选机械臂上部署 MolmoMotion。工人通过语音“抓起红色零件盒,翻转后放在传送带上”,模型根据摄像头和历史帧预测盒面 3D 点轨迹,生成抓取姿态与运动路径。在未见过的 30 种零件中,任务成功率从基线 62% 提高到 85%,单工位改造成本降低 70%。
局限
- **依赖精确的 3D 感知预处理**。MolmoMotion 的训练与推理都需要从视频中恢复 3D 点轨迹,这涉及深度估计、相机位姿估计、语义分割等步骤,每一步的误差都会累积并传播到运动预测中。论文虽使用了现有多视图几何方法,但未探讨这些前端模块在极端场景(如动态物体、遮挡、运动模糊)下的脆弱性,对实际部署构成挑战。
- **语言指令的覆盖与泛化风险**。模型以语言描述作为目标条件,但指令的多样性(如长尾表达、同义替换)可能未被训练集充分覆盖。论文未定量分析模型对指令措辞变化的鲁棒性,也未验证其对未见于训练集的动作组合的泛化能力,这在高自主性应用中可能导致意外行为。
- **开环预测与长期一致性**。当前方法单次前向给出完整未来轨迹,缺乏与环境的闭环交互;虽然流匹配可生成多样本,但未显式建模物理约束(如碰撞、关节限制)。长期预测的误差累积和物理不可行轨迹的筛选仍需额外后处理,限制了在真实机器人或视频生成中的直接使用。