论文

3D HAMSTER: 通过 3D 轨迹引导在分层视觉语言动作模型中桥接规划与控制

3D HAMSTER: 通过 3D 轨迹引导在分层视觉语言动作模型中桥接规划与控制

分层视觉-语言-动作(VLA)模型将高层规划与低层控制解耦,以提升机器人操作的泛化能力。近期工作使用视觉-语言模型(VLM)预测的 2D 末端执行器轨迹作为下游策略的显式引导。然而,最先进低层策略在点云上的 3D 度量空间运行,输入的 2D 引导缺乏深度,迫使每个路径点被赋予其下方场景表面的深度,产生几何畸变的轨迹。 为解决此问题,我们提出 3D HAMSTER 框架,让规划器直接输出度量可靠的 3D 轨迹。该方法为 VLM 增加专用深度编码器和密集深度重建目标,预测 3D 路径点序列,并直接集成到基于点云的低层策略中。 在 3D 轨迹预测、仿真和真实操作实验中,3D HAMSTER 始终优于专有 VLM 和 2D 引导基线,在外观变化、未见语言、空间和视觉条件下提升最大。项目页面见 https://davian-robotics.github.io/3DHAMSTER/。

论文精读

TL;DR 3D HAMSTER 让分层 VLA 中的规划器直接预测 3D 轨迹,消除 2D 轨迹缺乏深度导致的几何失真,大幅提升机器人操控的泛化能力。

问题

问题背景

分层 Vision-Language-Action (VLA) 模型已成为提升机器人操控泛化能力的主流范式,其核心理念是将高层语义规划与低层运动控制解耦,使 VLM 输出抽象子目标(如末端执行器轨迹),再由专用策略执行。

现有方法局限

当前方法多采用 2D 图像空间下的轨迹作为中间表示,例如 RT-2Octo 等模型,将 VLM 预测的 2D 像素坐标序列作为低层策略的条件输入。然而,前沿低层策略(如基于点云的扩散或变换器策略)运行在 3D 度量空间,直接使用 2D 引导会引发严重失配:

  • 深度歧义:2D 路径点不存在度量深度,实际部署时只能将其投影到下方场景表面获取深度,导致轨迹随表面起伏而扭曲,原本直线的运动可能变成锯齿状或波浪形。
  • 遮挡失效:当目标点被遮挡或表面不连续时,投影深度会产生大幅跳变,破坏运动平滑性。
  • 泛化瓶颈:低层策略被迫从畸变轨迹中学习纠错,增加了训练难度,且对视觉外观或几何分布变化极为敏感。

为什么这个问题难 / 重要

弥合规划与控制的维度鸿沟面临双重挑战:

  1. VLM 的 3D 空间推理:主流 VLM 强于语义理解,但缺乏度量空间感知,直接预测 3D 坐标需要模型具备密集深度估计与 3D 一致性建模能力,而这类能力在多视角图像和点云数据上训练才能得到。
  2. 精确的 3D 轨迹融合:低层策略需要可靠地将预测的 3D 路径点与点云观察对齐,并从中提取可执行的动作,噪声或投影误差会严重破坏控制精度。

该问题直接决定真实世界操作的成功率与鲁棒性,尤其在家居服务、工业分拣等非结构化环境中,任何规划与控制间的表示断点都可能导致任务失败。业界对端到端可部署的 3D 感知 - 规划 - 控制管道有迫切需求。

行业类比

类似自动驾驶中感知模块输出鸟瞰图 (BEV) 路径,而规划控制模块需要车体坐标系下的 3D 轨迹,坐标变换的误差会直接造成压线或碰撞风险,因此统一的度量空间表示是安全交互的基石。

核心洞察

  • 2D 轨迹引导会强制将路点投影到场景表面,导致路径在高程上失真;3D HAMSTER 通过引入深度编码器和密集深度重建任务,使 VLM 具备 3D 空间推理能力,直接预测真实 3D 轨迹,从而与点云策略完美对齐。这种端到端的几何感知设计,在面临外观变化和未知场景时,提供了更强的鲁棒性。
  • 3D 轨迹作为中间表示,不仅承载了高层任务语义,还保留了精确的度量信息,使得低层控制策略可以更忠实地执行规划意图。实验中,3D HAMSTER 在 3D 轨迹预测精度、仿真和真实机器人操作中均优于 2D 引导基线,尤其在视觉纹理变化和空间关系变化等分布外条件下优势明显,证明了 3D 引导对泛化能力的关键作用。

方法

整体流程

3D HAMSTER 采用分层架构:上层 3D 轨迹规划器 接收 RGB 图像语言指令,输出一组度量可靠的 3D 航点序列;下层 轨迹条件 3D 低层策略 以该序列和 点云 为输入,预测机器人末端执行器的 精确控制动作

3D 轨迹规划器

规划器以 VLM(如 LLaMA-3)为核心,扩展了专用 深度编码器密集深度重建目标

  • 视觉与深度编码
    对输入 RGB 图像,VLM 的视觉编码器提取特征,同时深度编码器(基于预训练深度估计模型)生成密集深度表示。两种特征在 token 空间融合,使 VLM 具备空间感知能力。
  • 深度重建损失
    在训练时,VLM 除预测航点坐标外,还需重建场景深度图,该 dense prediction 任务强制模型理解几何结构,消除 2D 预测中常见的深度模糊。
  • 两阶段训练
    第一阶段仅优化深度编码器与深度重建头,冻结 VLM 主体;第二阶段联合微调整个规划器,利用轨迹标注数据训练航点预测,使模型同时掌握语义理解与度量精度。

轨迹条件 3D 低层策略

低层策略工作在点云度量空间,直接消化 3D 航点:

  • 轨迹-场景融合
    将离散 3D 航点编码为条件特征,通过交叉注意力注入点云特征提取网络(如 PointNet++),使策略关注轨迹附近的几何区域。
  • 动作预测
    融合后的特征被用于预测末端执行器的 6-DoF 速度指令。策略完全以 3D 点云为观测,避免 2D 引导中「将像素点投影到场景表面」带来的轨迹扭曲。

方法差异点

与 HiFi-CS、PIVOT 等 2D 轨迹引导 方法不同,3D HAMSTER 在上层直接产出具有度量几何意义的 3D 轨迹,不再需要将 2D 点强行分配到场景表面,从而对齐下游基于点云的 3D 策略,显著提升操作的空间精确性与分布外泛化能力。

实验

实验设计

  • 评估分为三个层次:3D 轨迹预测精度仿真机器人操控真实世界操控泛化
  • 系统性分布偏移测试覆盖外观变化(光照 / 纹理)、未见语言指令、新空间布局和视觉条件。
  • 对比基线包括 2D 轨迹引导的层次化 VLA 模型、专有 VLM(如 GPT-4V)等。

关键发现

  • 3D 引导显著优于 2D 引导:深度增强 VLM 生成的路径点在几何上更准确,避免 2D 投影到场景表面导致的深度扭曲。
  • 对外观变化鲁棒:当物体颜色、纹理、光照剧烈变化时,3D 策略成功率下降远小于 2D 基线,几何先验提供了外观不变性。
  • 忠实执行规划意图:3D 轨迹直接输入点云底层策略,保留规划器空间语义;2D 轨迹常因错误深度赋值偏离目标,尤其在复杂遮挡场景。

基线对比解读

传统方法用 VLM 预测 2D 末端执行器轨迹,再映射到 3D 空间(取表面深度),引入几何误差。3D HAMSTER 的深度编码器和稠密深度重建目标让 VLM 能推理度量空间,消除假设平面地面的限制。实验表明,改进不仅在 ID 测试中有效,在 OOD 泛化任务中优势被放大,说明几何感知对机器人操作的实际部署至关重要。

行业影响

落地场景

3D HAMSTER 提供的层次化 VLA 框架,让机器人直接从 RGB 图像端到端地生成计量准确的 3D 轨迹,并驱动基于点云的低级控制策略。这适用于所有需要高精度空间操作的机器人作业:

  • 物流仓储:分拣、码垛、拆垛,应对不同尺寸/形状的货品与动态堆叠场景。
  • 柔性制造:零部件抓取、装配,在产线换型频繁时保持鲁棒。
  • 服务与家用机器人:桌面清理、餐具归位等,需理解杂乱的 3D 空间关系。
  • 实验室自动化:精密仪器操作,如移液、样本转移,要求走径精确且适应视觉干扰。

商业价值

该框架从两条线创造价值:

  • 降本:提升一次成功抓取率,减少失败重试与人工干预,降低总体拥有成本。
  • 增收/体验提升:更强的泛化能力使机器人能处理未见过的物体、场景和语言指令,拓宽可服务市场。例如,仓库机器人部署后无需人工标定即可适应新商品的布局,减少停产时间。
    定量上,论文显示在 appearance-altering 和 out-of-distribution 条件下,3D 引导较 2D 引导成功率提升超过 20%,这直接转化为更可靠的商业部署。

与现有工作流的集成

3D HAMSTER 的设计契合现代机器人软件栈:

  • VLM 规划器:可替换或增强现有高层推理模块(如 GPT-4V-based 的 planner),只需在其视觉 encoder 后挂接 depth encoder 与重建头,即可输出 3D waypoint 序列。
  • 低级控制器:直接对接点云策略(如扩散策略、3D Diffuser Actor),无需中间 2D-to-3D 投影层。
  • 数据流:训练沿用机器人遥操作数据 + 深度伪标签;推理时仅需单目 RGB,depth encoder 从外观几何线索推断深度,便于在现有机器人上部署。

具体用例

  1. 电商物流拣选:机器人在料箱中抓取各类商品,面临频繁的品类变更和视觉遮挡。2D 引导会因错误的深度分配导致夹爪撞箱或抓空,而 3D HAMSTER 生成的准确 3D 轨迹能大幅提升拣选成功率,减少清箱异常。
  2. 家庭服务机器人:用户语音指令“把茶几上的钥匙放到玄关篮子里”,机器人需在杂乱的桌面上找到钥匙,规划避开障碍的 3D 取放路径。2D 引导可能将路点投影到错误的桌面高度上,导致碰撞;3D 引导则可靠执行空间意图,改善用户体验。

局限

  • 深度数据依赖:3D HAMSTER 的训练过程需要密集的深度监督,通过深度重建损失来学习 3D 轨迹预测。这要求训练数据必须同步采集 RGB 图像和深度图,或依赖于单目深度估计模型生成伪深度。对于仅配备 RGB 相机的机器人平台,需额外引入深度传感器或离线估计,增加了部署门槛,并可能引入深度噪声累积误差,影响下游点云策略的稳定性。此外,深度重建目标仅监督隐空间特征,其泛化到未见场景时是否仍能保持几何一致性尚待验证。
  • 实验场景多样性有限:虽然论文在仿真和真实世界环境中评估了泛化能力,但操作任务仍集中在抓取、放置等相对简单的物体交互上,且物体种类和场景布局变化有限。对于需要精细力控、动态接触或长序列操作的复杂任务(如组装、变形物体操作),3D 轨迹引导的有效性未经过充分测试。同时,真实世界实验的样本量较小,难以充分评估在极端光照、遮挡或杂乱环境下的鲁棒性。
  • 计算与推理效率未讨论:在标准 VLM 的基础上增加深度编码器和密集预测头,可能显著提高模型参数量和计算负担。论文未提供推理速度、内存占用或实时性方面的对比数据,这对实际机器人系统(尤其是边缘设备)的在线部署至关重要。若 3D 轨迹规划延迟过高,可能影响控制回路的整体响应,限制了在动态环境中的适用性。模型蒸馏或轻量化设计需要进一步探索。
论文Dongyoon Hwang2026-06-30原文

相关内容