See like a Robot: 面向视觉-语言-动作模型的机器人中心点云图
视觉-语言-动作模型 (VLA) 利用视觉观测和语言指令预测机器人动作,但动作定义在机器人自身三维坐标系中,而观测通常来自相机坐标系,造成观测与动作之间的“帧不匹配”。在固定视角下,模型可记忆单一映射;但大规模数据集聚合了多种相机布置,要求模型跨视角泛化,此时不匹配问题加剧。 本文提出机器人中心点云图 (robot-centric pointmaps):图像像素存储场景点在机器人坐标系下的三维坐标。该表示既提供机器人坐标系下的几何信息,又保持预训练 2D VLA 所要求的密集 H×W 网格,因此可无缝集成现有 VLA,仅需极小架构改动。 在 RoboCasa 数据集上,点云图同时提升了 pi0.5 和 SmolVLA 的性能,并优于代表性的相机视角对齐方法与三维感知基线。真实机器人实验中,当相机被移动到训练时未见过的位置时,点云图相对纯 RGB 策略的优势更加显著。
论文精读
TL;DR 用机器人中心点图(robot-centric pointmaps)将场景3D坐标纳入图像网格,解决VLA中摄像头帧与动作帧不匹配问题,大幅提升跨视角泛化且易集成,在仿真与真实实验中均超越现有方法。
问题
问题背景
VLA(Vision-Language-Action)模型通过海量机器人操作数据学习从视觉和语言到动作的映射,已成为通用机器人操作策略的主流范式。
现有方法局限
多数 VLA 在相机坐标系下观察场景,却需在机器人本体坐标系中输出动作,两者之间存在空间参考系不匹配。在固定相机视角下,模型可记忆观测到动作的单一映射,但当今大规模数据集汇集了不同环境、不同相机安装方式的多视角演示,策略必须泛化这种跨视角映射。现有应对方案主要包括:
- 注入相机外参或深度信息:如通过 Plücker 射线、深度图等告知模型相机姿态,但并未将观测转换到机器人坐标系,仍需模型隐式学习坐标变换,泛化难度大。
- 使用 3D 点云表示:如点云输入加 3D 骨干网络(Point Transformer),能表达机器人坐标系下的几何结构,但与主流 2D 预训练 VLA 架构不兼容,难以复用海量 2D 视觉预训练先验,且会破坏密集网格结构,增加工程复杂性。
为什么这个问题难且重要
真实部署中相机位置难免发生移动或更换,训练阶段见过的视角组合无法穷举。一旦测试时相机放置超出训练分布,基于相机帧观测的 RGB-only 策略性能会急剧退化。技术挑战在于需要一种既能显式提供机器人坐标系 3D 几何、又能保持 H × W 密集图像张量形式的表示,从而无缝融入基于 2D 骨干的 VLA,实现零结构侵入。这关乎机器人学习系统从实验室走向非结构化环境的泛化能力,因此备受学术界与工业界关注。
行业类比
如同自动驾驶中多传感器融合必须将 LiDAR、Camera 等数据统一到自车坐标系(ego frame),否则下游规划控制难以应对传感器位姿变化。
核心洞察
- 用图像形式的机器人中心点图替代 RGB 图像作为 VLA 输入,从根本上统一了观察空间与动作空间的坐标系。已有工作要么在 RGB 输入上条件化相机参数(如 KYC、OC-VLA),要求模型隐式学习跨视角映射;要么引入点云等 3D 表征(如 DP3、PointVLA),但破坏了 2D 预训练骨干的密集网格结构。点图则保持与 2D VLA 兼容的 H×W 张量形状,每个像素存储机器人坐标系下的 3D 坐标,将几何对齐直接刻入输入,最小化架构改动的同时大幅降低多视角泛化的难度。
- 端部执行器中心化(end-effector centering)使点图成为一种视角鲁棒的 3D 观测表示。与全局机器人基座中心化相比,该方法将坐标原点移至当前末端执行器位置,使点图的数值分布在不同相机布置下保持一致,策略不再需要适应坐标系原点的显著变化。这解释了为何训练时视角变化越大,点图相对 RGB 基线的增益越明显,并在未见相机位姿的真实实验中取得优势,为 VLA 在规模化、多数据集场景下提供了一种实用的表示选择。
方法
核心思路:将机器人坐标系的3D几何编码为2D稠密图像
VLA 的输入通常为相机视角的 RGB 图像,但动作在机器人基座或末端执行器坐标系定义。帧间不匹配在固定视角下影响有限,但当训练数据来自多种相机部署位置时,策略难以泛化。本文提出 机器人中心点图 (Robot-Centric Pointmap),将场景点的三维坐标直接编码到机器人坐标系下的 2D 像素网格中,使 VLA 所见即所得。
输入→关键模块→输出
输入:
- 单帧或多帧 RGB 图像(来自眼在手或眼在外相机)
- 对应的深度图(或通过深度估计获得)
- 相机内参
K与外参T_camera→robot(从相机到机器人基座或末端执行器的变换矩阵) - 语言指令
关键模块:机器人中心点图生成
- 对于每个像素
(u,v),利用深度值d反投影到相机坐标系 3D 点:P_cam = K^{-1} * d * (u,v,1)^T - 通过外参变换到机器人坐标系:
P_robot = T_camera→robot * P_cam - 将
P_robot的 (x, y, z) 值归一化后直接写入对应像素位置,形成与输入图像同尺寸的 3 通道点图 (H×W×3) - 可选地,采用末端执行器中心化:坐标相对于当前末端执行器位姿表示,进一步增强视点鲁棒性
- 对于每个像素
点图-RGB 融合
- 将点图与原始 RGB 在通道维度拼接(例如 3 通道 RGB + 3 通道点图 = 6 通道输入),直接送入预训练的 2D VLA 视觉编码器
- 无需修改骨干架构(如 ViT 或 ResNet),仅调整输入层通道数
输出:机器人动作(如末端执行器相对位移、旋转、夹爪开合)
设计选择与验证
- 图像形式 vs. 点云:保持密集 2D 网格可利用预训练 2D 视觉模型的归纳偏置,避免引入昂贵的 3D 骨干(如 Point Transformer)
- 机器人帧 vs. 相机帧:直接将几何提供给策略,使其无需隐式学习相机外参
- 末端执行器中心化:坐标表示相对于执行器,使模型对相机安装位置变化更鲁棒
与同类方法的差异: 不同于 GeoVLA、PointVLA 等需额外相机参数输入或改用 3D 骨干的方案,机器人中心点图将 3D 感知转化为 2D 像素级回归问题,以最小架构改动为现有 VLA 注入视点不变的 3D 几何理解。
实验
实验设计
作者在 RoboCasa 仿真环境与 真实机器人 平台上验证 机器人中心点图 (robot-centric pointmap) 的有效性。基线模型选择当前主流的 VLA 架构 π₀.5 和 SmolVLA,比较对象包括:
- 仅 RGB 输入
- 额外提供相机内外参或 Plücker 射线的相机感知方法
- 使用点云的 3D 感知方法 (Point Transformer v3, DP3 等)
- 近期同类工作 GeoVLA, PointVLA, FP3, OC-VLA
真实实验特别设计了 训练未见过的相机摆放位置,以考察对视角变化的泛化能力。
关键发现
- 坐标系对齐显著提升性能:将观测直接转换到机器人坐标系后,策略无需学习复杂的跨帧映射,在固定相机和多视角设定下均超过 RGB-only 基线。
- 图像形式优于点云:点图保持 H×W 网格结构,无损融入预训练 2D VLA 的像素级特征提取,避免了点云稀疏、不规则带来的信息损失和额外架构改动。
- 末端中心化 (end-effector centering) 带来视角鲁棒:相对于世界坐标系中心,以机械臂末端为基准表示场景几何,使策略更容易迁移到新相机位姿。
- 训练时增加视角随机化,点图优势更突出:在训练过程中混入多样化的相机位置,点图方法的性能衰减远小于 RGB-only 策略。
与基线的对比解读
相机感知方法 (如 Plücker 射线) 试图隐式编码几何,但 2D 像素 + 射线信息 仍要求模型推断三维关系,跨视角泛化时负担重。点云类方法 (如 DP3) 虽提供显式 3D 坐标,却需额外设计点云编码器并处理密度不均匀、感受野受限等问题,且与预训练视觉骨干的兼容性差。点图巧妙融合了两者优点:维持与 RGB 图像相同的张量形状,直接复用大规模预训练权重的 2D 归纳偏置,同时像素值本身即为机器人系下的 3D 坐标,物理含义清晰。这一设计在 RoboCasa 多个任务上均达到最优成功率,真实机器人实验进一步证实:当相机被移动到训练未覆盖的位置时,点图策略仍能维持较高成功率,而 RGB-only 策略急剧退化。
行业影响
落地场景
机器人操作自动化是核心场景,尤其是仓储物流(如电商仓库的拣选、分拣)、制造业(产线上下料、装配)和家庭服务机器人。这些场景中,机器人需根据语言指令执行操作,但摄像头安装位置、机器人本体姿态等常因部署环境而异。Robot-Centric Pointmap 让视觉观察统一到机器人自身坐标系,使得在一种相机布局下训练的 VLA 模型能直接泛化到新的视角,无需重新采集数据或微调,显著降低大规模部署的工程门槛。
商业价值
- 降本:减少每个新部署点必需的场景适应成本(数据采集、标注、重训),一套模型即可跨站点复用,尤其利好机器人即服务(RaaS)企业的规模化扩张。
- 增收:提升操作成功率与鲁棒性,在物流领域可增加单位时间处理单量,在制造业可减少因视觉漂移(如摄像头被意外碰撞)导致的产线停顿。
- 体验/安全提升:在协作机器人场景,机器人对自身周边 3D 几何的理解更稳定,可降低误判碰撞风险,增强人机协作信心。
与现有产品/工作流的接口
Pointmap 以 H × W 网格图像 编码 3D 信息,可直接作为任何 2D VLA 模型(如 π0.5、SmolVLA)的输入通道,无需改动主干网络架构。实际集成只需:
- 从现有深度传感器或立体相机获取深度图;
- 利用相机内参与外参(实时标定或预标定)将深度转换为机器人坐标系下的 3D 点云;
- 投影回图像平面形成 pointmap,与 RGB 融合后送入现有 VLA pipeline。 这一流程与大多数机器人中间件(如 ROS)深度兼容,可快速嵌入 OpenVLA、RT 系列等开源 VLA 框架,作为标准视觉预处理模块。
具体落地用例
- 电商仓储拣选:在不同仓库中,摄像头可能装于高位或不同角度。基于 pointmap 的 VLA 模型统一观察视角,使机械臂始终准确抓取货架上的目标商品,无需每个仓库重新训练,直接复用云端策略。
- 自动驾驶测试采集:自动驾驶数据采集车因车型不同,传感器安装位置各异。将环境点云转换到自车坐标系后送入 VLA,可让驾驶策略在换车后仍保持一致性,降低感知-决策对齐的适配成本。
局限
- **依赖精确的深度传感器与相机外参标定**:Robot-centric pointmap 的生成需要获取每个像素在机器人坐标系中的三维坐标,这通常要求高质量的深度相机和准确的机器人-相机外参。在低成本硬件或标定不精确的场景下,pointmap 会引入显著噪声,可能抵消其几何先验带来的好处。论文未系统评估深度噪声或标定误差对策略性能的影响。
- **动态物体和遮挡场景的鲁棒性不足**:pointmap 假设场景几何在单帧内是静态的,当存在移动物体、被操作物发生位移或严重遮挡时,pointmap 可能包含过时或错误的坐标信息。论文实验以静态桌面操作任务为主,未涉及动态环境,因此该方法在真实非结构化场景中的有效性尚待验证。
- **仅在有限任务和规模上验证**:实验局限于 RoboCasa 模拟环境和简单的拾放、开门等任务,真实机器人实验数量较少且任务单一。与当前 VLA 预训练所使用的大规模、多样性数据集相比,pointmap 方法能否在更大规模、更复杂任务(如移动操作、长序列任务)中保持增益,以及是否会稀释视觉预训练表征的优势,均未得到充分探索。