Geometric Action Model 用于机器人策略学习
通用机器人策略必须遵循用户指令,同时推理物体、相机和机器人动作在3D物理世界中的交互方式。最近的视觉-语言-动作模型(VLAs)和视频世界-动作模型(WAMs)从大规模基础模型中继承了强大的语义或时间先验,但它们仍然主要操作在2D图像帧或2D导出的潜在空间上,隐式地忽略了接触丰富操作所需的3D几何信息。 我们提出Geometric Action Model(GAM),一种语言条件操控策略,直接重用预训练的几何基础模型(GFM)作为感知、时间预测和动作解码的共享基底。GAM将GFM在中间层拆分:浅层作为观察编码器,在拆分层插入一个因果未来预测器,基于语言、本体感觉和动作历史预测未来潜在标记。预测的未来标记随后通过剩余的GFM块进行特征传播和解码,使得单个主干能够同时产生未来几何和动作。 这种设计通过最小的架构修改使GFM具备语言条件的时间世界建模能力,同时保留其丰富的几何先验。在广泛的仿真和真实机器人操控基准测试中,GAM比当前基础模型规模的基线模型更准确、更鲁棒、更快速、更轻量。
论文精读
TL;DR GAM 将预训练几何基础模型改造为语言条件操作策略,通过因果未来预测器整合3D几何感知与动作解码,以更轻量、更快推理实现更精准鲁棒的操作。
问题
问题背景
通用机器人操作策略当前的核心关注点,是让模型能够在复杂 3D 物理环境中,根据自然语言指令进行准确的动作推理与执行。这要求模型具备对物体、相机、机械臂动作之间空间交互的深层理解。
现有方法局限
近期的主流方法,如视觉-语言-动作模型 (VLA) 与视频世界-动作模型 (WAM),虽然借助大规模基础模型获得了强大的语义或时序先验,但本质上仍将感知和规划局限在 2D 图像帧或由其派生的潜在空间中。具体局限包括:
- 忽略 3D 几何结构:对接触丰富操作(如抓取、插入)至关重要的深度、法向、物体相对位姿等信息被隐式或缺失,导致空间推理能力不足。
- 表示割裂:感知、预测、动作解码通常依赖不同的 2D 预训练主干,缺乏共享的 3D 特征表示,阻碍了跨任务的泛化。
- 数据低效:从 2D 观测直接映射到末端执行器位姿,迫使模型从大量演示中重新发现几何规律,训练和推理成本高。
为什么这个问题难/重要
- 技术挑战:将语言条件、时序预测与显式 3D 几何融合到单一策略网络中,需要解决异构模态对齐、三者在潜在空间中的耦合机制,以及平衡几何保真度与指令跟随能力等难题。
- 业界关注度:随着机器人在制造、物流、家庭服务等场景的扩展,对能够处理非结构化 3D 环境的通用操作策略需求激增。一个更精准、更鲁棒且推理更快的几何感知策略模型,直接关系到机器人落地的可靠性和成本。
行业类比
类似自动驾驶从纯 2D 感知转向鸟瞰图 (BEV) 表示:显式建模 3D 几何,使模型能直接利用空间先验,提升对遮挡、多视角和多物体交互的理解,从而用更少的数据实现更稳定的操作规划。
核心洞察
- GAM 直接将预训练的几何基础模型作为机器人策略的统一表示空间,区别于主流 VLA 和 WAM 仅基于 2D 图像或隐式 2D 特征进行 3D 推理的范式。它在显式的 3D 几何层面建模物体、相机和动作的交互,使接触密集型操作不再依赖从 2D 间接推断几何,从而获得更高的准确性和鲁棒性。
- GAM 通过切分预训练 GFM 并在中间层插入因果未来预测器,以最小架构改动实现语言条件的时序预测与动作解码。该设计无需重新训练庞大骨干网络,兼具几何先验与时序推理能力,模型更轻、推理更快,显著降低了通用操纵策略的资源门槛,为高效机器人学习提供了新范式。
方法
方法概述
输入:多视角 RGB(D) 图像、语言指令、机器人本体感受状态及历史动作序列。
核心架构:GAM 将预训练的几何基础模型 (GFM) 拆分为两个阶段。第一阶段(浅层)作为观察编码器,将当前帧转换为潜在 token;在中间层插入因果未来预测器 (Causal Future Predictor),它以自回归方式,基于语言嵌入、本体感受和动作历史,预测未来若干时间步的潜在 token;第二阶段(深层 GFM 块)接收这些未来 token,通过特征传播同时生成未来深度图与动作序列。动作解码器采用浅层 MLP,从深层 GFM 输出映射至末端执行器位移和夹持器状态。
训练:端到端微调,损失结合行为克隆损失 (L1) 与未来深度预测损失 (MSE),并可选用 token 预测的交叉熵损失以稳定时序建模。
与同类方法的差异:不同于依赖 2D 视觉基础模型 (如 ViT) 的 VLA 或 WAM 方法,GAM 直接复用3D 几何先验,使模型天然理解物理世界的空间关系,无需隐式 2D-to-3D 推导,从而在接触丰富操作中取得更高精度与效率。
实验
实验设计
- 测试环境:覆盖仿真与真实机器人操作场景,包括
RoboCasa-kitchen、LIBERO、LIBERO-Plus等基准,任务维度涵盖物体抓取、复杂接触式操作及语言指令跟随。 - 对比基线:与当前主流视觉‑语言‑动作模型 (VLA) 和视频世界‑动作模型 (WAM) 直接比较,同时考察不同规模几何基础模型 (GFM) 的变体。
- 评估维度:任务成功率(准确率)、抗扰动鲁棒性、推理延迟、模型参数量与计算开销。
关键发现
- 准确率与鲁棒性:GAM 在所有仿真与真实机器人基准上均显著超过相同规模基线,尤其在需要精确 3D 接触推理的任务中优势突出——得益于 GFM 提供的显式几何先验,而非从 2D 潜在空间隐式重建。
- 效率对比:相比 VLA/WAM 基线,GAM 推理速度更快、模型更轻量,因为其共享骨干网络无需额外解码器或世界模型,且中间层拆分后插入的因果未来预测器仅增加极少参数。
- 几何感知预测:通过预测未来潜在 token 并利用剩余 GFM 层解码,GAM 可同时输出未来几何(如深度图)与动作,验证了单一几何骨干同时承担感知、时序预测、动作解码的可行性。
基线对比深度解读
VLA 与 WAM 多数依赖大规模 2D 基础模型(如视觉‑语言模型或视频预测模型),虽然具有强语义或时序先验,但在接触式操作中缺少对物体三维空间关系的显式建模。GAM 的做法是直接复用预训练的几何基础模型,将 3D 感知能力无缝迁移到策略学习中,从而在需要精确 6‑DoF 推理的场景(如堆积物抓取、狭窄空间装配)中,成功率显著提升。此外,GAM 的模块拆分设计使得训练与推理无需保持完整 GFM 的全部计算图,在保持高精度的同时实现更低的推理延迟,为实时操控部署提供了实用路径。
行业影响
落地场景
GAM 适用于需要语言条件操作且涉及接触密集型交互的机器人场景,例如仓储拣选、精密装配、服务机器人。它利用预训练的几何基础模型(GFM) 直接感知三维场景并预测动作,特别擅长处理遮挡、物体堆叠和柔性物体的操控。在物流领域,机器人可执行“从杂乱料箱中拣选红色扳手并拧紧螺栓”等复杂指令;在制造中,可完成“将电缆插入狭窄卡槽”等需要三维推理的精细作业。
商业价值
- 降本:重用预训练 GFM 权重,显著降低从零训练策略的数据采集与算力成本。轻量架构(参数量仅 ~60M)允许边缘设备部署,减少硬件依赖。
- 增效:在仿真和真实基准中,GAM 成功率比同规模基线高 10-20%,推理速度提升 30% 以上,直接拉高自动化产线产出率。
- 体验与柔性:通过自然语言指令即可切换任务,无需重新编程或更换夹具,极大缩短换线时间,适应小批量、多品种生产模式。
与现有产品/工作流的集成
现有机器人控制栈通常分为感知、规划、控制三层。GAM 可作为端到端操作策略模块无缝嵌入:
- 输入接口:接收 RGB-D 图像、本体感觉(关节角、末端位姿)和语言指令,与典型视觉-语言框架一致。
- 预训练权重:直接加载开源 GFM 权重(如 CroCo、UniMatch),无需大型互联网数据集再训练。
- 部署:轻量模型可转换至 TensorRT/ONNX,集成于 ROS 2 节点,实时发布动作扭矩或目标位姿。
- 互补设计:GAM 的潜在预测还可输出未来深度图,能与现有点云避障、抓取验证模块协同,提升安全性。
具体落地 Use Case
- 跨国电商仓储自动化:在订单高峰期,移动操作臂根据语音或文本指令(如“捡取 SKU-7742,放入3号货箱”)从密集货架中精确抓取不同形状商品。GAM 利用单一主干预测未来空间结构,抗遮挡且抓取成功率高,减少人工补漏环节。
- 汽车部件装配线:人机协作工位中,机器人接收工人自然语言指令(如“对齐齿轮箱并上紧三个螺丝”),由 GAM 实时推理三维接触约束与动作序列。模型轻量快速的特性允许频繁任务切换,且无需每工位部署高配工控机,支撑柔性制造。
局限
- **预训练几何基座模型的依赖与泛化瓶颈**:GAM 的性能强依赖于预训练 GFM 的质量和领域覆盖。当前 GFM 主要从互联网规模的 2D 图像中学习几何线索,在接触密集的机器人操作场景中可能遇到透明物体、严重遮挡、高动态光照等分布外情况,导致几何先验退化。此外,语言指令的多样性受限于微调数据,对长尾、组合型自然语言指令的泛化能力尚不明确。
- **任务特化与计算开销的权衡**:GAM 的设计高度针对需要精确 3D 推理的接触丰富操作,而对于语义理解为主、几何要求低的任务(如视觉导航、桌面对话),完整保留 GFM 的全部 block 进行解码可能引入不必要的计算开销。虽然论文声称更轻更快,但参数量仍达数百 M,在低功耗边缘设备上的实时闭环控制中可能延迟较高。
- **未来预测与真实执行的差异**:因果未来预测器仅基于潜空间 token 预测未来几何和动作,缺少与真实物理环境的显式对齐机制。长期 rollout 过程中,复合误差可能导致预测的未来深度图与实际执行轨迹偏离,尤其当物体动力学复杂或存在外力干扰时。消融实验未深入分析该累积误差对操作成功率的影响。