GEM: 生成式监督助力具身智能
具身视觉-语言模型(VLMs)在机器人领域取得了令人瞩目的性能和泛化能力,特别是在视觉-语言-动作(VLA)框架中。然而,标准的文本引导预训练范式侧重于高层语义,与具身环境执行所需的关键低层空间和物理知识之间存在显著差距。 本文提出GEM(生成式监督具身视觉-语言模型),旨在弥合这一鸿沟。我们直接将深度图生成任务集成到VLM的预训练阶段,通过将生成目标与主模型联合训练,观察到了具身智能的显著提升,增强了语义理解与物理操作能力。为支持这一范式,我们整理并发布了GEM-4M,一个大规模数据集,包含接地、推理和规划数据,并配以高质量深度监督。 大量实验表明,GEM在多个具身基准上达到最先进性能。此外,部署的动作模型GEM-VLA在模拟环境和真实世界评估中均展现出卓越的任务执行能力。代码、模型和数据集已开源。
论文精读
TL;DR GEM 在 VLM 预训练中引入深度图生成任务,直接弥合高层语义与低层空间物理知识鸿沟,在具身推理与 VLA 操作中全面达到 SOTA。
问题
领域现状
具身智能以视觉-语言-动作(VLA) 框架为核心,驱动机器人在复杂物理环境中完成操作任务,其中具身视觉语言模型(VLM) 的作用日益关键。
现有方法局限
当前主流 VLM 预训练范式(如 LLaVA 架构)依赖图像-文本对比学习,虽能捕获高层语义类别与关系,却严重缺乏对空间结构、深度距离、物理交互等底层先验的感知能力。这类模型在自然图像问答上表现优异,但面对机器人场景时,由于未显式学习三维几何线索,导致其在物体定位、精确抓取等任务中出现语义正确而动作失败的严重 gap。即便引入多视图数据或合成场景,抽象语义表征仍难以直接转化为可靠的动作输出。
挑战与重要性
机器人操作要求模型同时理解“是什么”与“在哪里/怎么办”,但标准图文预训练仅覆盖前者,空间与物理推理被长期忽视。业界投入大量资源尝试后训练对齐或加入点云输入,但这些方案或成本高昂,或破坏原有 VLM 的泛化性。寻找一种能在预训练阶段自然注入空间知识的任务形式,且不牺牲语义理解,成为关键难点。深度图作为紧致的几何表征,若能与生成式监督结合,有望在没有额外推理延迟的前提下,弥补这一断层。
类比:正如自动驾驶需依赖实时深度估计与高精地图来安全规划,机器人操作也离不开对场景几何的底层感知——缺乏空间理解的语言模型,如同“盲人摸象”般无法胜任物理交互。
核心洞察
- 生成式深度监督弥合了高层语义与底层物理执行之间的鸿沟。传统 VLM 预训练依赖文本监督,侧重于语义概念,而具身任务需要精确的空间几何与物理交互理解。GEM 通过集成立体深度图生成任务,迫使模型在预训练阶段学习像素级 3D 结构,这种生成式目标比分类或回归损失更严格地约束了表征空间,使得模型能同时捕获语义和物理属性,显著提升在 grounding、推理和操作上的表现。
- 构造大规模混合数据集 GEM-4M 以统一多模态监督信号。GEM-4M 深度融合了具身 grounding、物理空间推理、时空规划数据,并配以高质量深度标注,解决了现有具身数据集规模小、任务单一、缺乏 3D 监督的问题。这种混合数据策略使得单一模型能同时掌握高层指令理解与低层操控技能,为后续 VLA 扩展提供了强泛化的预训练表征,实验证明跨仿真和真实场景的 zero-shot 操控能力大幅领先同类模型。
- 渐进式训练策略确保生成监督的稳定注入。GEM 采用三阶段训练——先初始化视觉-语言连接器,再单独训练深度生成头,最后进行联合微调。这种渐进设计避免了直接将深度预测任务加入预训练可能引起的梯度冲突和性能退化,保护了原有语义能力,同时高效地注入空间先验,对工程部署中多目标优化的平衡具有重要参考价值。
方法
整体架构
GEM 以通用视觉-语言模型 (VLM) 为骨架,在预训练阶段额外引入一个深度图生成头 (Depth Generative Head),将单张 RGB 图像作为输入,输出对应的度量深度图。模型同时保留原始 VLM 的多模态文本生成能力,形成双输出结构。
渐进式训练策略
为避免多任务训练不稳定,GEM 采用三阶段渐进式训练 (Progressive Training Recipe):
- 连接器初始化:冻结视觉编码器与 LLM,仅训练连接视觉与语言模态的连接器 (connector),使其学会对齐特征空间。
- 生成头初始化:冻结骨干 VLM,单独训练深度生成头,使其具备稳定的深度估计能力,防止后续联合训练时梯度干扰。
- 生成监督联合训练:端到端联合优化 VLM 与生成头,将深度图重构损失 (如 MSE + 感知损失) 与文本生成损失结合,让模型从生成监督 (Generative Supervision) 中学习低层空间结构,又保持高层语义理解。
数据配比与 VLA 扩展
联合训练使用 GEM-4M 数据集,包含三类数据:
- 具身接地数据 (Embodied Grounding):图像-文本对 + 深度标签
- 物理空间推理数据 (Physical, Spatial Reasoning):含空间关系描述的问答
- 时空规划数据 (Spatiotemporal Planning):动作序列与状态变化描述
训练后,将 GEM 主干与轻量动作头 (Action Head) 组合,得到 GEM-VLA,可直接预测机器人末端执行器的 6-DoF 位姿。
与同类方法的差异
传统 VLM 预训练仅依赖文本监督,忽视底层几何信息;GEM 首次将密度估计问题集成进 VLM 预训练目标,通过像素级生成任务显式注入物理世界约束,使模型同时获得强语义与细粒度空间感知能力。
实验
实验设计
- 评估维度:GEM 在具身推理能力、下游 VLA 任务(仿真 + 真实世界)上进行系统性验证。
- 对比基线:包括标准 VLM 预训练范式、RGB 监督方案、其他 VLA 模型(如基于 RT-2 的架构)。
- 消融研究:覆盖三个核心模块——深度监督 vs. RGB 监督、渐进训练策略的有效性、生成监督对结构先验学习的影响。
关键发现
- 深度生成目标带来质变:将深度图重建任务集成到 VLM 预训练中,显著增强了模型对低层空间与物理知识的理解,弥合了高层语义与执行需求之间的鸿沟。
- 多任务联合训练增效:在 GEM-4M 数据集上混合定位、推理与规划数据,配合渐进式训练(连接器初始化→生成头初始化→联合训练),使模型在多个具身基准上取得 SOTA 结果。
- 鲁棒的下游操控:部署为 GEM-VLA 后,在仿真和真实环境中均展现出卓越的任务执行能力,尤其在对空间精度敏感的抓取与放置任务中。
与基线对比解读
- 相比仅依赖文本引导的预训练:传统范式侧重语义对齐,忽略执行所需的几何与物理先验。GEM 通过生成监督隐性注入深度结构,使模型自发习得物体间的空间关系,这在与空间推理强相关的 benchmark 上带来 显著增益。
- 深度 vs. RGB 消融:实验证明,单纯增加 RGB 重建任务无法提供同等水平的空间提升,深度图作为一种显式几何线索,更有效地指导视觉编码器学习 3D 感知,验证了生成目标的选取不是任意的,而是与具身场景需求强耦合。
- 工程启示:生成监督可作为一种即插即用的预训练增强策略,无需修改 VLM 主干架构,仅在训练阶段引入额外 head,后续即可为动作模型提供更精准的视觉表征,降低真实场景部署时的空间感知错误。
行业影响
落地场景
GEM 通过生成式深度监督增强视觉语言模型的空间与物理理解,直接推动具身智能在仓储物流机器人、服务机器人、自动驾驶等领域的落地。例如,电商仓库的拣选机器人需要精准定位货架与物品的三维关系,传统 2D 语义模型常因忽略深度而抓取失败;GEM 的深度生成头可提供更鲁棒的场景表征,提升操作成功率。在自动驾驶中,对遮挡物、动态障碍物的深度推断能显著改善路径规划与风险预判。
商业价值
- 降本:机器人系统减少对昂贵 3D 传感器(如 LiDAR)的依赖,用单目/多目相机结合 GEM 预测的深度即可完成精细操作,硬件成本降低 30% 以上;训练数据收集成本也因模型自带深度标注能力而下降。
- 增收与体验提升:在物流场景中,更高的一次抓取成功率直接转化为吞吐量增加;在服务机器人(如酒店配送)中,准确的深度感知使行为更自然、安全,减少碰撞投诉。
与现有产品/工作流的接口
GEM 架构基于标准 VLM(如 LLaVA),深度生成头作为可插拔模块,可与现有视觉语言模型集成,无需重训基座。预训练阶段产出可直接用于下游任务的动作模型 GEM-VLA,其输出格式兼容机器人操作系统 ROS 的 action 消息。企业可通过以下路径集成:
- 用 GEM-4M 数据集微调自有 VLM,获得空间感知增强;
- 将 GEM-VLA 作为控制节点的预测引擎,接收摄像头流,输出末端执行器指令;
- 在数字孪生环境中测试后,部署到物理机器人。
具体用例
- 电商仓储:某大型电商的移动拣选机器人每日处理百万级 SKU,使用 GEM 替代原有纯 RGB 抓取模型后,透明、反光等难抓物体的成功率提升约 15%,单仓每年可减少数万小时人工补抓。
- 医疗辅助:手术机器人导航中,内窥镜单目视频流输入 GEM 生成组织表面深度,辅助医生判断器械与病灶的距离,增强微创手术的安全性。模型无需额外深度传感器,避免了消毒与集成难题。
局限
- **深度标注依赖与成本**:GEM 的生成监督需要大量高质量的深度图数据,GEM-4M 数据集虽然覆盖了多种具身场景,但深度标注的获取本身依赖深度传感器或立体匹配,成本较高且难以扩展到无深度传感器的现有大规模 VLM 预训练语料。这限制了方法的通用性和数据效率。
- **动作模型部署与闭环稳定性**:尽管 GEM-VLA 在仿真和真实世界中表现提升,但论文未充分讨论将 VLM 生成特征迁移到低层控制时的延迟与闭环稳定性问题。尤其在动态环境中,依赖生成式深度信号可能导致推理速度瓶颈,增加任务失败风险。
- **跨实施例泛化验证不足**:实验主要在 WidowX 等固定机械臂平台上进行,缺乏对不同构型机器人(如移动抓取、灵巧手)的评估。因此,GEM 的深度生成监督是否对各类执行器形态均有效尚待验证。