BridgeVLA++: 一种数据高效、可泛化、记忆增强的3D操作视觉-语言-动作框架
利用预训练视觉-语言模型(VLM)构建视觉-语言-动作(VLA)模型,已成为三维机器人操作的有前景范式。然而,现有三维VLA方法数据需求大,分布偏移下泛化能力有限,且缺乏对过往观察的显式记忆,阻碍其在数据稀缺、开放世界及依赖记忆的操作场景应用。 我们前期工作 BridgeVLA,通过保序学习提升数据效率与泛化:将原始点云投影为多视图图像,并在生成机器人动作前预测中间热图。在此基础上,BridgeVLA++ 为 BridgeVLA 配备统一时空记忆架构,建模持久空间上下文与时间交互历史。该记忆增强框架可基于观察历史推理,同时保留 BridgeVLA 的数据效率与泛化能力。 大量实验表明,我们的框架在空间操作任务上表现强劲且泛化稳健。BridgeVLA++ 在两个具有挑战性的记忆依赖操作基准上取得最先进性能,且不损失原版数据效率与泛化。此外,它有效支持双手操作设置,并在额外真实机器人平台验证,展示跨任务、环境与平台的可扩展性。 上述结果确立 BridgeVLA++ 为统一的3D视觉-语言-动作框架,同时支持数据高效学习、稳健泛化与有效的记忆感知机器人操作。
论文精读
TL;DR BridgeVLA++ 在预训练 VLM 基础上引入时空记忆架构,使 3D 机器人操控既保持数据高效和强泛化性,又支持对历史观测的显式推理,在记忆依赖任务上达 SOTA。
问题
问题背景
3D 机器人操作领域正积极利用预训练的 视觉语言模型 (VLM) 构建 视觉语言动作 (VLA) 模型,以实现语言条件控制,减轻对大规模示教数据的依赖。
现有方法局限
现有 3D VLA 方法普遍面临三个瓶颈:
- 数据饥渴 (data-hungry):需大量任务演示才能收敛,难以在数据稀缺场景下部署。
- 泛化不足:在感知分布偏移(如相机视角、光照、背景变化)下性能骤降,无法应对开放世界的多样性。
- 缺乏显式记忆:无法建模跨时间步的历史观察,导致在遮挡或长期依赖性任务中频繁失败。
先前的工作 BridgeVLA 通过保持 VLM 对齐并使用多视图热图中间表示,显著提升了数据效率和泛化能力,但依然不具备时间-空间记忆,无法处理需要回忆过去状态的操控任务。
为什么这个问题难且重要
3D 操作的环境动态性、遮挡现象、以及任务长程依赖性,要求模型同时具备:
- 从少量演示中学习的能力(降低数据成本);
- 在未见过环境中稳健泛化的能力(避免重复训练);
- 对时空上下文的显式记忆(处理部分可观测状态)。
三者往往相互制约——引入记忆模块容易破坏预训练 VLM 的对齐,损害泛化性;而保持数据高效又难以与记忆架构兼容。业界对能够统一这三者的框架有迫切需求,因为真实机器人部署意味着高昂的数据获取成本和不可预知的环境条件。
行业类比
类似自动驾驶中的 端到端模型,既需要从少量标注样本中快速学习,又必须在遮挡、长尾场景下记住道路元素的历史状态,才能做出安全决策。
核心洞察
- BridgeVLA 的核心创新在于保留预训练 VLM 的输入输出对齐(从多视图点云投影到 2D heatmap 再生成 3D 动作),这使得模型用极少演示数据就能学习且泛化;BridgeVLA++ 在此基础上注入统一时空记忆,让模型能显式建模空间遮挡与时间交互历史,从而在不牺牲数据效率与泛化性的前提下,突破以往 3D VLA 方法在记忆依赖任务上的瓶颈。
- 该框架通过解耦空间记忆(用于遮挡鲁棒的精细化定位)和时间记忆(自适应选择历史关键帧作为子目标),在双臂协同与单臂长期记忆任务上均取得 SOTA,同时跨平台(RLBench、Franka、Dobot)的实机验证表明其架构可扩展,为真实世界中数据稀缺、环境多变且需要记忆的机器人操控提供了一条落地路径。
方法
BridgeVLA++ 在 BridgeVLA 的基础上引入统一的时空记忆架构,使原本数据高效、泛化性强的视觉-语言-动作(VLA)框架能够处理需要记忆依赖的长时间操控任务。整体流程遵循“2D 感知先验 → 3D 动作解码”的对齐范式,并嵌入记忆模块。
输入与感知建模
原始 3D 点云被投影为多视角 RGB 图像,与语言指令一同送入冻结的预训练 VLM。VLM 输出动作热图,保留其语义理解和对齐能力。
关键模块:时空记忆
- 时间记忆(Temporal Memory):为粗阶段推理提供历史上下文。维护一组初始锚点视图和历史关键帧,通过自适应子目标关键帧选择,使模型能追溯过去的观测与动作,避免遗忘。
- 空间记忆(Spatial Memory):针对遮挡场景的精细定位,利用历史帧中的空间线索补偿当前视图的缺失信息,提升鲁棒性。
- 记忆集成(Memory Integration):将上述记忆特征注入到动作预测的流水线中,不破坏原有VLM的输入-输出对齐。
动作解码与优化
在热图基础上,模型预测平移、旋转、夹爪状态和碰撞概率。采用由粗到精的细化策略:先利用时间记忆生成粗动作,再结合空间记忆和局部热图进行微调,最终输出连续的3D动作轨迹。
训练策略
沿用两阶段训练:首先在大量2D数据上预训练热图生成能力(冻结VLM),然后在少量3D演示数据上微调,并加入记忆模块的参数学习,保持数据效率。记忆模块的槽位数量和历史长度等作为可调超参。
与同类方法的差异:现有3D VLA大多依赖大量演示且缺乏显式记忆,难以应对分布外场景或长序列操作;而BridgeVLA++通过解耦感知与记忆,在极少数据下实现强泛化,并能显式利用历史解决记忆依赖任务,首次同时满足数据效率、泛化性与记忆操控三者的统一。
实验
实验设计
BridgeVLA++ 在多个维度上进行验证:
- 通用 3D 操控(RLBench):测试基础的单臂操作能力,对比数据效率、动作准确性。
- 分布外泛化(COLOSSEUM / GemBench):评估对纹理、光照、物体姿态变化的鲁棒性。
- 记忆依赖操作(RMBench):双手协作场景,要求模型记住历史观测以完成长程任务。
- 记忆依赖单臂验证(MemoryBench):专门衡量对过去帧的利用效率。
- 真实世界实验:在 Franka 和 Dobot 两种不同平台上进行泛化和记忆任务测试,验证跨平台可扩展性。
基线包括原 BridgeVLA、SpatialVLA、π0.5、ACT、RVT-2、SAM2Act+ 等。
关键发现
- 记忆与效率兼得:引入时空记忆模块后,模型在记忆依赖基准上达到 SOTA,同时保持了原 BridgeVLA 的数据效率——仅需极少量演示(如 3 或 10 条)即可学习新任务,无需牺牲泛化能力。
- 鲁棒泛化:在 COLOSSEUM 和 GemBench 的纹理、场景变化下性能稳定,表明预训练 VLM 的对齐方式有效保留了视觉常识。
- 双手与跨平台迁移:框架无缝扩展到双手操作,并在 Dobot 新平台上成功部署,证明架构对机械臂形态和自由度不敏感。
与基线对比解读
相比缺乏记忆能力的 BridgeVLA,BridgeVLA++ 在需要历史推理的任务上出现质的提升;相对于 SpatialVLA 等 3D VLA 方法,它用更少的数据达到了更好的泛化效果。与 π0.5、ACT 等端到端策略相比,其核心优势在于通过 2D 热图预训练 和 粗到细的 3D 动作细化 保留了 VLM 的对齐特性,从而在开放世界设定下更可靠地定位物体与避免碰撞。消融实验(见论文附录)进一步证实:去除记忆模块会显著降低记忆依赖任务的完成率,而保留空间记忆能增强抗遮挡能力。
行业影响
落地场景
BridgeVLA++ 能够直接在数据稀疏、环境多变且需要记忆的 3D 操作中部署,适合以下产品与业务:
- 仓储与物流自动化:分拣、上架、拆垛等需要长期上下文记忆的任务(如根据前一个物料的放置位置决定下一个动作)。
- 精密装配与柔性制造:双臂协作(如电子元件装配)中,记忆历史动作序列可减少重定位与故障恢复时间。
- 服务与家庭机器人:在变化的家居环境中执行多步操作(如整理桌面),框架的记忆模块保证了跨遮挡的鲁棒性。
商业价值
- 大幅降低数据成本:仅需 3 个演示 即可学会任务,对比传统方法数据需求量降低一个数量级,直接减少数据采集的人力和时间支出。
- 提高模型泛化能力:对光照、纹理、相机视角等分布偏移保持高性能,减少重复部署时的再训练,缩短方案落地周期,从而加快投资回收。
- 拓展应用边界:首次统一实现数据高效、强泛化与记忆增强的 3D VLA 框架,可将 VLA 模式带入此前因数据短缺或环境多变而无法商业化的场景,开辟新增收入来源。
与现有产品/工作流的集成
BridgeVLA++ 可作为一个即插即用的 3D 动作规划模块 嵌入现有机器人栈:
- 其输入为多视角 RGB-D 图像和自然语言指令,输出为末端执行器位姿,可无缝替换传统的视觉伺服或基于 object pose 的规划模块,无需改动底层控制器。
- 框架依赖预训练的 VLMs(如 CLIP 或 SigLIP),不需要昂贵的机器人专属数据标注;训练流程支持两阶段微调,可基于现有 VLM 模型权重快速启动。
- 在双臂平台上验证了可扩展性,开发者可直接将其应用于 Franka、Dobot 等主流协作机器人,降低集成门槛。
具体落地用例
- 电商仓储分拣:在一个货品种类不断变化的仓库里,机器人仅通过少量示范(每个 SKU 3 次)即可学习“将指定商品放入对应周转箱”,并记忆已访问货架区域以规划剩余路径,应对货箱堆叠造成的遮挡。
- 柔性装配线:电子制造中,机械臂需依次完成插装、锁紧、检测等多步操作;BridgeVLA++ 的记忆机制能保存已完成的子目标(如已安装的螺丝位置),避免重复探测,提升节拍时间,且同一模型只需微调即可适应新机种,大幅节省换线成本。
局限
- **数据效率边界**:论文强调数据高效,但样本效率实验仅对比 3 与 10 个演示,在极低数据量(如 1-5 个演示)下性能可能大幅下降,尤其是对于长序列记忆依赖任务。这限制其在真实场景中仅靠极少示教快速部署的能力。
- **计算与存储开销**:时空记忆模块需维护历史多视图关键帧与 slot 缓存,随着观测序列长度增长,内存占用与推理延迟显著增加。尽管附录讨论了 memory overhead,但在资源受限的具身平台上,实时性仍可能成为瓶颈。
- **开放世界泛化局限**:实验集中于仿真基准(RLBench、COLOSSEUM 等)和有限真实环境,对高度动态、包含未知物体与背景干扰的完全非结构化场景未充分验证。预训练 VLM 的视觉域差异可能导致在陌生外观或遮挡严重时性能退化。