论文

GeneralVLA-2: 几何感知重建与受控记忆用于机器人规划

GeneralVLA-2: 几何感知重建与受控记忆用于机器人规划

通用视觉-语言-动作系统需要以物体为中心的3D证据和可复用的操作经验来规划可靠的机器人轨迹。GeneralVLA提供了将语言和RGB-D观测转换为3D末端执行器路径的分层接口,但仍存在两个瓶颈: 1. 单目SAM3D式物体重建可能产生位姿和未见几何的幻觉,而操作任务受益于存在校准多视角观测时的稳定物体形状。 2. 原有的 KnowledgeBank 主要检索语义相似的片段并追加新知识,难以控制记忆质量、冲突、置信度和几何相关性。 针对第一个挑战,我们提出 GeoFuse-MV3D——一种几何先验引导的多视图 MV-SAM3D 重建分支。它通过输入视图掩码验证外部几何线索,应用软视觉外壳支持,执行轴细化,并仅融合几何信息同时保留外观。针对第二个挑战,我们将 KnowledgeBank 升级为受控的长期记忆系统,包含显式的质量、置信度、生命周期、验证器和冲突元数据,以及精度导向的检索。 实验方面,重建分支在 GSO-30 数据集上评估,相比 MV-SAM3D 基线,CD 和 LPIPS 分别降低 2.20% 和 2.02%,PSNR 和 SSIM 分别提升 2.36% 和 1.03%。记忆模块在 Terminal-Bench 2.0 和 SWE-Bench Verified 上评估,KnowledgeBank 在 Terminal-Bench 的 SR 和 SWE-Bench 的 resolve rate 上分别比 ReasoningBank 提升 4.53% 和 3.73%,同时 AS 分别降低 4.95% 和 5.65%。代码和项目网站已公开。

论文精读

TL;DR GeneralVLA-2 用几何先验多视角重建消除3D幻觉,并以带质量/置信度元数据管控的记忆系统解决经验冲突,显著提升机器人规划的可靠性与任务成功率。

问题

领域关注点

视觉-语言-动作(VLA)系统正成为通用机器人规划的主流范式,其核心诉求在于将自然语言指令和 RGB-D 观测转换为可靠的三维末端执行器轨迹。这类系统亟需对象级 3D 证据可复用的操作经验,以提升规划的可信度与泛化性。

现有方法的局限

GeneralVLA 提出了分层接口,但存在两个瓶颈:

  • 单目 SAM3D 重建:依赖单帧推断完整对象几何,缺乏对多视角线索的利用,容易产生姿态幻觉和不可见区域的虚构几何。在机器人操作场景中,相机常为固定多视角,单目重建无法利用校准多视图提供的稳定形状先验,导致重建精度不足。
  • 原始 KnowledgeBank:仅基于语义相似度检索代码片段并追加新知识,缺乏对记忆质量、冲突、置信度、几何相关性的显式管控。这导致记忆库中低质量或冲突经验累积,检索结果不稳定,难以应对代码生成或长期规划中的精度要求。

技术挑战与重要性

  • 3D 重建:需将几何先验(如外部深度、视觉外壳)与学习模型有机融合,既要保留生成式外观细节,又要抑制几何噪声。多视图一致性约束和逐轴细化是难点。
  • 记忆治理:为长期记忆引入元数据(生命周期、校验器、冲突标识)和精度导向检索,需在保持检索效率的同时保证记忆的可靠性,这对持续学习的机器人系统至关重要。
  • 业界关注:当前大模型在物理世界落地时,记忆污染与感知不准是两大瓶颈,GeneralVLA-2 的思路为具身智能的闭环反思与规划提供了工程化参考。

类比:这类似于自动驾驶中,从单帧检测提升到多传感器融合感知,再结合经验回放缓存的质量管控,使规划系统既看得准又记得牢。

核心洞察

  • GeoFuse-MV3D 将多视图几何先验注入单目 3D 重建,通过 soft visual-hull 与轴对齐优化,在不改动外观分支的前提下仅融合几何结构,缓解了单目幻觉对操控任务的威胁。与 MV-SAM3D 的纯数据驱动重建相比,该方法在标定多视图可用的场景中强制物体形状的一致性,尤其适合机器人抓取等需要可靠 3D 证据的下游规划。这为 VLA 系统在物理交互中引入可控的几何归纳偏置提供了工程化样板,而非依赖不可解释的生成式先验。
  • Governed KnowledgeBank 将传统语义向量搜索升级为带有质量、置信度、生命周期、冲突元数据的受控记忆系统,并采用精度导向检索。相比原始 KnowledgeBank 仅凭相似度追加片段,这一设计显式管理知识冲突与退化,使得长期部署中记忆不会因噪声累积而失效。对 AI 工程而言,这相当于为 VLA 引入了一套轻量知识治理协议,无需改变基础模型即可提升 Terminal-Bench 与 SWE-Bench 上的规划成功率,同时减少幻觉操作步骤,是可复现的记忆增强范式。

方法

GeneralVLA-2 方法围绕“几何感知重建”和“受管控记忆”两条主线展开。系统输入为语言指令(task language)和校准的多视图 RGB-D 观测,经两个并行模块处理后,由 3DAgent 输出 3D 末端执行器轨迹。

GeoFuse-MV3D 多视图重建

针对单目 SAM3D 易产生姿态与不可见几何的幻觉问题,GeoFuse-MV3D 引入几何先验引导的多视图重建管道。关键机制包括:

  • 利用外部几何线索(如深度或稀疏点云)与 input-view masks 进行一致性验证,筛除不可靠区域;
  • 采用 soft visual-hull support,通过多视图轮廓约束增强形状稳定性;
  • 执行 axis-wise refinement,沿各主轴精细修正重建结果;
  • 仅融合几何信息(保留多视图外观),避免纹理干扰。 该分支输出 object-centric 的精确 3D 形状,作为轨迹规划的空间证据。

Governed KnowledgeBank 记忆系统

原有 KnowledgeBank 仅基于语义相似度检索并追加记忆,难以应对质量波动、知识冲突与几何相关性不足。升级后的 Governed KnowledgeBank 为每条记忆显式添加 quality、confidence、lifecycle、verifier 和 conflict 等元数据,并转向 precision-oriented retrieval。检索时,系统根据任务需求匹配高置信度、未过期的经验片段,由 verifier 模块过滤冲突知识,最终输出高质、几何相关的操作经验,用于引导规划。

与同类 VLA 系统的差异在于,GeneralVLA-2 并未单纯依赖端到端策略或单目重建,而是将 geometry-prior 多视图融合与 governed memory 显式管控相集成,在规划阶段更可靠地利用结构化 3D 证据和长期经验,从而减少幻觉与冲突。

实验

实验设计

  • 3D 重建分支:在 GSO-30 数据集上评估 GeoFuse-MV3D,对比 MV-SAM3D 基线,指标包括 CDLPIPS(越低越好)与 PSNRSSIM(越高越好)。
  • 长期记忆模块:在 Terminal-Bench 2.0SWE-Bench Verified 上测试升级后的 KnowledgeBank,对比原 ReasoningBank,关注任务成功率(SR / resolve rate)与动作序列差异(AS)。
  • 此外,还进行了机器人规划的无训练部署测试与真实世界实验,验证整体框架的实用性。

关键发现

  • 几何融合重建GeoFuse-MV3D 在 CD 上降低 2.20%,LPIPS 降低 2.02%,PSNR 提升 2.36%,SSIM 提升 1.03%,证明多视图几何先验与掩膜验证能有效抑制姿态和未观测区域的幻觉,并在保持外观的同时提升几何稳定性。
  • 治理式记忆管理KnowledgeBank 在 Terminal-Bench SR 上提升 4.53%,SWE-Bench resolve rate 提升 3.73%,同时 AS 分别降低 4.95%5.65%,说明通过引入质量、置信度、生命周期、冲突解决等元数据与精确检索,显著改善了长期记忆的可靠性和规划一致性。

对比基线深度解读

  • MV-SAM3D 缺乏显式几何验证与软化融合,易产生伪影;而 GeoFuse-MV3D 利用输入视图掩膜进行校验,结合视觉外壳支持与轴对齐优化,仅融合几何、保留原有外观,因此在保持视觉真实感的同时大幅降低重建误差。该设计表明,对于机器人操作,几何先验的显式注入比纯数据驱动的 3D 估计更可靠
  • KnowledgeBank 仅依赖语义相似度检索与简单追加,无法应对记忆冲突与置信度差异;升级为治理式长短期记忆后,通过冲突元数据、生命周期控制和精准召回,在需要长程依赖的任务中表现更稳定。这启示记忆系统需引入类似数据库治理的机制,才能在机器人规划中持续积累有效经验。

行业影响

落地场景

GeneralVLA-2 主要面向需要高可靠 3D 操作规划的场景:仓储物流机器人拣选未知形状物品、制造装配线的柔性上下料、服务机器人在非结构化家庭环境中的物品抓取与放置。其改进的 GeoFuse-MV3D 重建分支提升了从多视角 RGB-D 还原操作对象几何的精度,减少了单目幻觉导致的抓取失败;Governed KnowledgeBank 则让机器人能从历史操作中积累可复用的经验,避免重复试错,适合长期运行、任务多变的部署环境。

商业价值

主要落在降本增效体验提升两条线。

  • 降本:更准确的几何重建与记忆治理可减少操作失败率,降低因碰撞、掉落造成的货损和停机时间;记忆系统自动过滤低质量、冲突的经验,减少了人工审核与知识库维护成本。
  • 增效:通过复用验证过的经验,新任务适配速度加快,单位时间处理量提升;在仓库中可 7×24 稳定运行,吞吐率明显改善。
  • 体验提升:服务机器人交互更自然,错误操作更少,用户信任度上升。

与现有产品/工作流的接口

整体框架以层次化接口设计:输入语言指令与 RGB-D 流,输出末端执行器路径。可近乎即插即用地集成到 ROS 2 生态的规划栈中:

  • 感知端:GeoFuse-MV3D 可替换现有 3D 目标重建模块,接收已标定的多相机流,输出带置信度的点云。
  • 规划端:记忆系统作为独立的知识库微服务,通过 REST/gRPC 提供检索与更新接口,与运动规划器(如 MoveIt)和任务规划器(如行为树)协同。
  • 现有产品兼容:仓储机器人公司(如 Boston Dynamics Stretch、Fetch Robotics)或服务机器人平台(如 Hello Robot Stretch)可将 GeneralVLA-2 作为视觉-语言-动作的集成层,直接替换或增强原有堆抓取管线。

具体用例

  1. 电商物流仓库:动态料箱拣选场景中,机械臂面对成千上万种 SKU,依靠 GeoFuse-MV3D 从固定多相机视角稳健重建商品几何,并结合记忆库复用以往抓取成功案例,显著减少人工介入,提升日清货量。
  2. 企业级机器人开发平台:机器人即服务(RaaS)提供商可将 Governed KnowledgeBank 作为标准化经验管理模块嵌入云平台,不同客户的机器人集群共享经过质量验证的知识项,快速实现跨场地迁移学习,缩短部署周期。

局限

  • **几何先验依赖**:GeoFuse-MV3D 需要外部几何线索(如多视角掩膜或深度)进行重建引导与视觉外壳支撑,当标定不精确或视角覆盖稀疏时,几何幻觉风险依然存在,限制了在非受控环境中的泛化能力。
  • **记忆治理仍需人工设定**:Governed KnowledgeBank 通过质量、置信度、生命周期等元数据管理记忆,但这些阈值和规则需要领域专家预先定义,缺乏从经验中自适应调整的机制,长期自主运维仍面临挑战。
  • **模块化流水线的级联脆弱性**:方法延续了“重建→语义→规划”的模块化设计,相比端到端 VLA(如 RT-2)难以联合优化,且前序视觉重建或记忆检索的错误会直接传导至规划阶段,缺乏整体鲁棒性应对机制。
论文Haoyu Wang2026-06-16原文

相关内容