论文

GOAG: 用于灵巧机器人操作的生成式与对象无关抓取规划器

GOAG: 用于灵巧机器人操作的生成式与对象无关抓取规划器

多指抓取是机器人关键技能,但当前基于深度学习的抓取规划器往往难以泛化到新物体,因为它们是在有限、特定物体的数据集上训练的。我们提出一种根本不同的方法,基于抓手和物体在其相互接触点处共享相同表面几何形状的观察。我们提出 GOAG(生成式与对象无关的抓取规划器),一种新颖的深度生成模型,学习特定抓手接触表面分布的紧凑潜在表示,无需依赖特定物体的训练数据即可高效采样有效抓取配置。 我们展示了通过在推理时仅引入物体特征,模型可以有效检索与抓手能力兼容的可接受接触区域。我们在模拟和真实场景中通过已建立的抓取协议进行了广泛实验,验证了该方法在不同抓手上的有效性。我们的方法在 MultiDex 数据集上的物体取得了最先进的结果,平均成功率达到 86.93%。在生成大量抓取时,它提供了显著更快的处理速度,同时与专门在该数据集上训练的领先方法性能相当。 与这些方法不同,我们的方法不依赖特定物体的训练数据,突显了对象无关学习的优势。它有效解决了传统数据驱动抓取规划器面临的泛化挑战。代码和视频可在项目网站上获取。

论文精读

TL;DR GOAG 提出物体无关的生成式抓取规划范式:仅学习夹爪接触面分布,推理时注入物体几何特征,无需物体特定训练即可泛化到新物体,在 MultiDex 上取得 86.93% 成功率。

问题

问题背景:多指灵巧抓取是机器人操作的核心技能,近年来深度抓取规划器在特定物体集上取得高成功率,但泛化到新物体仍是开放难题。

现有方法局限:主流数据驱动方法依赖 object-specific 训练集,例如对 MultiDex 等数据集进行全监督训练,模型学习的是“物体→抓取姿态”的映射,而非抓取能力的通用表示。这导致:

  • 面对训练分布外的物体时,生成的抓取候选质量显著下降;
  • 扩展新物体需要重新标注大量接触与抓取数据,成本高、周期长;
  • 模型规模与物体类别数耦合,难以像基础模型那样一次训练、多任务复用。

为什么这个问题难/重要:抓取规划的可行空间受夹爪运动学、接触稳定性、碰撞避免等多重约束耦合,且不同夹爪(如 Allegro、Shadow Hand)的接触几何差异极大。要学习一个只编码夹爪本身接触能力的潜在表示,同时在推理时仅通过物体特征检索可接受接触区域,需要生成模型同时具备强先验和灵活条件化能力。业界对“物体无关”的抓取策略高度关注,因为它直接决定机器人能否在开放环境中操作未见物品,是通用操作智能的关键一环。

行业类比:这类似于 NLP 中预训练语言模型通过 prompt 在推理时适应新任务,而不为每个下游任务重新训练;GOAG 试图将“抓取能力”与“物体实例”解耦,用一次 gripper 预训练支持多物体推理。

核心洞察

  • 范式从物体中心转向抓取器中心:GOAG 不学习在特定物体上标注抓取点,而是直接建模特定机械手接触表面的潜在分布。因为接触几何由抓取器形态决定,物体仅提供可接触表面约束,所以模型天然与具体物体解耦,对新物体自然泛化。
  • 生成式建模实现高效采样:用潜在空间编码抓取器所有可能的接触配置,一次采样即可批量生成多样候选抓取,再结合物体点云特征筛选可行区域。相比逐物体优化类方法,推理速度显著提升,同时匹配甚至超越在专用数据集上训练的 SOTA 方法,且完全免去对象特定数据收集和标注成本。
  • 推理时引入物体特征实现 object-agnostic 训练与 object-aware 推理分离:在采样阶段仅依赖抓取器潜在分布,物体点云作为条件在推理时注入,用于从候选接触区域中检索与抓取器能力和物体几何兼容的可采纳区域。这一设计既保持了对新物体零样本泛化能力,又避免了纯生成模型可能产生不可行接触的问题。

方法

方法概述

GOAG 的核心范式从物体中心转向 gripper 中心:训练时仅使用 gripper 自身的接触表面分布,不接触具体物体数据。

输入:

  • 训练阶段:从 gripper 的运动学模型和可行关节空间采样大量接触点,构成接触表面分布 C(H(Q)),其中 H(Q) 表示手部关节配置空间中的姿态集合。
  • 推理阶段:引入目标物体的点云特征,先将物体点云变换到 gripper 坐标系 O([R,T]^{-1}),再与生成模型交互。

关键模块:

  1. 深度生成模型:学习 gripper 接触表面分布的紧凑隐空间表示,支持从隐变量采样生成新的接触点集。
  2. 条件注入:在推理时将物体特征作为条件,引导生成模型输出与物体表面几何兼容的接触区域。
  3. 位姿反解:从生成的接触点位置与法线,结合 gripper 运动学约束,反解出手部关节角度与腕部位姿,输出 grasp configuration。

输出:一组候选抓取配置,通常还需经过力闭合或碰撞检测进行筛选。

与同类方法的差异:传统深度抓取规划器依赖物体标注数据训练,对未见物体泛化差;GOAG 仅在 gripper 自身几何上训练,物体信息只在推理时注入,从根本上实现 object-agnostic 的抓取规划。

实验

实验设计

GOAG 在模拟 与真实机器人 场景下验证,覆盖文献中多种多指灵巧手配置。核心基准为 MultiDex 数据集,方法训练阶段完全不使用物体特定数据 ,仅学习 gripper 接触面分布;推理阶段输入物体特征以检索可接受接触区域。评估协议遵循既有抓取基准,比较对象为在该数据集上专门训练的领先抓取规划器。

关键发现

  • 在 MultiDex 上平均抓取成功率达 86.93% ,与专门训练的领先方法性能相当 。
  • 生成大量抓取候选时,GOAG 推理速度显著更快 ,更适合实时或大规模采样场景。
  • 在未见物体上展现出强泛化能力,验证了物体无关学习 的有效性。

与基线对比解读

传统深度抓取规划器依赖有限、物体特定的标注数据,跨物体泛化受限。GOAG 的核心创新在于从 gripper 接触面分布学习紧凑潜在表示 ,而非记忆物体形状,因此推理时只需物体几何特征即可生成合法抓取。虽然基线方法在训练分布内可能达到类似成功率,但 GOAG 无需为每个新物体或数据集重新训练,工程部署成本更低、扩展性更好。不过论文未给出训练算力与具体推理耗时数值,实际落地时仍需评估资源开销。

行业影响

落地场景

GOAG 面向多指灵巧手抓取,适合需要处理大量未知或新出现物体的场景。典型 use case:电商仓储的订单拣选机器人,SKU 频繁更新,使用 GOAG 可省去对每个新 SKU 采集抓取数据与重新训练;制造业柔性装配线,工件形状多变,可快速切换抓取策略。此外,服务机器人在家庭或医院等开放环境中抓取日常物品,也能受益于对象无关的通用性。

商业价值

核心降本点在于数据与训练开销:传统抓取模型需要物体特定标注数据,采集、标注、训练成本高,且难以覆盖长尾物体。GOAG 只需训练一次特定夹爪的接触面分布,推理时输入物体局部几何即可生成可行抓取,大幅缩短部署周期。对机器人集成商而言,这降低了对大量真实抓取数据采集的依赖,可更快交付面向新行业的抓取方案。增收方面,提升机器人系统在非结构化环境中的抓取成功率(论文报告 86.93%)直接减少人工干预,提高产线或仓库吞吐量。

与现有工作流接口

GOAG 作为抓取规划模块,可嵌入现有机器人感知-规划-控制栈。它接收来自深度相机或点云分割的物体部分观测,输出候选抓取姿态,再交由运动规划器(如 MoveIt)和控制器执行。接口上可封装为 ROS 2 节点或 gRPC 服务,输入为物体点云/网格和夹爪类型,输出为抓取配置列表。与现有物体识别、6D 位姿估计模块解耦,只在推理阶段结合物体特征,便于与不同感知方案集成。项目提供 GitHub 和 项目主页,便于评估与二次开发。

局限

  • - **抓手特异性训练**:GOAG 学习的是特定抓手的接触表面分布(`gripper-specific contact surface distribution`),更换不同多指手需要重新采集接触数据并训练模型,无法跨硬件直接复用。论文中提到使用不同 gripper 从文献中验证,但未展示零样本迁移到新抓手的实验。与 UniGrasp 等尝试跨抓手泛化的工作相比,GOAG 在硬件灵活性上存在明显局限,部署到新平台时需额外训练成本。
  • - **对完整物体几何的依赖**:推理阶段需要引入物体特征 `O([R,T]^{-1})` 来检索可允许接触区域,这通常假设能获得较完整、高质量的物体点云或网格。但在真实抓取场景中,物体常被部分遮挡或仅提供单视角观测,此时接触表面估计可能退化。论文实验主要基于已知物体模型或完整扫描,未系统验证在部分观测、噪声输入下的鲁棒性,限制了其在非结构化环境中的直接应用。
  • - **成功率与单次抓取质量仍有提升空间**:MultiDex 数据集上平均成功率 86.93%,与专门针对该数据集训练的方法持平但并未大幅超越,表明生成式采样在某些物体上仍可能产生不稳定或无接触的抓取。文中强调生成大量抓取时处理速度快,但单个抓取的物理可行性可能依赖后处理筛选或碰撞检查。与闭环自适应抓取或基于强化学习的交互式方法相比,GOAG 作为静态生成模型难以应对抓取过程中的接触动力学变化和实时力反馈。
论文Julien Merand2026-08-20原文

相关内容