CoToGrasp: 基于规范工作空间学习的接触拓扑条件灵巧抓取合成
当前灵巧抓取规划器主要优化物理稳定性,关注物体能否被抓取,而非如何抓取以支持下游功能任务。然而,基于特定人类抓取分类法进行条件化抓取合成,通常需要成本高昂的物体标注数据集。 为应对这些局限,我们提出 CoToGrasp,一种新颖的生成式框架,可严格依据特定接触拓扑合成多样化、稳定的抓取。为绕开数据收集瓶颈,CoToGrasp 以物体无关方式完全训练。我们引入基于特征的规范工作空间,将局部物体特征投影到统一的夹爪中心域,从而将语义功能意图与任意物体几何解耦。通过在该工作空间内学习夹爪的内在接触流形,模型在推理时可对未见物体实现零样本泛化。 在大型 DexGraspNet 数据集上的广泛评估表明,CoToGrasp 达到当前最优性能,优于现有分类法引导的规划器。最后,我们在物理机器人平台上验证了合成接触拓扑的物理可行性 与 运动学可行性。
论文精读
TL;DR CoToGrasp 将接触拓扑与物体几何解耦,在规范工作空间中学习抓取接触流形,实现零样本、对象无关的灵巧抓取生成,性能超越现有分类引导方法。
问题
问题背景
灵巧手抓取规划长期以物理稳定性为优化核心,但机器人操作任务(如工具使用、物体传递)要求抓取方式符合特定功能意图,而非仅仅“抓得住”。
现有方法局限
现有 planner 大多将稳定性作为唯一优化目标,生成抓取与人类功能抓取分类学(如 precision/power grasp)脱节。少数 taxonomy-guided 方法虽能以接触拓扑为条件,却依赖对象级标注数据集,需要为每个物体人工标注可行的接触模式,采集成本极高、难以扩展到新物体。同时,这类方法通常直接在物体坐标系下建模接触分布,物体形状变化会导致接触拓扑空间分布剧烈改变,模型无法有效迁移。
为什么这个问题难/重要
核心难点在于:功能意图(语义)与物体几何(形态)高度耦合。同一功能抓取(如捏取)在不同物体上表现为完全不同的接触点分布;若不显式解耦,模型要么过拟合训练物体,要么需要海量标注覆盖物体多样性。业界对高性能、低数据依赖的灵巧抓取生成需求迫切,尤其在面向开放世界物体操作与快速技能迁移场景。CoToGrasp 采用对象无关训练与规范工作空间思路,为解除该耦合提供了直接路径:稳定性与功能意图分开建模,可显著降低数据标注依赖,提升未见物体的泛化能力。
行业类比
类似图像生成中从不带属性标签的数据学习可控属性解耦表示(如 StyleGAN 的 latent direction 编辑),CoToGrasp 试图在接触拓扑空间实现无标注的语义控制,避免逐物体注释。
核心洞察
- CoToGrasp 的核心创新在于将接触拓扑作为生成条件,并通过物体无关的规范工作空间训练,将功能意图与物体几何解耦,从而实现零样本泛化。与依赖物体标注数据集的分类学引导方法不同,其训练完全在抓手中心域进行,无需昂贵的物体-抓取配对标注,降低了数据门槛。这一设计使得模型能够学习到抓手内在的接触流形,在遇到未见物体时,根据指定接触拓扑直接生成稳定抓取,为功能导向的灵巧抓取提供了新范式。
- CoToGrasp 的规范工作空间投影机制将局部物体特征统一转换到抓手坐标系,有效解决了跨物体几何差异导致的泛化难题。相比只优化物理稳定性的传统规划器,它通过接触拓扑显式编码“如何抓”的语义,使生成结果更贴合下游任务需求。在 DexGraspNet 上的 SOTA 性能及实体机器人验证表明,该框架在保持稳定性的同时,还能保证拓扑条件的合规性,为实际部署提供了可信依据。
方法
输入与表示
输入包含两部分:目标物体的局部几何特征(通常为点云或局部 patch 编码)和指定的 接触拓扑(contact topology),即指尖在物体表面期望的接触模式。为消除不同物体形状带来的域偏移,CoToGrasp 将物体局部特征通过特征级投影映射到统一的 gripper-centric canonical workspace,该空间以机械手为中心,使接触拓扑语义与物体任意几何解耦。
关键模块
- Geometric Transfer via Canonical Workspace Learning:学习一个特征投影函数,将来自不同物体的局部特征转换到规范空间,其中相同接触拓扑对应相似的表示分布。
- Learning Contact Topology Templates using Self-Attention:在规范空间中,利用 self-attention 捕捉多个接触点之间的内在依赖,学习不同拓扑的接触流形模板,为生成提供结构先验。
- Grasp Synthesis Through Contact Points Generation:根据条件拓扑,生成符合该拓扑的接触点位置,随后通过后续优化或采样恢复完整抓取姿态,兼顾稳定性与多样性。
输出与训练
模型输出为满足指定接触拓扑的多样化抓取姿态,可直接用于未见物体的零样本推理。训练全程 object-agnostic,不使用物体标注数据集,显著降低数据采集成本。
与同类工作的差异:现有 taxonomy-guided planners 依赖昂贵的物体标注数据,CoToGrasp 通过 feature-based canonical workspace 在 gripper-centric 空间学习接触流形,使拓扑条件生成不再受限于物体数据标注。
实验
实验设计
- 数据集:在 DexGraspNet 大规模抓取数据集上进行评估,该数据集包含多样物体与标注。
- 训练设置:CoToGrasp 完全物体无关地训练,通过特征化规范工作空间将局部物体特征投影到统一的抓取器中心域,学习接触流形。
- 评估方案:与现有 taxonomy-guided planners 对比,指标侧重抓取多样性、物理稳定性、接触拓扑条件符合度等;并在真实机器人平台验证物理可行性与运动学可行性。
关键发现
- 在 DexGraspNet 上取得 state-of-the-art 性能,超越现有 taxonomy-guided planners。
- 模型实现零样本泛化:训练时未见物体,推理时能生成稳定多样的抓取。
- 接触拓扑条件有效解耦语义功能意图与任意物体几何,使抓取合成从“能否抓住”转向“如何抓以支持下游任务”。
与基线对比的深度解读
- 现有 taxonomy-guided planners 依赖昂贵的物体标注数据集来条件化抓取,数据收集瓶颈显著。
- CoToGrasp 通过物体无关训练绕开该瓶颈,利用规范工作空间将语义意图转化为抓取器中心的几何约束,因此在不同物体间迁移更强。
- 物理实验进一步表明,该方法合成的接触拓扑不仅数值上更优,在真实机器人上同样可行,具备工程部署潜力。
行业影响
落地场景
CoToGrasp 的 zero-shot 抓取合成能力可直接用于 电商仓储分拣:面对海量未知 SKU,机器人无需逐物体标注即可生成满足功能意图的抓取(例如抓取瓶装水时逼着手指贴合瓶身,而非捏盖)。服务机器人 场景中,捕捉特定 contact topology 可让抓取动作支持后续操作(如抓取工具递交、按电梯按钮)。此外,工业装配 和 医疗辅助 同样需要接触拓扑约束的灵巧操作。
商业价值
现有灵巧抓取数据集标注成本极高,CoToGrasp 的 object-agnostic 训练范式将成本从“逐物体标注”压缩到“一次性学习 gripper 本身的接触流形”。这直接降低了部署新产品的边际成本——新增 SKU 无需重新训练或标注。同时,条件生成带来的 topology controllability 可提升功能任务成功率,减少机器人误操作带来的停机与损坏,属于典型的降本增效路径。
与现有产品/工作流的接口
CoToGrasp 可作为 感知-规划-控制 栈中的一个可插拔 grasp planner 模块:感知模块(如 PointNet++ 或 RGB-D 相机)输出局部特征后,输入 CoToGrasp 生成接触点与手部位姿,再交由运动规划器(如 MoveIt)或力控模块执行。其代码已开源(GitHub),基于 PyTorch 实现,便于集成到现有 ROS/Isaac Sim 仿真或实机流水线。需要注意:当前模型主要针对多指灵巧手,若部署到两指夹爪需适配 contact topology 定义。
局限
- - **接触拓扑条件的抽象性**:CoToGrasp 用接触拓扑(contact topology)作为功能意图的代理,但拓扑本身只描述手指与物体接触点的分布,不包含时序和力控信息。对于需要动态操作(如旋转、按压、滑动)的任务,静态拓扑可能不足以约束生成抓取的功能性,模型生成的抓取可能稳定但无法执行后续操作。论文未提供与具体下游任务(如开门、使用工具)的端到端集成验证,因此实际功能泛化能力仍有待检验。
- - **对象不可知训练范式的限制**:完全 object-agnostic 的训练依赖于局部特征映射到规范工作空间,对于纹理稀疏、透明或可变形物体,局部特征提取可能失效,导致合成质量下降。此外,规范工作空间是基于特定机械手几何构建的,更换末端执行器(如不同自由度或手指布局)需要重新构建工作空间并重新训练模型,限制了跨平台的零样本迁移能力。
- - **评估范围的局限**:实验主要基于 **DexGraspNet** 数据集和少量真实机器人演示,真实实验可能只验证了部分接触拓扑序列的可行性,没有在杂乱场景、遮挡或不同材质物体上做系统测试。对比基线主要集中在 taxonomy-guided planners,缺少与基于强化学习、模仿学习或更通用抓取生成方法的定量比较,因此 **SOTA 声明** 的普适性还需进一步验证。