重新审视机器人操作中的 Articulated Parts 感知
我们周围充斥着各种带有可动铰接部件的物体,例如盒子、把手、门。准确且泛化的铰接部件感知对于提升机器人操作能力至关重要。基于这一需求,近期铰接部件感知研究主要沿两个方向展开:一是基于位姿的表示,但需要高昂的人工成本;二是基于功能性的方法,通过点跟踪推断物体未来运动,无需额外人工,但数据质量较低。 本文提出一种新的铰接部件表示——几何主结构,通过对部件几何结构进行抽象,在可扩展性与数据质量间取得平衡。为高效可扩展地收集数据,GPS 结合便携式虚拟现实设备,仅需一分钟即可标注一个物体序列。这种直接人工标注比估算出的功能性提供更高质量。借助VR-GPS系统,我们收集了41K 帧数据,涵盖 6 类部件的 234 个物体,并训练出一个以单张 RGB-D 图像为输入的泛化 GPS 模型。 在物体操作中,我们基于 GPS 预测部署启发式策略。无需任何领域内微调,该方法在 9 个物体的 270 种初始状态下达到73% 成功率。代码、数据和可复用工具已开源。
论文精读
TL;DR 提出 Geometric Primary Structure (GPS) 表示,用 VR 高效标注将人工成本压缩至 1 分钟/序列,训练单 RGB-D 输入模型,配合启发式策略在 270 种初始状态下实现 73% 的零微调操作成功率。
问题
问题背景
机器人操作中,铰接部件感知 (articulated parts perception) 是使机械臂能打开抽屉、转动旋钮、拉开门等日常任务的关键。该领域长期关注如何让机器人从视觉输入中准确理解物体的可动部分及其运动约束,并据此规划动作。
现有方法局限
当前主流方法分为两类,各有明显短板:
- 基于位姿的表示 (pose-based):需人工标注每帧的 6D 部件位姿,虽然几何精度高,但标注一个物体序列常需数小时,人力成本极高,难以规模化构建大数据集。
- 基于 affordance 的方法 (affordance-based):通过点跟踪从视频中估计未来运动,无需人工标定,但数据质量严重受限于视觉噪声与跟踪误差,常产生低质量运动标签,导致模型泛化性差。
简言之,现有方案在“低成本”与“高质量”之间无法兼得,这直接限制了可训练数据的规模与可靠性,进而阻碍可泛化感知模型的开发。
为什么这个问题难且重要
铰接对象的运动学结构复杂多样——从旋转轴位置到平移方向,不同物体差异巨大,模型需要从单帧 RGB-D 中同时推断几何形态与运动语义。现实场景中物体种类开放,要求模型具备少样本或零样本泛化能力。同时,操作任务要求感知输出能直接支撑下游策略,这对表示形式的工程可用性提出高标准。业界对 通用操作机器人 的需求持续增长,铰接部件感知成为其中“最后一厘米”的技术瓶颈,受到大量关注。
行业类比
类似于 开放世界目标检测 从有限标注类别泛化到任意物体检测的挑战,铰接部件感知也需要在设计精巧的表示上,结合高效的人类监督(如 VR 标注),才能在低成本下获得高质量的通用感知模型,这正是本工作的出发点。
核心洞察
- GPS 表示通过抽象部件几何结构,在姿态表示的标注成本与可供性方法的数据质量之间取得平衡。现有姿态方法需手工标注精确 6D 姿态,成本极高;可供性方法从点跟踪自动提取运动,数据噪声大。GPS 仅标注简化的几何结构(如旋转轴、平移方向),既降低标注复杂度,又保留操纵所需的关键约束,兼具可扩展性和高质量。
- 便携式 VR 设备与 GPS 表示协同设计,将单物体序列标注时间压缩至一分钟,实现高效的人机交互数据采集。VR 提供直观 3D 交互,人类只需拖动控制器即可标注部件的运动结构与几何参数,相比传统手动工具大幅提升速度和易用性,使快速构建大规模多样化数据集成为可能,为机器人学习的高效数据获取提供新思路。
方法
输入与表示定义
方法以单帧 RGB-D 物体图像 作为输入,目标是为图像中每个可动关节部位输出一种新型表征——Geometric Primary Structure (GPS)。GPS 是零件几何形态的抽象,不直接输出完整的 6D 位姿或未来运动轨迹,而是刻画关节运动的几何基元:对于旋转关节,GPS 编码转轴的空间位置与方向;对于平移关节,则描述滑动方向与运动范围。这种表征设计刻意避开了完整姿态预测所需的高昂人工标注,同时比基于点跟踪的 affordance 信号更稳定、更精确。
关键模块:高效 VR 标注与模型学习
数据采集瓶颈的突破是本工作的一个核心贡献。团队构建了一套便携 VR 标注系统,标注员通过手柄拖拽虚拟物体部件来模拟运动,系统自动记录运动前后的点云并解算出 GPS 参数,单物体序列标注仅需约 1 分钟,远低于传统姿态标注方案。利用该系统,为 234 个物体 采集了 41K 帧 标注数据,覆盖 6 个部件类别。
模型部分采用一个可泛化的 GPS 预测网络,以上述单帧 RGB-D 图像为输入,输出逐像素或逐区域的 GPS 参数(如旋转轴参数、平移向量)。网络架构基于编码器-解码器设计,以端到端方式回归 GPS 几何量。训练时使用 VR 标注的真值进行监督,损失函数直接优化 GPS 参数的预测误差,从而保证推断精度。模型未使用任何域内微调即可直接部署到新物体上。
输出与操控策略
GPS 预测结果直接驱动下游的启发式操控策略。对于抓取后的零件操控,策略根据预测的转轴位置决定末端执行器的运动圆弧,或沿平移方向施加直线运动,无需复杂的运动规划或强化学习训练。实验在 9 个物体、270 个初始化状态 下达到 73% 的成功率,验证了 GPS 表征对操控任务的直接有效性。
与同类方法的差异
相较于 pose-based 方法需要大量手工标注完整姿态参数,以及 affordance-based 方法依赖低质量点跟踪信号,GPS 通过引入结构抽象实现标注效率与数据质量的平衡,同时其 VR 标注工具可实现快速迭代,更适合工程落地的可扩展需求。
实验
实验设计
本研究构建了 VR-GPS Dataset,通过便携 VR 设备采集 234 个物体共 41K 帧 RGB-D 序列,涵盖 6 类铰接零件。每段序列标注耗时约一分钟,比传统姿态标注高效。训练阶段,仅使用单帧 RGB-D 图像预测物体的几何主结构(GPS),模型输入为单视角深度与颜色。测试阶段,在真实机器人场景部署基于 GPS 预测的启发式策略,对 9 个未见物体、270 种初始状态进行操作评估,无需域内微调。
关键发现
- 高效率标注:VR 辅助下人均标注每物体序列仅需 1 分钟,远低于姿态标注所需成本。
- 强泛化性:模型在未见物体上无需微调即达到 73% 操作成功率,覆盖 270 种初始配置,证明 GPS 表示具备通用性。
- 数据质量:直接人类标注的 GPS 比基于点跟踪的 affordance 估计噪声更低,有利于策略学习。
与基线的对比
与现有两类主流方法对比:
- 姿态表示 (pose-based):虽精度高但依赖昂贵的逐关节参数标注,难以规模化;GPS 从单张图像直接回归结构参数,显著降低先验要求。
- 示教表示 (affordance-based):从点运动预测未来动作,受点跟踪误差影响,数据质量差;GPS 避免了运动估计误差,由人类直接提供几何抽象,质量更优。 虽然论文未提供具体成功率对比数值,但无微调 73% 的成功率表明 GPS 在实用性与可扩展性之间取得了良好平衡,为后续策略学习提供了可靠感知基础。
行业影响
落地场景
Geometric Primary Structure (GPS) 为机器人操作中的关节零件感知提供了一种低人工成本、强泛化的解决方案。它可以嵌入任何需要与可动部件交互的自动化系统:仓储物流中的开箱/关门、家庭服务中的抽屉与柜门操作、工业产线上的设备维护(如扳手、阀门)。尤其在非结构化环境下,机器人需处理未见过的铰接物体,GPS可直接从单帧 RGB-D 图像中预测旋转轴、平移方向等几何抽象,支撑下游操作策略。
商业价值
传统方案依赖高成本的人工标注姿态(pose-based)或低质量自动提取(affordance-based),GPS 的 VR 标注工具将单物体序列的标注时间压缩到约 1 分钟,显著降低数据获取的边际成本;同时,预测结果比 affordance 方法更准确,减少了因感知失败导致的操作中断与设备损耗。从降本增效看,可支撑更广泛的 SKU 覆盖,提升机器人利用率。最终提升终端体验:机器人能可靠执行开门、拧盖等精细化动作,推动服务机器人和自动化物流的规模化落地。
与现有产品/工作流的接口
GPS 作为轻量视觉模块,输入为单张 RGB-D 图像,输出旋转/平移的几何参数,可无缝接入现有机器人感知-规划栈:
- 感知端:可替换或补充基于点云的目标检测/分割模块(如 PointNet++、Mask R-CNN)。
- 规划端:输出的参数可直接转化为运动原语(如旋转角度、平移向量),与 MoveIt、Diffusion Policy 等规划器结合,实现开环或闭环控制。
- 数据管线:VR 标注工具可集成到合成数据或遥操作标注流程,加速模型迭代。
具体落地 Use Case
- 电商仓储拆零拣选:搬运机器人面对装有铰链盖板的料箱或带拉手的周转箱,GPS 实时预测盖板旋转轴,驱动夹具完成开盖-抓取-关盖序列,减少人工开箱动作,提升拣选效率。
- 医疗辅助机器人:手术室中移动设备(如带关节臂的监护仪)需要调整方位,机器人利用 GPS 识别关节结构并安全操作,避免因碰撞或错误施力导致损坏。
以上场景均不涉及针对特定物体的事先微调,GPS 的泛化能力可直接适配新物体,加速机器人从演示到部署的流程。
局限
- **表示粒度有限**:**Geometric Primary Structure (GPS)** 将关节运动抽象为旋转与平移两大类,虽能覆盖常见铰接物体,但无法表示更复杂的运动类型(如螺旋、平面复合运动)或柔性变形。对于**多关节串联物体**或**非刚体部件**(如软体抓手),GPS 表示的适用性显著下降。其几何抽象在追求可扩展性的同时,丢弃了精确的位姿信息,可能导致无法应用于需要精确配合的精细操作任务。
- **数据依赖与泛化瓶颈**:VR 标注虽效率较高(单序列约 1 分钟),但仍依赖人工介入,无法实现完全自动化数据生成。且模型仅在 6 类部件、234 个物体上训练,物体多样性和视觉复杂性有限。从单张 **RGB-D 图像**预测 GPS,对**遮挡、视角变化及不同光照**的鲁棒性未充分验证。实验显示的 73% 成功率也表明,在更复杂现实场景中,预测错误会直接导致启发式策略失败,且策略本身未考虑重规划与闭环反馈。
- **启发式策略简单**:操作策略完全基于 GPS 预测的几何结构,采用固定规则生成抓取与运动序列,缺乏对动态环境和任务约束的适应性。与基于学习的策略(如 Diffusion Policy)相比,难以处理需要推理接触物理或适应意外扰动的场景。文中虽提及可与 Diffusion Policy 结合,但该方向尚未被充分探索,目前方案仍是开环执行,对初始位姿和预测精度高度敏感。