论文

人类通用抓取 (HUG)

人类通用抓取 (HUG)

人类能够轻松抓取各种物体,而多指机器人远未达到这种通用性。本文提出HUG,一种流匹配模型,能从单个RGB-D图像生成多样化的人类抓取,实现零样本机器人操作。 首先,我们使用智能眼镜收集了1M-HUGs数据集,包含100万帧(27.8小时)的自我中心人类抓取数据,覆盖41栋建筑中的6707个物体实例。其次,模型融合RGB和深度观测,输出由手腕平移、手腕旋转和MANO手部姿态参数化的抓取。预测的抓取可重定向到多种机器人手,实现日常场景中的零样本抓取。 为标准化评估,我们构建了HUG-Bench模拟基准,包含90个来自5个几何类别、不同尺寸的未见物体,并提供度量尺度3D网格。在HUG-Bench的30个物体测试集上,HUG在真实世界中跨多个立体相机、机器人形态和家庭环境进行评估,比最先进的抓取基线分别高出+23%和+34%。 代码、数据、基准、检查点和交互演示已发布在 https://grasping.io/。

论文精读

TL;DR **HUG** 从大规模人类抓取数据中学习,通过流匹配模型由 RGB-D 图像直接生成多样抓取姿态,零样本部署到多款机器人手,在挑战物体集上超越 SOTA 超 23%。

问题

问题背景

机器人多指手的通用抓取是领域核心目标。现有系统在特定物体或夹具上表现尚可,但远未达到人类随手拿起任意物体的灵巧度,泛化能力严重不足。

现有方法局限

  • 基于分析/规则的方法依赖理想接触点,难以应对形状、材质各异的新物体,泛化能力弱。
  • 基于学习的方法面临数据稀缺:真机采效低,模拟器存在 sim-to-real gap。现有数据集(如 GraspNet)多为平行爪夹设计,多指手抓取标注(手部姿态、接触)极为匮乏。
  • 生成式抓取模型(CVAE、扩散模型等)尝试从点云/深度图采样抓取姿态,但多聚焦于夹爪的 6-DoF 单姿态,难以建模高维手部姿态的连续分布与抓取多样性。
  • 已有工作利用人类示范(遥操作/视频),但缺乏大规模、自我中心、带精确手部姿态标注的数据,且未解决 从人类手到机器人手的跨形态映射零样本泛化 问题。

为什么难/重要

技术挑战在于:需从单张 RGB-D 图像推理物体 3D 几何与可抓取区域,并输出符合物理约束、稳健且多样的抓取姿态——要求模型同时具备 3D 感知、几何推理和生成能力。不同机器人末端执行器形态差异大,需通用表示(如 MANO 手部模型)桥接人类与机器人。业界关注度高,因通用抓取是服务机器人进入非结构化环境(家庭、仓库)的关键瓶颈,直接影响成本与部署可行性。

行业类比

这类似于 大语言模型 通过预训练从海量文本学习通用语义,实现零样本下游任务;HUG 旨在从大规模人类抓取数据学习通用抓取先验,再针对不同机器人手 零样本适配,有望成为机器人抓取的“基础模型”。

核心洞察

  • 从可穿戴设备记录的大规模第一人称人类抓取数据直接学习可泛化的抓取技能。与在合成数据或受限真实数据上训练的抓取方法不同,HUG 使用智能眼镜采集了 1M+ 帧的自我中心视频,包含 6707 个物体实例,覆盖多种日常场景。这种数据采集方式更接近人类自然行为,为模型提供了丰富的、细粒度的抓取先验,使其能泛化到训练数据中未见的物体形态和尺寸。
  • 基于流匹配的生成式抓取框架统一了多样性与精确性。现有方法常将抓取归结为单一最优解或受限于坍塌的确定性回归,而 HUG 用 flow-matching 建模完整的抓取分布,可从同一输入生成多种合理抓取。同时,抓取参数化为与机器人无关的手腕姿态和 MANO 手部姿势,再通过简单的重定向适配不同灵巧手,实现真正的零样本跨硬件迁移,显著降低了部署成本。

方法

HUG 将人类抓取建模为条件生成问题:给定单张 RGB‑D 图像中用户指定的物体,生成符合人类先验的手部抓取姿态。

输入

  • 单帧 RGB‑D 图像:由立体相机(如 Aria)采集,提供稠密深度对齐的彩色图。
  • 物体指定:通过点云裁剪(以物体为中心的球半径)或交互式 click 指定目标物体,模型仅对该区域进行推理。

关键模块

HUG 采用 流匹配(Flow Matching) 生成框架,核心是学习从简单先验(高斯噪声)到目标分布的常微分方程路径。

  1. 特征融合:RGB 与深度点云经独立编码后融合,提取物体几何与外观的联合表征。深度输入转换为稀疏点云,并通过 PointNet 类结构编码局部几何;RGB 分支用 CNN 提取多尺度视觉特征。
  2. 流匹配过程:将抓取表示(手腕平移、手腕旋转、MANO 手姿态参数)视为连续变量,通过神经网络预测速度场,从随机姿态开始逐步迭代去噪,最终生成可行抓取。训练时使用 条件流匹配损失,使生成路径匹配真实人类抓取分布。
  3. 参数化:抓取由 手腕平移(3D 位置)、手腕旋转(6D 连续旋转)、MANO 低维手部姿态(45 维,不含全局位姿)联合表示,与手模型解耦,便于后续重定向。

输出

一组 MANO 手部参数 可直接驱动手模型并渲染,也可通过关节映射重定向至不同机器人手(如 Allegro、Leap Hand),实现零样本抓取。生成结果具有多样性:对同一物体可采样多个合理抓取姿态。

与同类方法的差异

与以往的判别式抓取方法(如直接回归单个最优抓取)或基于单模态(仅 RGB)的生成模型相比,HUG 借助 大规模人类演示数据集 1M‑HUGs流匹配 训练,能够显式建模人类抓取的多峰分布,并在 RGB‑D 融合下获得更强的 3D 推理能力,从而在未见物体上显著提升成功率(+23% ~ +34%)。

实验

实验设计

HUG-Bench 是一个新提出的模拟评估基准,包含 90 个未见物体,来自 5 种几何类别,每种物体都提供度量级 3D 网格。模拟抓取在 MANO 手模型上进行,真实世界测试则使用 30 物体子集,在多款立体相机、多种机器人形态(通过手腕位姿 + MANO 参数重定向到不同手爪)和家庭环境中执行。基线包括现有抓取规划及学习方法。

关键发现

  • 零样本泛化:HUG 无需微调即能在新物体上生成稳定抓取,成功率大幅领先基线。
  • 多样化抓取:流匹配模型输出条件于物体点云的抓取分布,而非单点估计,便于从多个候选姿态中选取最优解。
  • 鲁棒性:在模拟和真实世界中均观察到一致的性能提升,对于不同相机视角和手爪形态均保持有效。
  • HUG-Bench 挑战集上,HUG 相对 SOTA 抓取基线提高 +23%+34%(可能对应不同设置,如模拟 vs 真实或不同指标)。

与基线对比深度解读

传统抓取方法常依赖预设的手爪几何、物理仿真优化或有限的数据集,难以触及自然人类抓取的分布。HUG 直接从 1M-HUGs 大规模第一人称人类抓取数据集中学习,通过流匹配建模高维姿态空间,生成的抓取天然符合物体几何与人类直觉。这种 人体先验 + 流匹配 的组合既保证了多样性,又能在重定向到不同机器人手时保持成功率。相比于需要强化学习或复杂仿真 pipeline 的方法,HUG 的训练仅需图像观测与抓取标注,效率更高;并且其自监督的数据采集方式(用智能眼镜记录人类日常抓取)大幅降低了数据获取成本,为机器人灵巧操作开辟了数据驱动的新路线。

行业影响

落地场景

HUG 所实现的通用零样本抓取,可直接赋能多个机器人场景:

  • 物流仓储:拆垛、分拣、订单履行中的任意物体抓取;
  • 制造业:柔性产线上料、装配辅助,减少专用夹具需求;
  • 家庭服务机器人:在杂乱家居环境中拾取日常物品,如餐具、玩具;
  • 医疗辅助:抓取药品、器械,适应不同形状尺寸;
  • 零售与电商:自动补货、货架整理,甚至即拿即走商店的机器人操作。

商业价值

  • 降本:替代人工重复抓取劳动,减少劳动力短缺影响;无需为每种物体设计专用末端执行器,降低硬件成本。
  • 增收:使机器人能部署于更多非结构化环境,扩大可服务市场(如中小型仓库、便利店)。
  • 体验提升:零样本泛化能力意味着部署后无需大量人工标注或针对新物体重新训练,系统上线速度提升一个数量级。

在现有基线对比中,HUG 在困难物体集上相对 SOTA 提升 +23% 和 +34%,这在商业拣选任务中可直接转化为吞吐量或成功率的显著收益

与现有产品/工作流的接口

HUG 可作为抓取规划的可插拔模块集成进现代机器人软件栈:

  • 输入:消费级立体相机(如 Intel RealSense)采集的单帧 RGB-D 图像,无需多视角或额外传感器。
  • 输出手腕位移+旋转+MANO 手部姿态,可直接通过逆运动学映射到不同机器人手(如五指灵巧手、三指夹爪),支持主流 ROS 工具链(如 moveittf2)。
  • 集成模式:用 HUG 替代传统抓取候选生成器(如 GPD、AnyGrasp),与抓取执行、路径规划模块串联。

具体落地 Use Case

  1. 电商仓储自动拣选机器人:在周转箱上安装立体相机,实时拍摄待拣取商品。HUG 直接预测抓取姿态,控制六轴机械臂与两指或三指夹爪完成拣选。由于模型在 HUG-Bench 上对未见几何形状泛化出色,可处理长尾商品(异形包装、柔性物体),减少人工补录 SKU 数据的成本。
  2. 家用服务机器人辅助拾取:专为行动不便人群设计的移动机器人,搭载 Intel RealSense 相机和轻量臂。用户通过语音指令“帮我拿桌上的杯子”,机器人调用 HUG 从 RGB-D 图像生成多种握杯姿态,选择无碰撞方案执行,显著提升日常任务自主完成率。

局限

  • **依赖高质量深度输入与场景覆盖**:HUG 以单帧 RGB-D 为输入生成抓取,深度噪声或缺失(如透明、高反光物体)会严重损害预测质量。数据集和实验均在室内环境采集,模型对室外多变光照、纹理稀疏的场景泛化能力未经验证。单视角 ego-centric 观测天然存在遮挡,算法可能输出穿模或不可达的抓取。
论文Kevin Yuanbo Wu2026-06-15原文

相关内容