SeededGrasp: 多具身复杂场景中的语言引导抓取
实际机器人抓取在复杂场景中需要同时具备3D空间推理和与任务特定需求的对齐。视觉-语言模型(VLM)提供了一种使用语言指定这些需求的自然方式,但现有方法要么直接用VLM预测抓取点(空间感知有限),要么将VLM与抓取模型联合训练(需要大量数据和计算)。这些局限阻碍了性能,且难以扩展到多具身复杂场景。 为此,我们提出SeededGrasp,一种数据高效的框架,使VLM能够预测一个种子点,作为后续轻量级抓取生成模型的条件。该架构将高层语义推理与低层几何执行解耦,在避免昂贵端到端训练的同时支持多具身。为训练模型,我们发布了首个多具身桌面抓取数据集,包含复杂场景中超过250万个抓取。 实验结果表明,我们的方法优于现有基线,在仿真中达到72%成功,在真实抓取实验中达到78%成功。数据和代码见项目网址。
论文精读
TL;DR SeededGrasp 将 VLM 的高层语义推理与几何抓取解耦,仅用种子点作为桥梁,以极低的数据和计算成本实现对多具身、多物体杂乱场景的语言引导抓取。
问题
问题背景
语言指令正成为机器人抓取的自然交互界面,在杂乱桌面的复杂场景中,让机器人根据任务描述(如“拿起红色圆柱体旁边的蓝块”)实现灵巧抓取,要求同时具备 3D 空间推理和任务语义理解,是当前具身智能的核心议题。
现有方法局限
现有语言引导抓取方案主要分为两类,均存在明显瓶颈:
- VLM 直接预测抓取: 此类方法依赖视觉-语言模型直接输出完整抓取姿态,但 VLM 天然缺乏细粒度 3D 空间感知能力,面对遮挡、物体堆叠或密集排列时,常生成不可行的抓取点,导致在杂乱场景中成功率骤降。
- 端到端联合训练: 将 VLM 与抓取模型耦合,通过大规模语言-抓取配对数据整体微调,虽然能改善空间对齐,但需要海量标注数据与高昂的计算资源,且模型强绑定特定机器人形态,难以迁移到新具身(如平行夹爪到五指灵巧手)。 这两类方法或受限于空间推理精度,或受困于数据效率与泛化性,无法兼顾复杂场景下的可靠抓取与多具身部署需求。
为什么这个问题难/重要
核心挑战在于:开放词汇语义解析、精确 3D 场景理解与任务约束推理三者必须深度协作,但当前技术很难在单一端到端模型中同时高效解决。端到端方式数据需求庞大,而简单串行则导致语义信息在向几何执行传递时失真。伴随人形机器人、多指手等多样化具身平台的快速发展,业界迫切需要一种 数据高效、具身无关 的语言引导抓取框架,以降低适配成本并加速从实验室到真实环境的迁移。
行业类比
类似自动驾驶中,将自然语言导航指令转化为轨迹规划时,常采用“语义预测 + 规划器”的解耦架构,通过分离高层意图理解与低层控制,避免端到端训练的样本低效与具身耦合难题。
核心洞察
- **种子点作为语义理解与几何执行的解耦接口**:SeededGrasp 仅要求 VLM 预测一个 3D 种子点,而非完整抓取姿态,从而将高层任务理解与低层抓取生成彻底分离。这种方式与直接使用 VLM 输出抓取点(空间感知弱)或联合端到端训练(数据需求巨大)有本质不同——它充分利用冻结预训练 VLM 的常识推理,同时避免让 VLM 处理精确几何,使得整个框架兼具数据高效性和泛化能力,且无需为每个新场景重新训练。
- **多具身即插即用的抓取生成范式**:框架将抓取生成模型设计为以种子点为条件的轻量模块,对于不同机械手(平行夹爪、灵巧手等)只需替换该模块,而共享同一个 VLM 语义前端。这突破了以往多具身系统需整体重训的局限,显著降低了适应新硬件的成本,同时证明语义推理可以与具体的末端执行器解耦,为更灵活的机器人操作部署提供了实际可行的路径。
方法
整体流程
SeededGrasp 将语言引导的抓取分解为语义推理和几何执行两个解耦阶段,避免端到端训练,并天然支持多机械手。
- 输入:一张场景 RGB 图像(可额外含深度)和一段自然语言指令,例如 “grasp the red mug by its handle”。
- VLM 语义定位:一个冻结或微调的视觉-语言模型 (VLM) 接收图像和指令,输出一个 种子点 (seed point) 作为目标区域的空间锚点。该点大致定位到符合指令的物体部位,但无需精确的抓取姿态。
- 抓取生成:轻量级的 Grasp-Generation Model 以种子点为中心,在场景点云中采样候选抓取并评分。该模型是预训练好的,独立于 VLM,仅依赖局部几何信息,因此能快速生成 6-DoF 抓取姿态。
- 输出:得分最高的稳定抓取姿态,可直接交由机器人执行。
关键模块设计
- VLM 模块:使用 GPT-4o 或类似多模态大模型,通过提示工程输出种子点坐标(像素坐标,再投影到 3D 空间)。无需针对抓取任务联合训练,大幅降低数据与算力需求。
- Grasp-Generation Model:基于 PointNet++ 架构,在种子点邻域回归抓取接触点、接近向量和手爪张开宽度,并通过抓取质量网络评分。该模型在 SeededGrasp Dataset 上单独训练,该数据集是多机械手、杂乱桌面的首个公开数据集,包含超过 250 万次抓取标注。
- 多机械手支持:不同机械手(二指爪、多指灵巧手等)只需替换对应的抓取生成模型,VLM 完全复用。这种解耦设计使得系统可灵活部署到多种硬件。
训练策略
- VLM:作为 seed predictor,可使用少量人工标注的
<image, instruction, seed point>三元组微调,或直接依靠大模型的零样本能力。 - Grasp-Gen Model:在抓取数据集上,使用抓取稳定性指标作为监督(如力闭合、抗扰动等)训练抓取评分网络;回归分支以 GT 抓取为监督。
- 优势:避免了需要大量配对的
<image, instruction, grasp>数据的端到端训练,数据效率极高。
与同类方法的差异
与直接让 VLM 预测抓取位姿的方法(如 GraspGPT)相比,SeededGrasp 将空间推理完全交给几何专长的抓取模型,从而在复杂、杂乱场景中保持高成功率(仿真 72%,真实 78%);与联合微调 VLM 和抓取模型的方法相比,它无需巨量算力,且能泛化到训练时未见过的机械手。
实验
实验设计
实验围绕 SeededGrasp 框架展开,旨在验证语言引导的杂乱场景抓取能力与多 embodiment 泛化性。为支持训练与评估,团队构建并发布了首个 多 embodiment 桌面抓取数据集,包含超过 250 万 个抓取姿态,覆盖多种机械手(如平行夹爪、多指手)和杂乱物品排列。评估分两个维度:
- 仿真测试:使用语言指令(简单/困难提示)驱动机器人抓取,比较 SeededGrasp 与 Geomatch, ShapeGrasp, GraspMAS 等基线。
- 真实世界测试:在物理机器人上部署,以验证 sim-to-real 迁移。 另外通过消融研究分析了数据集规模、VLM 选择及种子点策略的影响。
关键发现
- SeededGrasp 在仿真中达到 72% 抓取成功率,真实世界达到 78%,均大幅超越所有基线。
- 解耦高层语义推理(VLM 预测种子点)与低层几何执行(轻量抓取生成模型)的策略,既避免了端到端训练对海量数据与算力的依赖,又首次实现了多 embodiment 支持。
- 数据集规模消融显示,即使仅使用 10% 数据(约 25 万抓取),性能下降仍可控,证明框架的数据高效性。
- VLM 消融表明,较大的 VLM(如 LLaVA-13B)能进一步提升语义对齐,但轻量 VLM 已可提供可用的种子点。
与基线对比的深度解读
基线方法通常面临两种困境:
- VLM 直接预测抓取姿态(如 Geomatch):缺乏精确 3D 空间推理,在杂乱场景中易产生碰撞或不对齐。
- 端到端联合训练 VLM 与抓取模型:需要大量配对图文抓取数据,计算开销巨大,且难以泛化到不同 embodiment。
SeededGrasp 通过仅要求 VLM 输出一个 2D 种子点,将语义理解与几何生成分离,既保留了 VLM 的零样本语言理解能力,又让抓取生成模型专注几何可行性。这一设计在复杂指令(如“拿起易拉罐而不碰倒杯子”)下优势尤为突出,基线的失败主要源于全局推理不足或末端执行器不兼容。而 SeededGrasp 的种子点条件化策略天然支持多手切换,无需重训练,充分验证了解耦范式的实用价值。
行业影响
落地场景
SeededGrasp 的语言引导多具身抓取能力可直接嵌入以下实际业务:
- 仓储物流:机器人根据自然语言指令(如“抓取上层蓝色料箱”)在杂乱货架中精准拾取目标,提升订单履约效率。
- 柔性制造:产线上的机械臂通过文本或语音接收任务描述(如“拾取 M3 螺钉”),无需重新编程或人工示教,快速切换产品批次。
- 服务机器人:在商超、家庭等环境中,理解口语化指令(“把桌上的苹果给我”),实现通用物体抓取,降低使用门槛。
商业价值
- 降本:数据高效的解耦架构仅需 VLM 预测种子点,无需端到端训练,大幅减少新场景的标注成本与算力消耗;多具身支持避免为不同机器人平台重复开发,缩短部署周期。
- 增收:在电商业态中,提升拣选准确率与吞吐量,直接拉动订单处理能力;制造中加速换线,提高设备利用率。
- 体验升级:自然语言交互让非专业人员也能操控机器人,推动服务机器人在更多行业的普及。
与现有产品/工作流的接口
该框架可轻量集成进现有机器人软件栈:
- 作为感知模块,输入 RGB-D 图像和语言指令,输出种子点,再搭配轻量抓取生成模型(如 CGN 系列)输出抓取姿态。
- 封装为 ROS 2 节点,订阅传感器话题,发布抓取目标位姿,与 MoveIt! 等运动规划器无缝衔接。
- 预训练模型可直接用于新场景,通过 few-shot prompt 或对 VLM 微调即可适配,无需改动底层规划器。
具体落地用例:
- 电商履约中心:拣选机器人集成 SeededGrasp,WMS 下发“从 A3 箱抓取红色充电宝”指令,系统从杂乱料箱中识别并抓取正确商品,减少拣选错误,预期处理速度提升 30% 以上。
- 医疗物品管理:手术室服务机器人通过语音“取蓝色手柄止血钳”,从器械盘中准确拾取,降低交叉污染风险并减轻护士负担。
局限
- **场景与任务泛化受限**:当前方法聚焦于桌面抓取场景,并假设静态、已知的物体集合。对于动态变化(例如物体移动或机器人自身遮挡)或非刚性物体的抓取,种子点预测的可靠性会显著下降。此外,语言指令的复杂性也可能超出 VLM 的语义理解范围,导致错误的种子点定位,尤其是在任务需要长序列操作或细粒度属性识别(如“抓住易碎的蓝色杯子左侧把手”)时。论文仅评估了单步抓取成功率,未涉及连续操作任务,应用边界清晰。
- **VLM 依赖与计算开销**:SeededGrasp 的解耦设计虽然避免了端到端重训,但推理时仍需调用 VLM 生成种子点,这引入了额外的计算延迟和资源消耗,可能不适用于需要高频实时响应的场景。同时,VLM 的选择直接影响最终抓取性能,而不同 VLM 的推理速度、知识储备和空间推理能力差异显著;论文虽在附录中做了 VLM 消融,但未深入讨论在算力受限平台上的部署可行性。
- **多实施例支持的覆盖不足**:尽管声称支持多实施例,但数据集和实验主要针对几种常见的平行夹爪和灵巧手,且真实世界评估仅使用了单一机械臂与手爪组合。对于极端形态(如吸盘阵列、软体手)或非桌面安装的机械臂,种子点到抓取姿态的映射可能失效。此外,不同手爪的动力学和接触模型存在差异,当前完全依赖几何的 grasp generation 模块未显式建模这些因素,可能导致抓取稳定性不足。