行业新闻

华科等提出 AdaRoboVLG:解耦任务理解与抓取合成,跨机械手通用抓取框架

AdaRoboVLG 把任务理解与抓取合成解耦,用统一接口连接可组合的基础模型先验和跨机械手共享的抓取策略,新机械手或新任务可插拔接入,不用从头采集数据重训。

同样抓一只杯子,倒水时该握杯柄,递给别人时该把杯柄留给对方——抓哪里取决于任务。华中科技大学、北京大学、擎朗智能等提出 AdaRoboVLG,把「任务需要怎样抓」和「机械手如何抓稳」拆成两层:上层用视觉、分割、语言等基础模型的先验,把自然语言和场景转成抓取约束(抓哪、怎么接近、张开多宽);下层用共享的抓取策略为具体机械手生成并打分候选姿态。换机械手时只需配置运动学映射和兼容抓取类型,不必重训整套模型。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/19deaf78-7d57-4e89-9615-c1360cf83c23/038(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) [![](https://image.jiqizhixin.com/uploads/editor/57cb5b6b-c768-4008-a801-cbe000cdc2ba/1790330912475.png)](https://mp.weixin.qq.com/s/gS5Bwtf28wPMUYaR2V6dag) AdaRoboVLG:适用于不同机械手的任务自适应视觉语言抓取框架 同样是一只杯子,机器人到底应该抓哪里? 如果任务是把水倒进水槽,握住杯柄通常更合适;如果要把杯子递给别人,机器人最好把杯柄留给对方;如果杯子还在传送带上移动,抓取位置又必须随时间不断更新。周围堆放的杂物、目标遮挡和不同机械手的结构差异,又让一个看似简单的「伸手拿杯子」,变成空间、语义与动态控制交织的问题。 视觉 — 语言抓取(Vision-Language-Grasping,VLG)的目标,正是让机器人根据自然语言和具体情境,做出符合任务意图的抓取。这需要同时处理空间、认知、时序与本体四类挑战:找准目标并避开碰撞,理解物体用途,追踪持续变化的状态,还要适应不同机械手。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-25原文

相关内容