行业新闻

人大与智源等提出 ROMA:让机器人主动交互感知物体物理属性

ROMA 把视听触力四模态接入机械臂,让机器人自主决定何时、对哪个物体做什么交互来补齐信息,并配套近 2000 件真实物体的数据集与评测基准。

人类判断一个盒子是否为空,往往要拿起来摇一摇、掂一掂,而不是只看一眼。人大高瓴 GeWu-Lab、智源研究院等机构提出 ROMA 系统,把视觉、听觉、触觉、力四种模态接到机械臂上,让机器人自己判断缺什么信息、该和哪个物体做什么交互,并据此完成对物体物理属性的推理。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/86d73500-d307-4cd3-9e7d-d017e1858cae/017(2).jpg) ![图片](https://mmbiz.qpic.cn/mmbizjpg/5L8bhP5dIqFg0WfYlyqqeepLD4C3TibGpjf6FOH7EVuKjibcnDe74qjAU9XhgHylI3WghS7ricbx1ckkNhJHaQ2AnGqG5ZmOdwHJQLl99bxYHU/640?wxfmt=webp&from=appmsgimgIndex=0) 我见,我摸,我理解 。 人类认识一个物体,从来不只是「看」。看到一个盒子,我们可能会拿起来掂一掂,判断它有多重;我们可能会摇一摇,听听里面有没有东西;还可能会捏一捏,试试它软不软。人类感知世界的过程不是被动地接受已有的感官信息,而是在 发现我们对身边事物不够了解时,主动地与之交互,根据交互的信息补全对世界的物理理解。 来自人大高瓴 GeWu-Lab、智源研究院、燧行 AresoX 等机构的研究者所提出的 ROMA (Real-World Object-Centric Multi-Sensory Active Perception) ,正是希望将这种主动感知物理世界的能力赋予多传感器机器人。该工作全面地从 数据集与 Benchmark、多模态推理模型和物理交互系统 展开对 具身多模态主动感知 的系统研究,希望为 下一代主动具身 Agent 铺平道路。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-10-10原文

相关内容