人大与智源等提出 ROMA:让机器人主动交互感知物体物理属性
ROMA 把视听触力四模态接入机械臂,让机器人自主决定何时、对哪个物体做什么交互来补齐信息,并配套近 2000 件真实物体的数据集与评测基准。
人类判断一个盒子是否为空,往往要拿起来摇一摇、掂一掂,而不是只看一眼。人大高瓴 GeWu-Lab、智源研究院等机构提出 ROMA 系统,把视觉、听觉、触觉、力四种模态接到机械臂上,让机器人自己判断缺什么信息、该和哪个物体做什么交互,并据此完成对物体物理属性的推理。
正文摘录
.jpg)  我见,我摸,我理解 。 人类认识一个物体,从来不只是「看」。看到一个盒子,我们可能会拿起来掂一掂,判断它有多重;我们可能会摇一摇,听听里面有没有东西;还可能会捏一捏,试试它软不软。人类感知世界的过程不是被动地接受已有的感官信息,而是在 发现我们对身边事物不够了解时,主动地与之交互,根据交互的信息补全对世界的物理理解。 来自人大高瓴 GeWu-Lab、智源研究院、燧行 AresoX 等机构的研究者所提出的 ROMA (Real-World Object-Centric Multi-Sensory Active Perception) ,正是希望将这种主动感知物理世界的能力赋予多传感器机器人。该工作全面地从 数据集与 Benchmark、多模态推理模型和物理交互系统 展开对 具身多模态主动感知 的系统研究,希望为 下一代主动具身 Agent 铺平道路。