北大团队提出AgentHOI框架 无需HOI标注实现人-物交互检测
北大提出AgentHOI,无需标注数据,用多模态大模型加视觉定位模型协作,实现开放世界人-物交互检测。
HOI(人-物交互检测)需要模型输出“人-骑-自行车”这类三元组并框出人和物。传统方法依赖大量标注,且难以应对新场景。北大团队提出的AgentHOI无需任何HOI标注,用多模态大模型推理交互语义,再让视觉定位模型定位人和物,通过多轮推理补全遗漏交互,在多人多物场景下也能准确识别。
正文摘录
- title: ECCV 2026 | 北大团队提出 AgentHOI:不用一张 HOI 标注图,大模型也能看懂「谁在对什么做什么」 - sourcecompany: 机器之心 - bodymarkdown: .jpg)  该论文的第一作者和通讯作者均来自北京大学王选计算机研究所,共同第一作者为博士生雷廷和实习生刘佳林,通讯作者为博士生导师刘洋。团队近年来在 TPAMI、IJCV、CVPR、ICML 等顶会上有多项代表性成果发表,多次荣获国内外多模态理解与生成竞赛冠军,和国内外知名高校、科研机构广泛开展合作。 本文主要介绍来自该团队的最新论文 Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild。