行业新闻

北大团队提出AgentHOI框架 无需HOI标注实现人-物交互检测

北大提出AgentHOI,无需标注数据,用多模态大模型加视觉定位模型协作,实现开放世界人-物交互检测。

HOI(人-物交互检测)需要模型输出“人-骑-自行车”这类三元组并框出人和物。传统方法依赖大量标注,且难以应对新场景。北大团队提出的AgentHOI无需任何HOI标注,用多模态大模型推理交互语义,再让视觉定位模型定位人和物,通过多轮推理补全遗漏交互,在多人多物场景下也能准确识别。

正文摘录

- title: ECCV 2026 | 北大团队提出 AgentHOI:不用一张 HOI 标注图,大模型也能看懂「谁在对什么做什么」 - sourcecompany: 机器之心 - bodymarkdown: ![](https://image.jiqizhixin.com/uploads/article/coverimage/4783cab5-2168-44a1-9cbf-343f642e887e/058(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 该论文的第一作者和通讯作者均来自北京大学王选计算机研究所,共同第一作者为博士生雷廷和实习生刘佳林,通讯作者为博士生导师刘洋。团队近年来在 TPAMI、IJCV、CVPR、ICML 等顶会上有多项代表性成果发表,多次荣获国内外多模态理解与生成竞赛冠军,和国内外知名高校、科研机构广泛开展合作。 本文主要介绍来自该团队的最新论文 Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-31原文

相关内容