行业新闻

RefCaptioner 提升视频描述与参考图语义对应能力

RefCaptioner 解决多参考图视频描述中的图文对应难题,借助双层奖励与结构化学到更准的绑定,并开源了评测基准。

多模态大模型在描述视频时,参考图一多就容易对应错。RefCaptioner 通过后训练增强模型对参考图的识别与绑定能力,并用双层奖励函数抑制干扰项、合并同一实体的多视角图片。作者还构建了 MRVBench,将“描述正确”与“图文对应”分开评测,相关数据和代码已开源。

正文摘录

RefCaptioner:让参考图与视频语义精准对应 ![](https://image.jiqizhixin.com/uploads/article/coverimage/63b3e60e-a660-4678-a0f3-f494764d836f/021(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsg&tp=webp&wxfrom=5&wxlazy=1imgIndex=0) ![图片](https://mmbiz.qpic.cn/mmbizpng/5L8bhP5dIqHb4ZmmkZvyv7Zn2mbMuw2aDO6OhqIXD2seBYvVibI4wkXcBLDq8X74DOZdnCBOEx3wDILlzuBicqUu4q2y2ONCZmIFU3ibSviaL0U/640?wxfmt=png&from=appmsgimgIndex=1) 图 1:RefCaptioner 的任务动机。普通视频描述只生成文本,很难表达候选参考图与局部视频语义之间的对应关系;RefCaptioner 从最多 22 张候选图中选出视频实际出现的内容,将图像标签放在对应短语之后,同时排除无关干扰项。 近年来,随着多模态大模型的发展,视频理解领域已经能对视频内容进行详尽描述。然而,随着多参考图视频生成与编辑的推进,模型往往需要同时处理人物、服装、场景等多张参考图,并建立参考图与视频之间的对应关系。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-08-11原文

相关内容