RefCaptioner 提升视频描述与参考图语义对应能力
RefCaptioner 解决多参考图视频描述中的图文对应难题,借助双层奖励与结构化学到更准的绑定,并开源了评测基准。
多模态大模型在描述视频时,参考图一多就容易对应错。RefCaptioner 通过后训练增强模型对参考图的识别与绑定能力,并用双层奖励函数抑制干扰项、合并同一实体的多视角图片。作者还构建了 MRVBench,将“描述正确”与“图文对应”分开评测,相关数据和代码已开源。
正文摘录
RefCaptioner:让参考图与视频语义精准对应 .jpg)   图 1:RefCaptioner 的任务动机。普通视频描述只生成文本,很难表达候选参考图与局部视频语义之间的对应关系;RefCaptioner 从最多 22 张候选图中选出视频实际出现的内容,将图像标签放在对应短语之后,同时排除无关干扰项。 近年来,随着多模态大模型的发展,视频理解领域已经能对视频内容进行详尽描述。然而,随着多参考图视频生成与编辑的推进,模型往往需要同时处理人物、服装、场景等多张参考图,并建立参考图与视频之间的对应关系。