论文

Vision-Language Grounding as Bidirectional Concept Correspondence

Vision-Language Grounding as Bidirectional Concept Correspondence

视觉-语言定位 旨在将语言与视觉内容相关联,但现有的大多数方法将定位简化为一个单向定位问题:给定预先指定的文本短语或类别名称,识别相应的图像区域。这种设定假设相关语言单元已知,忽略了接地通信中一个更基本的挑战:确定文本的哪些部分具有视觉指称性,以及它们如何与图像中的实体对应。 我们将定位建模为图像-文本对上的双向概念对应。给定图像及其配对文本,目标是在不假设提供相关文本片段的情况下,恢复所有视觉指称性文本跨度与实例级图像片段之间的对应关系。这一表述将常见的定位任务统一起来,包括短语定位、指称表达定位和开放词汇检测,将文本分割、图像分割和跨模态对齐视为一个统一的对应关系预测问题。 为了解决该任务,我们引入了 ConCor-1,一个基于预训练视觉-语言模型构建的定位模型。它使用可学习的桥接令牌来表示候选图像-文本对应关系,并为每个令牌预测一个文本掩码、一个图像掩码和一个对应存在分数。为了训练和评估该任务,我们将各种定位和分割数据集转换为统一的对应关系格式。 实验表明,ConCor-1 在多个基线上持续取得更优性能,在长描述数据集上对应关系 F1 提高了 48%,在零样本 LVIS(以大型类别列表作为文本输入)上提高了 29%。

论文精读

TL;DR 将视觉语言 grounding 重新定义为双向概念对应,无需预设文本片段,同时预测图像实例、文本片段及其对齐,统一了短语 grounding、指代表达和开放词汇检测。ConCor-1 使用 bridge token 大幅提升对应 F1。

问题

问题背景

视觉语言定位(Vision-Language Grounding)旨在连接文本与图像中的视觉实体,是构建多模态理解系统的核心环节。当前研究普遍关注如何提升对预定义短语、类别或指代表达的定位精度与效率。

现有方法局限

主流方法将定位简化为单向定位问题:给定一个事先指定好的文本短语或类别名称,模型仅在图像中检索对应区域。这一设定隐含假设了相关语言单元已知且边界明确,但真实交流场景(如长文本描述、自由形式指令)中,哪些词语具有视觉指称性、如何切分文本片段并建立对应,本身就是一个待解决的难题。具体局限包括:

  • 忽略文本端语义解析:无法自动判断文本中哪些片段是“可定位的”,必须依赖外部短语检测或手工标注,限制了在开放文本上的泛化能力。
  • 单向映射导致信息丢失:只关注从文本到图像的映射,忽略了图像实体对文本概念的反向参照,难以处理多对象共现、模糊指代或需要双向推理的场景。
  • 任务碎片化:短语定位(Phrase Grounding)、指代表达理解(Referring Expression Grounding)、开放词汇检测(Open-Vocabulary Detection)等任务各自独立建模,缺乏统一的框架来联合学习文本分割、图像分割和跨模态对齐。

技术挑战与重要性

该问题的核心难点在于双向概念对应的搜索空间巨大:模型需同时预测任意文本跨度的视觉对应、任意图像区域的语言对应,并判断这对对应是否成立。这要求模型具备细粒度的多模态理解能力,能够处理变长、模糊甚至无直接视觉指称的文本片段。此外,训练数据需要统一格式的“文本片段-图像掩码-对应置信”三元组,而现有数据集多为单向标注,标准化成本高。

从应用价值看,将双向对应建模为单一预测问题可统一多种下游任务,减少级联误差,提升系统的整体协同性。例如,在具身交互或智能助手中,理解复杂指令并精准关联场景中的多个实体,与自动驾驶中将自然语言命令(如“避开右侧的蓝色卡车”)中的关键概念与实时感知结果动态匹配,本质上遵循同一技术逻辑,显现出双向 grounding 在推动通用多模态交互中的基础性地位。

核心洞察

  • 将视觉-语言 grounding 从单向定位重新定义为双向概念对应,突破了“文本短语已预先给定”的假设。现有方法大多假设指称性文本单位已知,仅完成单向图像区域定位,这忽略了更基础的挑战:确定文本中哪些部分是视觉指称的,以及它们如何对应到图像中的实体。ConCor-1 将文本分割、图像分割与跨模态对齐统一为同一个对应预测问题,使模型无需预定义文本片段就能恢复所有图文对应关系,为 grounding 任务提供了更贴近真实交流场景的形式化描述。
  • 通过 learnable bridge tokens 实现统一的双向对应预测,在长描述与开放词汇检测等场景中显著优于传统分离式流水线。ConCor-1 为每对图文设置可学习的桥接 token,同时预测文本掩码、图像掩码和对应存在分数,避免了先检测再对齐的多阶段误差累积。在长描述数据集上对应 F1 提升 48%,在零样本 LVIS 上提升 29%,表明联合建模文本和图像分割不但提升了召回,还通过跨模态交互强化了罕见或未见过概念的对应能力。

方法

输入与任务定义

给定图像-文本对,ConCor-1 不预设待定位的文本短语,而是直接预测所有视觉可指代的文本片段与实例级图像分割之间的双向对应关系。这一设定将短语定位、指代表达定位和开放词汇检测统一为单一对应预测问题。

核心模块:桥接令牌与多尺度分配

模型基于预训练视觉语言模型(如 CLIP 或 BLIP-2)构建,核心创新是引入一组可学习的桥接令牌(bridge tokens)。这些令牌作为图像与文本之间候选对应的中间表示,每个令牌负责估计一个可能的概念对应。

  • 多尺度特征融合:通过跨注意力机制从图像编码器和文本编码器中聚合多尺度信息,使每个桥接令牌能同时感知不同粒度的视觉和语言特征。
  • 三个预测头:
    • 存在头(presence head):输出该令牌代表有效对应的置信度分数。
    • 文本分割头(text segmentation head):生成文本序列上的掩码,标记哪些词元属于该指代概念。
    • 视觉分割头(vision segmentation head):生成图像上的实例掩码,定位对应的视觉实体。

训练与推理

训练时,将多个定位和分割数据集(如 GoldG、COCONut-PanCap、Pixmo 等)统一转换为概念对应格式:每条数据包含图像、文本以及标注好的文本片段-图像掩码对应关系。损失函数由三部分组成:

  • 存在性二元交叉熵损失(判断桥接令牌是否对应真实概念)
  • 文本片段 IoU 损失(优化文本掩码精度)
  • 视觉掩码 Dice + 交叉熵损失(优化分割质量)

推理时,对桥接令牌的预测进行后处理,使用阈值过滤低置信度令牌,并通过匈牙利匹配去除冗余对应,最终输出一组(文本片段, 图像掩码, 分数)三元组。

与同类方法的差异

传统方法(如 Grounding DINO + SAM)将定位视为单向任务:先给定文本,再找区域,割裂了文本与图像的联合推理。ConCor-1 以双向对应为核心,同时建模“文本中哪些词需要定位”和“图像中哪些区域可被指代”,无需任何预指定短语,更贴近真实场景下视觉-语言对齐的需求。

实验

ConCor-1 将视觉语言 Grounding 建模为双向概念对应,在多个数据集上进行评估,包括改写后的长描述数据集、零样本 LVIS 等。实验将多个 Grounding 与分割数据集统一为对应格式进行训练和测试。

关键发现:在长描述数据集上,ConCor-1 的 Correspondence F1 相比基线提升了 48%;在零样本 LVIS 上,以大规模类别列表作为文本输入,F1 提升 29%。这表明模型能够有效处理未指定文本片段的情况,同时定位图文对应。

与基线对比:相较于 Grounding DINO + SAM、Florence-2 等方法,ConCor-1 在双向对应预测上明显优于单向假设基线,尤其在文本片段未被预指定的场景下优势显著。该统一框架将文本分割、图像分割与跨模态对齐作为单一对应预测问题,简化了流程。

行业影响

落地场景

ConCor-1 提出的双向概念对应任务可广泛应用于需要细粒度跨模态理解的场景:

  • 电商搜索与商品结构化:用户输入自然语言查询,系统同时分割文本中的属性词和图片中的对应区域,实现“红色皮质手提包”等精确匹配,提升搜索与推荐精度。
  • 内容审核与风控:自动检测图片中是否包含违规元素,并与文本描述交叉验证,例如识别广告文案中夸大的视觉表达,降低合规风险。
  • 自动驾驶场景理解:将传感器数据与自然语言指令对齐,从“前方左侧蓝色轿车”中联合分割文本短语和图像实例,辅助决策。
  • 医疗影像报告生成:对齐 X 光片中的病灶区域与报告中的医学术语,自动生成结构化标注,辅助诊断和教学。
  • 多模态文档解析:在 PDF、截图等文档中关联图表内的文本提及与视觉元素,用于自动化信息抽取。

商业价值

  • 降本:传统 grounding 任务需大量人工标注短语-区域对,ConCor-1 可从现有弱对齐数据(图像-文本对)中自监督学习对应关系,减少 80% 以上的标注成本。
  • 增收:更精准的视觉搜索直接提升电商转化率;高质量自动化内容标注可加速 UGC 平台生态建设,增加广告库存。
  • 体验提升:用户可自然描述多对象场景,系统一次性返回所有对应区域,避免多次查询交互,尤其在智能相册、视频检索等场景中显著提高满意度。

与现有工作流集成

ConCor-1 可作为即插即用的模块嵌入现有视觉-语言流水线:

  • 模型层面:基于预训练 VLM(如 Florence-2、GLaMM)添加轻量级 bridge tokens 和分割头,训练开销低,可直接替换原有的单向 grounding 模型。
  • 部署层面:提供 REST/gRPC API,输入图像和文本,输出结构化 JSON(含 text span、image mask 及 correspondence score),易于与下游业务逻辑集成。
  • 数据层面:支持将多个现有数据集(如 LVIS、RefCOCO)统一转换为 correspondence 格式,无需定制化预处理,可直接利用已有标注资产。

具体落地用例

  1. 电商商品发布编辑器:卖家上传多角度商品图和一段描述,ConCor-1 自动识别文本中所有视觉相关属性(材质、颜色、部件),并在图片中高亮对应区域,一键生成标准化价格对比表,减少人工组合信息的工作量。
  2. 视频平台弹幕与情节对齐:在长视频中,用户发送弹幕“那只猫好可爱”,ConCor-1 实时定位视频帧中的猫的区域并与弹幕文本建立对应,用于后续高光片段剪辑或弹幕特效触发,提升互动玩法体验。

局限

  • **计算效率与实时性不足**:ConCor-1 通过桥接 Token 联合建模文本分割、图像分割和跨模态对应,尽管统一了多个任务并提升了性能,但需要同时处理多尺度分配和三个预测头,导致计算开销显著增加。与单向接地模型(如 Grounding DINO)相比,其推理速度较慢,难以直接应用于实时交互场景;训练时混合多个数据集的复杂流水线也增加了工程实现的复杂度。
  • **对预训练 VLM 的依赖性及泛化局限**:该方法构建于预训练视觉语言模型之上,性能上限受限于基座模型的能力和潜在偏差。当基座模型对某些视觉概念或语言表达理解不足时,ConCor-1 的多模态对应也会失效。此外,尽管在 curated datasets 上表现出色,但在更复杂的真实场景(如密集描述、罕见实体)下的泛化性尚未充分验证,对文本噪声或歧义表达的鲁棒性也可能不足。
论文Jieyu Zhang2026-08-08原文

相关内容