论文

RelateAnything:面向任意输入的实时开放词汇关系预测

RelateAnything:面向任意输入的实时开放词汇关系预测

开放词汇检测可在推理时接受任意类别列表,可提示分割返回不带类名的区域:taxonomy 已经离开模型、变成输入。但关系预测没有跟上。场景图模型仍在某一种标注风格的 50 或 56 个谓词上训练与评测,其 relation head 以 object labels 为条件,因而绑定在单一 detector 上。三个障碍解释了这一现状,且都不是建模层面的问题: 1. 没有既自由文本又经过验证的关系语料; 2. label-conditioned 架构无法接受未参与训练的词汇表; 3. 标准指标奖励与训练语料的一致性,于是更大的词汇表反而被评为退步。 我们提出 RelateAnything,一个 53M 参数的模型:输入图像与来自任意来源的区域,输出推理时以字符串形式给定的谓词词汇表上的打分关系。object labels 从不作为输入,因此区域来源可以更换而无需重训练;词汇表是一组 text embeddings 而非学到的分类器,运行速度 20 ms/帧。在 19,103 个谓词上训练需要 positive-unlabeled 监督,以及一个能区分反义词的 text encoder——contrastive encoders 会把反义词嵌入到 cosine 0.95。 为提供监督信号,我们构建 RA-4M:474k 图像、4.3M 关系、覆盖 10,102 个自由文本谓词,针对带编号的框标记生成并做几何验证。为度量它,我们构建 OV-SGG-Bench,沿六个轴跨数据集评分,以满足既有标准 recall 无法满足的先验。在三个跨数据集基准与第四个 zero-shot 设定上,RelateAnything 的 mean recall 是同等规模最强开放词汇方法的 2.3-3.5 倍,该优势在接入真实 detector 后依然成立,并在两项指标上领先一个 3B-VLM 场景图模型,而参数量不到其 2%。域内测量会把迁移增益高估约 5 倍。模型、语料与基准均已公开。

论文精读

TL;DR RelateAnything 是一个 53M 参数的实时开放词汇关系预测模型,接受任意区域与谓词词汇表,无需对象标签,在跨数据集基准上显著超越同类方法。

问题

问题背景

场景图生成(Scene Graph Generation)领域已见证开放词汇检测与可提示分割的兴起,模型可在推理时接受任意类别列表或区域输入,无需重新训练。然而,关系预测仍停留在封闭词汇时代,常用数据集仅包含 50 或 56 个固定谓词。

现有方法局限

传统场景图模型存在三个结构性缺陷:

  1. 语料限制:没有同时具备自由文本形式且经过几何验证的大规模关系语料,导致监督信号受限于标注风格单一的谓词集。
  2. 架构绑定:关系头以对象标签为条件输入,与特定检测器强耦合,更换区域来源需重新训练,无法泛化到训练集外的谓词。
  3. 评估失真:标准 Recall@K 指标奖励与训练语料分布一致,当模型输出更大词汇表时反而因与人工标注不一致而被判为回归,掩盖了真实开放词汇能力。

为什么这个问题难/重要

开放词汇关系预测的难点在于:需要从数万级别的谓词中学习,但人工标注成本极高,必须依赖正样本-未标注(PU)监督;同时对比学习常用的文本编码器会将反义词嵌入到余弦相似度 0.95,无法区分方向性关系。该问题的解决可推动场景图在图像检索、视觉问答、机器人任务规划等真实场景中落地,业界关注度持续上升。

行业类比

类似目标检测从封闭集走向开放词汇(如 GLIP、Grounding DINO)的变革,关系预测也需要从固定谓词转向任意文本谓词,才能让场景图真正适配开放世界视觉理解任务。

核心洞察

  • **关系预测彻底解耦物体标签**:RelateAnything 让关系头不再以物体标签为条件,而是仅依赖区域视觉特征与谓词文本嵌入。与传统 scene-graph 模型将关系头绑定特定检测器不同,该架构允许任意区域源(如 SAM 提议或不同检测器)直接输入,无需重新训练。推理时谓词词汇表作为字符串嵌入动态提供,彻底移除了封闭集分类器的限制,使开放词汇关系预测真正落地,显著提升模型在真实部署中的灵活性。
  • **文本嵌入空间的方向性修正**:针对对比学习文本编码器将反义词(如 `above` 和 `below`)嵌入到余弦相似度 0.95 的缺陷,RelateAnything 引入 positive-unlabeled supervision 与方向性监督,在 19,103 个谓词上有效区分语义。这一设计解决了开放词汇关系预测中语义精细区分的核心障碍,相比仅依赖 contrastive encoder 的基线方法在跨数据集任务中取得了 2.3-3.5 倍的平均召回提升,证明了在文本空间中显式建模方向是必要的工程手段。
  • **评估协议揭示标准召回指标的偏差**:OV-SGG-Bench 的六个轴证明传统 recall 指标奖励与训练语料的一致性,导致更大词汇表反被判定为 regression。该基准强调跨数据集迁移、真实检测器输出与无 ground truth 判断,为开放词汇 scene-graph 提供了公平度量,避免 in-domain 测量高估迁移收益约 5 倍。这提醒从业者在评估开放词汇系统时,必须重新设计指标以匹配真实分布迁移场景,否则模型能力将被系统性低估。

方法

输入与输出

  • 输入:一张图像、一组来自任意源头的区域(检测框 / mask / point,可来自不同检测器),以及推理时提供的谓词词汇表(字符串列表)。
  • 输出:对每个主语-宾语区域对,在该词汇表上的关系分数。

关键模块

  1. 视觉路径:轻量 backbone 提取图像特征,对每个区域做 deformable scene read / RoI 池化,得到区域特征。
  2. 对表示:融合主语与宾语区域特征,加入相对位置、几何编码,生成 pair representation。
  3. 谓词条件门与双分支:关系头不预测固定类别,而是用文本编码器将谓词字符串嵌入为向量;通过谓词条件门对 pair representation 做条件化,输出与文本嵌入对齐的 logits。双分支分别处理方向(主语→宾语 vs 宾语→主语)或不同语义粒度。
  4. 训练策略:RA-4M 标注稀疏且无显式负例,采用 positive-unlabeled (PU) supervision,对无标注对使用 source-aware negatives;同时用 synonym penalty / distillation objective 对齐同义谓词嵌入并推开反义词,解决对比编码器中反义词 cosine 0.95 的问题。

部署特性

模型仅 53M 参数,单帧 20ms,适用于实时场景图生成。

跟同类方法的差异点:对象标签从不作为输入,区域源可替换且无需重训;谓词词汇表是文本嵌入 bank 而非学习到的分类器,真正实现推理时开放词汇关系预测。

实验

实验设计

作者构建了 RA-4M 数据集,包含 474k 图像和 4.3M 关系,覆盖 10,102 个自由文本谓词,通过编号框标记和几何验证保证质量。评估采用 OV-SGG-Bench,从六个轴测量:跨数据集迁移、对抗负样本精度、全词汇表、检测模式图、无 ground truth 图质量、空间关系。模型 RelateAnything 仅 53M 参数,输入图像和任意区域,输出任意谓词词汇表的评分关系。

关键发现

在三个跨数据集基准和一个零样本基准上,RelateAnything 的平均召回比同规模最强开放词汇方法高 2.3-3.5 倍,且在两项指标上超过 3B-VLM 场景图模型,参数不到其 2%。推理速度达到 20 ms/frame,适合实时应用。此外,域内测量会高估迁移增益约 5 倍,说明跨数据集评估的必要性。

与基线对比深度解读

传统场景图模型的关系头依赖对象标签,与特定检测器耦合,限制了词汇表扩展。RelateAnything 完全去除对象标签输入,使用文本嵌入存储谓词,动态接受推理时提供的词汇表,实现了检测与关系预测的解耦。正无标签监督配合能区分反义词的文本编码器解决了大规模谓词训练的难题(对比编码器将反义词嵌入到余弦相似度 0.95)。这种设计让模型可以零样本泛化到新谓词和任意区域来源,无需重新训练,对工程部署具有实际价值。

行业影响

落地场景

  • 内容平台:自动生成图像/视频的场景图,提取如“人骑自行车”、“猫坐在沙发上”等开放关系,用于内容标签、检索和推荐。
  • 电商:商品图片解析,自动标注“模特穿连衣裙”、“包放在桌子上”等关系,生成商品描述、属性标签,优化搜索与推荐。
  • 自动驾驶/机器人:实时理解场景中物体间关系(如“行人靠近车辆”、“交通锥在道路上”),辅助决策与交互。
  • 医疗影像:从影像中提取器官/病灶间关系,辅助生成结构化报告。

商业价值

  • 降本:模型支持任意谓词词汇表,无需为每个新关系类别重新训练或标注,减少数据标注与模型迭代成本。
  • 增收:更精细的视觉语义提升搜索/推荐准确性,增加用户参与度和转化率;改进内容理解可提升广告匹配效率。
  • 体验提升:开放词汇关系预测让视觉问答、图像描述等应用更准确、更灵活。
  • 模型仅 53M 参数,推理速度快(20ms/帧),显著降低部署和运营成本,适合边缘设备。

跟现有产品/工作流的接口

  • 作为即插即用模块,接受任何检测器/分割模型输出的区域提议,输出带分数的关系三元组。
  • 谓词词汇表以文本嵌入形式提供,可结合领域知识库动态调整,无需重新训练对象检测器。
  • 可直接替换现有闭集场景图生成 pipeline 中的关系头,保留现有检测器不变。
  • 提供公开代码库与数据集(GitHub),便于快速原型验证与集成。

局限

  • **RA-4M 数据集由机器生成并经几何验证**,虽然规模大(4.3M 关系)且覆盖 10,102 个自由文本谓词,但语义正确性未被人工完全校验。生成模型可能产生罕见、错误或不符合人类直觉的谓词,几何验证仅能过滤空间不合理的边界框关系,无法保证视觉语义的准确性。论文也在讨论部分承认 **corpus precision** 与 **held-out concepts** 的局限,例如对抽象概念(情感、意图)覆盖不足,且训练集与真实世界分布可能存在偏差,影响模型在极端开放场景下的泛化。
  • **方法依赖输入区域的质量**:RelateAnything 完全不使用对象标签,只接受区域框,因此性能受上游区域提议器(如检测器或分割模型)的召回率制约。如果区域漏检或定位不准,关系预测必然出错。尽管论文声称与检测器解耦,实际部署时需额外承担区域生成的计算成本(虽然模型本身仅 20 ms/frame),且不同区域来源的分布差异可能导致性能波动,需要针对下游任务调整配对采样策略。
  • **OOV 关系与文本嵌入空间的局限**:虽然谓词词汇表在推理时以字符串嵌入输入,理论上支持任意开放词汇,但实际受限于训练所用文本编码器的语义空间。论文指出对比编码器将反义词嵌入到余弦相似度 0.95,需额外惩罚,但这可能无法完全解决所有近义/反义词混淆。此外,对于未见过的罕见谓词,嵌入可能不可靠,模型输出分数可能偏高或偏低,导致在 OV-SGG-Bench 的 A3(答案为 withheld)轴上仍存在精度下降。
论文Maëlic Neau2026-09-11原文

相关内容