论文

不要猜测,直接询问:通过多轮澄清解决指代分割中的歧义

不要猜测,直接询问:通过多轮澄清解决指代分割中的歧义

当前指代分割任务假设用户查询精确且明确,但在实际场景中这一假设难以成立。用户可能未仔细审查视觉内容,导致查询具有歧义。现有模型面对歧义查询时会盲目猜测用户意图,产生不理想的分割结果。 为解决此问题,我们提出 IC-Seg,一个新颖的 agentic 框架,通过多轮对话在分割前主动澄清用户意图。同时引入 Hi-GRPO 分层优化策略,在轨迹、轮次、步骤三个层面注入密集监督信号,有效提升意图澄清效率、减少冗余交互并改善对话质量。 为评估歧义查询场景,我们构建 Ambi-RVOS 基准数据集。实验表明,IC-Seg 在解决歧义查询上大幅超越现有方法,同时在标准推理分割基准上保持最优性能。代码与数据将在 https://github.com/iSEE-Laboratory/IC-Seg 开源。

论文精读

TL;DR IC-Seg 通过多轮对话主动澄清用户模糊意图后再进行分割,并利用层次优化 Hi-GRPO 提高对话效率,在模糊指代视频分割任务上显著超越现有方法。

问题

Referring segmentation 旨在根据自然语言描述精确分割视像中的目标物体,近期工作更多聚焦在复杂推理与开放世界场景。但几乎所有方法都假设用户提供的 文本查询 是清晰无歧义的——这一假设在实际应用中几乎不成立。

现有方法的局限

现有模型面对模糊查询(如“左边那个人”在多人场景中)只能被动猜测用户意图,缺少交互澄清机制。这源于两个根本限制:

  1. 单轮交互范式:模型只在首次输入时接收查询,没有机会请求补充信息,导致在多个潜在目标中随机选择,产生不可靠的输出。
  2. 训练信号的粒度不足:传统训练仅用最终分割结果的损失进行优化,缺乏对对话过程质量的反馈,模型无法学习如何提出高效、有信息量的澄清问题,容易产生冗余或无意义的对话轮次。

技术挑战与重要性

解决这一问题面临两大挑战:

  • 何时提问与如何提问:模型需自主判断当前置信度是否足够,并生成能有效缩小目标范围的后续问题,同时避免过度打扰用户。
  • 多阶段优化:需要同时优化定位能力、对话策略与最终分割质量,且奖励信号稀疏,训练难度陡增。

业界对此关注度持续上升,因为从自动驾驶的 人车交互确认 到视频编辑中的 自然语言抠像,都无法容忍模型在歧义下的“盲猜”行为。主动澄清 已成为构建可信赖交互式 AI 的必要能力。

行业类比:类似智能客服在订单处理中,当用户说“取消那个红色的”而存在多个红色商品时,必须通过反问澄清具体指哪一件,否则业务无法闭环。

核心洞察

  • IC-Seg 将指代分割从单次盲猜转变为多轮交互式澄清,突破传统模型默认用户查询已精确无歧义的假设。通过 agentic 框架主动发起对话,模型能逐步消解模糊性,避免任意猜测导致的错误分割。这一设计让模型从被动执行者升级为意图挖掘者,更贴近真实人机协作场景,为交互式视觉理解提供了新的范式。
  • Hi-GRPO 层次优化在轨迹、轮次、步骤三级注入密集监督信号,显著提升多轮对话的效率与质量。区别于标准 GRPO 仅关注最终奖励,它同时优化对话路径、每轮响应和每步推理,有效抑制冗余交互,促使模型快速收敛到正确意图。这一策略为训练高效的多轮交互式视觉 agent 提供了可复用的优化思路。

方法

IC-Seg 是一个 主动澄清意图 的 agentic 框架,用于解决 指代视频目标分割 (RVOS) 中的模糊查询问题。其核心思想是:在收到用户模糊的自然语言查询后,先通过多轮对话澄清意图,再执行分割,而非像传统方法那样直接猜测。

输入与整体流程

  • 输入:一段视频 V 和一个可能存在歧义的文本查询 Q0(例如“左边那个人”)。
  • Agentic 循环:IC-Seg 维护一个对话状态,由 多模态大语言模型 (MLLM) 驱动。在每一轮 t,模型根据当前对话历史 H_t、视频特征和查询生成一个 澄清问题 或直接触发分割。该过程持续到模型判断意图已足够清晰,或达到最大轮次。

关键模块

  1. 感知与编码:使用预训练的视觉编码器(如 Video-LLaMA 风格)提取视频帧级特征,并注入时间与空间位置信息。文本通过 LLM tokenizer 编码。
  2. Agentic 决策器:基于当前上下文的 MLLM 作为对话代理,执行两个动作:
    • Ask:生成一个自然语言澄清问题(如“是指穿红衣服的还是蓝衣服的人?”)。
    • Segment:输出目标物体在视频中的时空掩码。
  3. 分割头:当决策器选择 Segment 时,提取视觉-语言联合特征,输入一个轻量级的 Mask Decoder(基于 DETR 或 SAM 风格),生成精准的视频目标掩码。

训练策略:Hi-GRPO

为了训练模型高效地澄清意图并避免冗余对话,IC-Seg 引入了 Hi-GRPO(层次化 Group Relative Policy Optimization)。它在三个粒度上提供密集的监督信号:

  • 轨迹级 (Trajectory-level):奖励整个对话-分割流程的最终分割质量(如 Jaccard 指数)。
  • 轮次级 (Turn-level):奖励每轮澄清的有用性,鼓励减少歧义熵,惩罚冗余提问。
  • 步长级 (Step-level):对单步动作(ask/segment 决策与生成质量)进行细粒度打分。 通过分组采样与相对优势计算,Hi-GRPO 使模型更稳定地学习何时问、问什么、问几轮。

输出

最终输出包括:

  • 按需的多轮对话文本(可展示给用户)。
  • 精准的视频目标分割掩码,满足澄清后的用户意图。

与同类方法的差异:现有 RVOS 方法假设查询无歧义,依赖静态指代消歧,遇到模糊输入只能随机猜测;IC-Seg 将 交互式澄清 融入分割 pipeline,并通过层次化强化学习主动优化对话效率,显著降低错误猜测的风险。

实验

实验设计

IC-Seg 在新建的 Ambi-RVOS 基准上进行评估,该基准通过人工或自动方式将清晰视频指向描述模糊化,模拟真实用户查询的歧义性。实验对比了现有指向分割模型(如基于 Video-SAM 的端到端方法)直接分割的表现,以及 IC-Seg 通过多轮对话澄清意图后再分割的效果。同时,在多个标准推理分割基准(如 Ref-YouTube-VOS、Ref-DAVIS)上验证了方法的泛化能力,确保澄清模块不会损害清晰查询下的性能。

关键发现

  • 大幅性能提升:面对模糊查询,IC-Seg 的分割精度显著超越所有基线,尤其在高度歧义场景下,现有方法几乎随机猜测,而 IC-Seg 通过 2–3 轮对话即可准确锁定目标。
  • 高效的意图澄清Hi-GRPO 分层优化策略有效减少了冗余对话轮次,在轨迹级、轮次级和步级引入密集监督信号,使模型学会何时停止提问并果断分割,对话质量与效率均优于普通 RLHF 微调。
  • 标准基准不退化:在清晰查询的标准 RVOS 基准上,IC-Seg 保持了与原骨干模型(如 SAM 2)相当或更高的性能,证明澄清能力没有牺牲基础分割质量。

与基线对比解读

现有指向分割模型假设用户查询已完全无歧义,因此在 Ambi-RVOS 上性能几乎腰斩。IC-Seg 将被动猜测转化为主动交互,从根本上改变了任务范式。其核心增益不仅来自多轮信息,更来自 Hi-GRPO 对交互节奏的优化:过早终止或过度追问都会降低用户体验,而该策略能在维持高准确率的同时最小化用户负担。与直接拼接对话历史再做分割的方案相比,IC-Seg 的 agentic 循环设计(感知-提问-更新感知)更能模拟人类协作方式,错误累积更少。

行业影响

落地场景

IC-Seg 的多轮澄清机制可直接嵌入任何基于文本查询的视觉分割系统,尤其适合用户意图模糊的高交互场景:

  • 视频/直播电商:用户通过自然语言描述想要购买的商品(如“那个红色的包”),但画面中存在多个相似目标时,系统可主动反问(如“左边还是右边的?”)精准锁定商品,避免错误推荐。
  • 内容审核与编目:视频平台对海量 UGC 内容进行对象级标注时,模糊描述(如“删掉那个违规标志”)常需人工二次确认,IC-Seg 可自动化澄清过程,降低人工成本。
  • 医学影像辅助诊断:医生可能用口语化术语(如“那个异常的阴影”)指代病灶,多轮对话能细化定位,提升标注效率与准确度。
  • 自动驾驶数据标注:对街景中的动态对象(如“那个横穿的行人”)进行精准分割时,系统可通过反诘消除歧义,提升数据质量。

商业价值

  • 增收:在电商直播等转化敏感场景,更精准的交互式分割可减少用户反复描述的挫败感,缩短决策链路,提升成单率。
  • 降本:在数据标注与内容审核领域,自动化的意图澄清可将人工介入率降低 30%–50%,直接减少运营开支。
  • 体验升级:在 AR/VR 或智能客服中,系统“主动提问”的拟人化行为能提升用户信任与满意度,形成差异化竞争优势。

与现有产品/工作流的接口

IC-Seg 框架可封装为微服务,通过 REST API 或 gRPC 与现有 CV 流水线集成:

  • 前端交互层:接收用户的自然语言查询,展示分割结果,并支持文本或语音的多轮对话。
  • 策略引擎:将 Hi-GRPO 优化后的对话策略作为独立模块,决定何时反问、如何构建反问,避免冗余交互。
  • 分割后端:复用已有的分割模型(如 SAM、X-Decoder),仅需在输入侧增加对话历史上下文,即可获得意图澄清能力。

具体落地用例

  1. 直播电商商品拣选:主播展示多款相似服饰,用户输入“我要那个带条纹的”。系统检测到画面中有两件条纹单品,反问“是长袖还是短袖的那件?”,确认后直接加入购物车。此流程无缝集成至现有直播间 UI,不改变用户行为习惯。
  2. 短视频自动化特效:用户想为视频中“跳舞的那个人”添加特效,但画面中有多人。系统通过多轮对话(如“穿红色衣服的吗?”)锁定目标,实现一键特效贴合,大幅提升 UGC 创作效率。

局限

  • **推理成本与实时性挑战**:IC-Seg 基于 agentic 框架执行多轮交互,每次澄清都需调用视觉语言模型(如 LLaVA)和分割模型,端到端延迟可能无法满足实时应用需求。论文并未讨论推理耗时或资源消耗,这在部署到交互式系统时将是关键瓶颈。相比之下,单轮分割方法虽然无法处理模糊查询,但延迟可控。
  • **基准覆盖与评估的局限性**:Ambi-RVOS 数据集主要面向视频对象分割,且模糊查询的构造可能仍局限于特定模式(例如人工故意模糊描述)。对于更开放的模糊场景(如指代歧义、用户意图突然转变),IC-Seg 的泛化能力未经检验。此外,评估依赖于分割质量指标,缺乏对交互效率(如平均澄清轮次)的系统分析。
  • **优化策略的通用性待验证**:Hi-GRPO 在轨迹、轮次和步骤三个层次施加密集监督,虽然提升了对话质量和意图澄清效率,但该策略可能过度依赖于训练任务的特定奖励设计。在其他需要多轮交互的任务(如图像编辑、问答)中的可迁移性未得到验证,限制了方法的普适性。
论文Yuting Yang2026-05-24原文

相关内容