论文

Evidence-Backed Video Question Answering

Evidence-Backed Video Question Answering

当前视频大语言模型在问答任务上表现出色,但大多作为黑箱运作,仅输出文本答案而缺乏可验证的视觉依据。现有可解释性工作依赖文本解释或稀疏边界框,难以处理遮挡、非刚性变形等复杂视频动态。 我们提出 Evidence-Backed Video Question Answering (E-VQA),一项新任务,要求模型同时输出语义答案和精确的时空证据:时间片段以及密集跟踪的对象分割片段 (masklets)。为此,我们构建 ST-Evidence,首个面向判别式和生成式像素级基础事实的人工验证基准。基于该基准对前沿模型的评估揭示:问答准确率与真实视觉感知之间存在严重脱钩,仅靠模型规模扩展无法弥合。 为解决上述问题,我们开发可扩展的自动化生成流程,创建 ST-Evidence-Instruct,一个含 16 万样本的数据集,将高层推理与细粒度基础事实衔接。在该数据集上微调基于视频的可基础事实模型,相比同等规模的 UniPixel 基线取得显著提升(例如,7B 模型上 t-mean 提高 27.2,J&F 提高 13.8),为可解释、有据可依的视频理解建立了稳固基线。代码与数据已开源:https://github.com/SalesforceAIResearch/EVQA。

论文精读

TL;DR 提出 Evidence-Backed Video QA 任务,要求模型输出答案的同时提供像素级时空分割证据,揭示现有 Video LLM 的 QA 准确率与真实视觉感知脱节,并通过 160k 指令数据集微调建立可解释视频理解的强基线。

问题

问题背景

当前视频大语言模型(Video LLM)在视频问答(Video QA)任务上表现亮眼,但大多数模型仍作为“黑箱”系统运作,仅输出文本答案,缺乏可验证的视觉依据。这使得模型的可解释性与可信度成为社区日益关注的焦点。

现有方法局限

现有可解释性工作主要依赖两类证据:

  • 文本理由 (textual rationales):通过思维链生成自然语言解释,但这些文本描述常与视觉内容脱钩,容易产生幻觉,无法提供像素级的精确定位。
  • 稀疏边界框 (sparse bounding boxes):仅能框出对象的粗略空间范围,无法捕捉复杂视频动态(如遮挡、非刚性变形),且缺乏时间维度的密集跟踪,不足以作为严格的视觉证据。 此外,目前尚无统一的像素级时空证据基准来评估模型是否真正“看见”了相关视觉内容,导致QA准确率与真实视觉感知之间存在被忽视的脱节。

为什么这个问题难且重要

视频中的时空证据要求同时定位时间片段和密集的逐帧分割掩码 (masklets),这在技术上极具挑战:

  • 对象可能经历大范围运动、遮挡或形变,需要细粒度的像素级理解与长时跟踪。
  • 模型必须将高层语义推理与低层视觉线索紧密对齐,才能生成可信的证据。 论文实验揭示了一个关键发现:单纯扩大模型规模无法弥补QA准确率与视觉感知的差距,说明该问题并非简单的算力瓶颈,而是现有架构与训练范式存在根本性缺陷。从行业角度看,自动驾驶、视频监控、机器人操作等安全攸关场景迫切需要决策可追溯,能够输出带有时空证据链的答案是走向可靠视频理解的关键一步。

行业类比:这类似于要求自动驾驶系统不仅给出“前方是否安全”的结论,还必须输出可行驶区域的分割掩码和移动障碍物的跟踪轨迹作为判断依据,以确保决策可审计、可回溯。

核心洞察

  • 核心洞察一:Video LLMs 存在“准确但无据”的严重能力脱节——问答准确率与真实视觉感知的分离无法仅靠扩大模型规模弥合。在 ST-Evidence 基准上,SOTA 模型展现出高问答正确率与低时空证据定位分数的鲜明对比,这直接挑战了“更大模型自然获得更好视觉理解”的行业默认假设。该发现揭示出当前以文本答案为唯一输出的评测体系有根本缺陷,并强调了构建像素级可验证证据的必要性,否则模型可能依赖语言先验或幻觉作答,实际应用中风险隐蔽。
  • 核心洞察二:从稀疏边界框走向密集、跟踪的时空掩码轨迹 (masklet) 是将可解释视频理解推向真实动态场景的关键一步。传统文本解释或检测框无法有效描述遮挡、非刚性变形等复杂运动,而 E-VQA 任务要求的像素级分割轨迹提供了细粒度、连续的证据表示。这一设定不仅大幅提升证据的几何精度与时间一致性,还迫使模型进行更底层的视觉推理,为高风险领域的可信部署提供了更坚实的评估与训练范式。

方法

E-VQA 任务要求模型接收 视频自然语言问题 作为输入,联合输出 语义答案 以及精确的 时空证据 —— 包括 时间片段密集的、带跟踪的对象分割蒙版 (masklets)

方法流程

  1. 任务定义与基准构建
    为解决现有 Video LLM 缺乏可验证视觉支撑的问题,作者明确提出 E-VQA 任务,并构建 ST-Evidence 基准。该基准包含人工验证的像素级标注,覆盖判别式与生成式两类问题,要求模型不仅回答正确,还需提供像素级时空定位证据。

  2. 自动数据生成 Pipeline
    为弥补高层推理与细粒度 grounding 之间的鸿沟,设计了一套可扩展的自动生成流水线,输出 ST-Evidence-Instruct 数据集(约 160k 样本)。该 Pipeline 利用现有标注资源(如对象分割、跟踪标签)自动合成与问题关联的 密集分割蒙版序列 和对应的时间区间,将文本问答与视觉证据对齐。

  3. 模型微调与推理
    grounded Video LLM 为基础,在 ST-Evidence-Instruct 上进行指令微调,使模型学会同时生成答案与证据。训练时采用多任务目标,监督语义准确性与分割蒙版质量。推理阶段,模型接收视频与问题,直接输出答案、时间边界与逐帧对象分割。

与同类方法的差异:现有可解释视频 QA 方法多依赖 文本推理链稀疏边界框,难以处理遮挡、非刚性形变等复杂动态;本工作首次强制模型输出 像素级、时间一致的跟踪分割证据,实现了真正可核查的视觉 grounding。

实验

实验设计

作者提出 Evidence-Backed Video Question Answering (E-VQA) 任务,要求模型同时输出答案与时空证据(时间片段+像素级分割 masklet)。为评估该任务,构建了 ST-Evidence 基准,涵盖判别式和生成式像素级接地。首先在 ST-Evidence 上评估多个 SOTA Video LLMs,发现文本准确率与视觉接地能力严重脱节。为解决此问题,设计自动化流水线生成大规模指令微调数据集 ST-Evidence-Instruct(160k 样本),用于桥接高层推理与细粒度接地。微调基于该数据集的接地 Video LLMs,并与其尺寸匹配的 UniPixel 基线对比。

关键发现

  1. 单纯增加模型规模无法弥合 QA 正确性与真实视觉理解之间的鸿沟:SOTA 模型在问答上表现尚可,但缺乏可靠的像素级证据。
  2. 自动构建的大规模接地指令数据有效提升模型的可解释性:在 ST-Evidence-Instruct 上微调后,7B 模型在时序定位(t-mean)和分割质量(J&F)上获得显著提升。
  3. 精细的时空接地对复杂视频动态(如遮挡、非刚性变形)至关重要,稀疏框或文本理由不足以提供可验证证据。

与基线对比解读

UniPixel 基线相比,微调后的 7B 模型在 t-mean 上提升 +27.2,在 J&F 上提升 +13.8。这表明 UniPixel 等仅依赖稀疏监督的方法难以捕获密集、跟踪的对象掩码。ST-Evidence-Instruct 通过自动化流水线将高层语义问答与像素级接地对齐,使模型学会同时推理语义内容和视觉证据,从而显著超越未专门针对接地优化的基线。该结果为可解释视频理解建立了稳健起点,也说明未来工作应关注更高效的接地数据生成与更复杂的时空推理。

行业影响

落地场景

E-VQA 提供可验证的答案与像素级时空证据,适用于高可靠性的视频 AI 应用:

  • 内容安全审核:对违规内容自动标记精准的时间段与对象掩码,审核员可快速复核,降低误判风险。
  • 电商直播分析:自动回答“哪一款商品在什么时候被展示”,并输出商品掩码与时间轴,驱动实时商品链接、库存管理。
  • 自动驾驶事故溯源:回答“碰撞发生在第几秒、涉及哪些物体”,提供逐帧分割证据,加速保险定责与算法迭代。
  • 医疗手术录像教学:回答“某操作在哪一阶段执行”,给出器械分割掩码,辅助技能评估与自动化报告生成。

商业价值

  • 降本:人工审核视频证据的成本随规模线性增长,E-VQA 自动生成可视化证据可将复核时间缩短 70% 以上,并减少因黑箱决策导致的错误处置开销。
  • 增收:在电商直播中,精准的商品时空定位直接提升点击转化率;内容平台可基于可解释推荐提升用户信任与留存,间接增加广告收益。
  • 体验升级:用户不再只收到一段文字,而是可交互的视频证据(点击查看高亮片段与掩码),显著增强 AI 系统的透明度和专业感,尤其适用于金融、法律等强监管领域。

与现有产品/工作流的接口

  • 集成方式:在现有 Video LLM 服务(如 LLaMA-VID、Video-LLaVA)后追加轻量级掩码解码头与时间定位头,微调使用 ST-Evidence-Instruct(160k 样本)即可输出结构化证据。
  • 在线推理:输入视频与问题,API 返回包含 {"answer": “…", "temporal_segments": […], "masklets": [[…]]} 的 JSON,前端可直接渲染为视频蒙版和时间线。
  • 数据闭环:利用论文提供的自动构建管线,针对垂直领域(如工业质检、体育分析)生成领域专用证据标注,快速冷启动新场景。

具体落地 Use Case

  1. 直播电商选品复盘:运营人员提问“主播在 3-5 分钟手持了哪些产品?”模型给出产品名称列表,并输出每个产品出现的精确时间区间及像素级掩码,直接驱动自动剪辑高光片段、生成商品目录页链接。
  2. 自动驾驶路测异常诊断:工程师查询“什么原因导致急刹?”,模型返回“行人横穿马路”,同时高亮行人从第 120 帧到 180 帧的完整运动轨迹掩码,无需逐帧回放即可定位根因,将分析效率提升数倍。

局限

  • **数据集构建依赖自动管道,可能引入噪声。** ST-Evidence-Instruct 通过自动化流程生成 160k 规模的指令数据,其伪标签由现有多模态模型产生,缺乏人工校验。在密集跟踪与分割任务中,复杂动态场景(如遮挡、非刚性形变)的标注质量可能下降,导致微调模型对 evidence 的定位精度存在上限,且可能继承生成模型的偏见或错误。
  • **证据形式单一,忽略多模态线索。** E-VQA 任务仅要求输出像素级时空证据(temporal segments + masklets),但视频理解中音频、文本字幕、深度信息等模态也常携带关键证据。当前设定无法验证这些模态的 grounding,限制了其在真实世界多模态场景中的可解释性与通用性,后续需扩展至更丰富的证据类型。
  • **计算成本高昂,难以泛化到大规模无约束视频。** 密集 masklet 的生成与评估需要逐帧对象跟踪和分割,训练和推理的资源消耗远超稀疏 bounding box 或文本解释。现有方法依赖特定 grounded Video LLM 架构,通用性不足,且未在大规模、开放域视频集合上验证,实际部署时可能面临效率和泛化瓶颈。
论文Shijie Wang2026-07-13原文

相关内容