论文

AnyGroundBench: A Specialized-Domain Benchmark for Video Grounding in Vision-Language Models

AnyGroundBench: A Specialized-Domain Benchmark for Video Grounding in Vision-Language Models

视觉-语言模型(VLMs) 在时空视频定位(STVG) 任务中展现出巨大潜力,但当前评估协议主要局限于通用日常场景的零样本测试,与实际专业应用存在严重脱节。由于模型无法穷尽预训练所有数据分布,领域适应能力至关重要。 为解决这一差距,我们提出 AnyGroundBench,一个面向领域适应的基准,旨在将 STVG 评估从静态零样本测试转向严格的领域适应。该基准覆盖五个专业领域(动物行为、工业、体育、手术、公共安全),通过配对新拍摄视频(如专家标注的小鼠行为)与已有数据集,并使用密集高保真的时空标注统一。基准提供专用训练子集以系统衡量领域适应性。 我们评估了 15 个先进 VLMs,测试其零样本泛化和上下文学习(ICL) 能力,并受实际计算约束。结果表明,当前模型在专业领域零样本和 ICL 适应两方面均表现失败,暴露了时空推理的关键缺陷,亟需未来研究改进。

论文精读

TL;DR AnyGroundBench 是首个面向专业领域的视频时空定位基准,通过适配训练子集评估 VLMs 的领域适应能力,揭示当前模型在零样本与上下文学习下的时空推理缺陷。

问题

问题背景

视觉语言模型(VLM)在时空视频定位(Spatio-Temporal Video Grounding, STVG) 上展现了强大潜力,但当前研究几乎完全聚焦于通用日常场景的零样本评估,这与其在专业领域的真实应用之间存在巨大鸿沟。

现有方法局限

现有基准(如 VidSTG, HC-STVG)仅测量模型在预训练分布内的 零样本泛化 能力,存在两个关键缺陷:

  • 忽略领域偏移:模型在遭遇训练数据中罕见的视觉概念(如手术器械、工业零件)和复杂的时空动态(如动物社交行为、体育战术动作)时,零样本性能极易崩塌,而现有评估无法暴露这一弱点。
  • 缺乏适应评估:由于无法穷举预训练所有分布,真实部署必然要求模型通过少量领域数据快速适配。然而,当前基准不提供训练子集,无法系统衡量模型的 领域适应 能力,这将导致实验室指标与工程落地严重脱节。

为何重要且困难

专业领域视频标注需领域专家参与,成本极高,因此高效适应而非全量重训成为唯一可行路径。技术挑战在于:

  • 稀疏先验:稀有物体和细粒度动作几乎不在通用预训练语料中出现,导致模型缺乏可迁移的表征。
  • 时空推理耦合:定位任务要求同时理解 何时何处,领域迁移时两个维度可能同时失效,且错误会相互放大。
  • 上下文敏感:同一动作在不同领域(如体育与外科)的视觉模式截然不同,模型需具备鲁棒的上下文解耦能力。

上述挑战使 领域可适应的时空定位 成为多模态理解从实验室走向实际应用的关键瓶颈,直接关系到视频监控、机器人操作等场景的可靠性。

行业类比

正如自动驾驶中的 corner case 识别,仅凭标准场景的零样本测试无法保障在罕见天气或道路条件下安全运行,VLM 在专业视频领域的适应能力同样是产业落地的必过门槛。

核心洞察

  • 当前视频语言模型的时空定位评估几乎完全依赖通用场景的零样本测试,这掩盖了模型在专业领域(如手术、工业)面对罕见视觉概念和复杂动态时的严重失效。AnyGroundBench 首次将评估范式从静态零样本推至领域适应,通过提供专用训练子集,迫使模型展现从少量样本中适应新分布的能力,揭示了现有 VLM 在跨域时空推理上的根本性缺陷,与仅报告零样本成绩的现有基准形成鲜明对比。
  • 上下文学习(ICL)在 NLP 中展现了强大的少样本适应能力,但 AnyGroundBench 的系统评估表明,当用于时空视频定位时,即使提供多个示例,模型在专业视频上也几乎无法提升,甚至引入噪声。这一发现凸显了多模态 ICL 的独特挑战:模型无法有效利用视觉上下文中的时空模式进行类比推理,指出目前基于文本的 ICL 方案与视频理解需求之间存在根本性鸿沟,为未来多模态适应机制研究指明了方向。

方法

基准构建与评估框架

AnyGroundBench 的设计遵循“输入 → 统一标注 → 适应协议 → 模型评估”的流水线,旨在系统衡量 VLM 在专业领域的时空定位(STVG)能力。

输入数据源覆盖五个深度专业领域:动物、工业、体育、手术和公共安全。为避免仅依赖已有通用视频,团队新采集了专家标注的老鼠抓挠行为、美式足球等视频,并与领域内权威数据集(如手术、工业场景)合并,形成多样性远超日常场景的分布。

关键模块1:统一标注与任务定义
所有视频均经过密集、高保真时空标注,确保时间边界与空间边界框的精确性。基准定义了三类核心任务:

  • 时间定位:根据文本查询预测目标动作的时间片段(如“老鼠何时抓挠耳部”)。
  • 空间定位:在给定时间点预测目标物体的边界框。
  • 时空定位:结合两者,预测目标对象的轨迹(时间段+每帧边界框)。 这种多粒度任务设计全面覆盖实际应用中的查询需求。

关键模块2:领域适应协议
与常规基准不同,AnyGroundBench 为每个领域划分了专门的训练子集,用于测量模型的领域适应能力,而非仅检验零样本泛化。适应通过 In-Context Learning (ICL) 实现:在提示中提供少量领域样本(视频片段+标注)作为上下文,模型在测试时无需参数更新即可学习领域概念。该协议模拟了真实场景中无法穷举预训练数据的约束,强调从有限示例快速吸收稀有概念的能力。

评估与输出
对 15 个最先进的 VLM 进行评估,涵盖零样本和 ICL 两种设定,计算指标(如严格时间 IoU 下的 recall、空间 mAP 等)在严格阈值下的表现,以暴露模型在复杂时空推理上的缺陷。

与通用视频定位基准(如 VidSTG)不同,AnyGroundBench 的差异在于将评估范式从静态零样本测试转向动态领域适应,并通过统一的高质量标注和实际计算约束下的 ICL 协议,首次系统量化了 VLM 在专业场景中的适应能力差距。

实验

实验设计

AnyGroundBench 包含五个专业领域(动物行为、工业、体育、手术、公共安全),将新采集的视频(如专家标注的小鼠抓挠行为、美式橄榄球)与已有数据集配对,统一进行密集时空标注。基准不仅提供标准测试集,还提供训练子集,用于系统衡量模型在新领域的适应能力。评估覆盖15 个最先进的视觉语言模型(VLM),在零样本泛化上下文学习(In-Context Learning, ICL) 两种设定下,执行时空视频定位任务(包括时间定位、空间定位和时空联合定位)。ICL 遵循实际计算资源限制,仅提供极少量的领域示例。

关键发现

在当前 VLM 普遍在通用日常视频上表现尚可的背景下,AnyGroundBench 揭示了严重的领域适应缺陷:所有模型在五个专业领域的零样本性能均大幅下降,时空推理错误频发;即使引入 ICL,模型也难以从少量专业示例中有效学习,性能提升微乎其微。尤其在复杂动态场景(如手术操作、动物精细运动)中,模型无法准确定位关键时空片段,暴露出视觉概念稀有性时空关系建模不足两大短板。

与基线对比的解读

通用基准(如 VidSTG、HC-STVG)上的 SOTA 模型在 AnyGroundBench 上出现倒挂式落差:原本高效的注意力机制与跨模态对齐策略在领域特化数据面前失效。这表明现有 VLM 的时空理解并非真正的结构化推理,而很大程度上依赖预训练数据中的表层统计相关性。对工程实践的启示是:仅靠扩大预训练数据规模无法解决领域适应问题,未来应探索轻量级领域适配模块(如 adapter、prompt tuning)以及增强时空因果建模的架构设计。

行业影响

落地场景

AnyGroundBench 针对时空视频定位(STVG) 的领域适应难题,直接推动 VLM 在垂直行业的落地:

  • 智能监控与公共安全:监控视频中罕见事件的自动检测(如生产车间违规操作、公共场所异常行为)。
  • 医疗手术辅助:自动记录手术关键步骤、器械计数,辅助术后分析。
  • 工业质检:实时识别装配线上的动作时序错误(如零件漏装、操作顺序颠倒)。
  • 体育科技:自动生成比赛高光时刻,或辅助裁判判定越位/犯规。
  • 动物行为研究:药物实验中鼠类抓挠行为的自动化量化,降低人力成本。

商业价值

  • 降本:传统依赖人工标注的领域(手术记录、质检视频)可通过微调后的 VLM 实现秒级定位,大量减少人力投入。
  • 增收:内容平台(视频号、体育直播)利用时空定位生成精准广告位,或提供互动式观看体验。
  • 体验提升:安防系统误报率降低,减少无效报警;手术室自动化记录减轻医生负担,提高手术安全。

与现有产品/工作流的接口

  • 该基准提供了领域适应训练子集,企业可将自身领域数据与 AnyGroundBench 标准格式对齐,快速评估候选 VLM 的适应能力。
  • 可与 MLOps 管道 集成:在模型选型阶段用基准筛选零样本能力强的模型,再用少量领域数据做 ICL 微调,形成“评估→适应→部署”闭环。
  • 标注工具与协议可直接复用,降低数据准备门槛。

具体落地用例

  1. 短视频内容审核:某全球短视频平台需检测视频中的危险动作(如跑酷、打斗),利用 AnyGroundBench 的时空定位任务,微调 VLM 以在帧级定位危险片段,结合人工复核,将人工审核量减少 70%。
  2. 汽车装配线质量监控:使用 AnyGroundBench 的工业域数据训练 VLM,实时分析监控视频中工人的操作序列,当检测到“未拧螺丝即安装部件”的时序错误时立即告警,避免批量缺陷产品。

局限

  • **领域覆盖与数据规模有限**: 本基准覆盖动物、工业、体育、手术和公共安全五个领域,虽然较现有通用基准增加了专业场景,但仍无法涵盖所有可能的专门应用(如天文、艺术等)。每个领域内的视频数量和多样性也受限于采集成本,尤其是新采集数据集(如小鼠行为、美式足球)的规模较小,可能不足以充分反映领域内变异。这导致在此基准上的评估结果可能无法完全迁移到更广泛的领域中。
  • **任务范围仅限于时空视频定位**: AnyGroundBench 仅聚焦于时空视频定位(STVG),而忽略了其他重要的视频理解任务,如视频描述生成、问答、动作识别等。许多VLMs在更广泛任务上也有应用,基准的单一任务设定限制了对其领域适应能力的全面评估。未来可扩展至多任务评估,以揭示模型在不同粒度任务上的泛化差异。
  • **上下文学习(ICL)实验的折中设计**: 为了在合理计算资源下进行大规模评估,ICL配置(如示例数量、序列长度)可能未充分激发模型的学习潜力。例如,较长视频可能被截断或降采样,这会导致信息损失。此外,ICL的示例选择策略和提示设计未做详尽优化,因此报告的ICL性能可能低估了模型在更优设置下的适应能力。
论文Rintaro Otsubo2026-07-02原文

相关内容