论文

OmniCapBench:面向细粒度音视频描述的深度结构化评测框架

OmniCapBench:面向细粒度音视频描述的深度结构化评测框架

多模态大语言模型 (MLLMs) 正快速向连续的音视频推理演进,这使得能够暴露其能力边界的评测变得尤为迫切。音视频描述是理想的诊断任务,但现有 benchmark 面临一组相互耦合的权衡:整段描述打分 有覆盖度却无定位,局部探测 有定位却无覆盖度,而无约束的 LLM judge 又会引入不稳定性。 为此,我们提出 OmniCapBench(Omni-Video Caption Benchmark),将音视频描述评测重构为一个 深度结构化诊断框架。它把预测目标从自由文本转变为原子化、可验证的评测单元集合,覆盖三条 track: - 实体指代(entity references) - 视觉镜头(visual shots) - 音频事件(audio events) 借助确定性约束检查与局部化的 LLM 语义比较,该框架实现了可靠打分。 OmniCapBench 包含 786 段密集标注视频,能有效区分 MLLM 的各类感知错误,包括时间定位失败、身份漂移、跨模态错位与幻觉描述。对前沿 MLLM 的评测显示,它们具备较强的局部感知能力,但长程音视频推理较弱,尤其体现在身份漂移与跨模态错位上,这为 omnimodal 的发展提供了细粒度的路线图。

论文精读

TL;DR **OmniCapBench** 将音视频描述评估重构为深结构化诊断框架,拆解为实体引用、视觉镜头、音频事件三类原子可验证单元,可精确定位身份漂移、跨模态错位等感知错误,为全模态模型发展提供细粒度路线图。

问题

问题背景

多模态大模型(MLLMs)正快速迈向连续音视频推理,业界亟需能暴露模型能力边界的细粒度评估基准。

现有方法局限

当前音频-视觉 captioning 评估长期受困于三重耦合制约:

  • 全局文本评分(如 CIDEr、SPICE)具备覆盖性,但缺乏时序与空间定位能力,无法区分模型在具体镜头、实体或音频事件上的错误;
  • 局部探针能提供定位,却通常只验证预设的少量维度,覆盖率不足,难以反映完整 caption 质量;
  • 无约束 LLM-as-judge 依赖开放式文本比较,受提示词、模型偏差和随机性影响,结论稳定性差,且常混淆“检测能力”与“结构化推理能力”。

这些方法把 captioning 当作整体文本生成任务,忽略了音视频流中多粒度、跨模态、时序对齐的原子事实。

为什么这个问题难且重要

音视频理解要求模型同时处理视觉实体引用、镜头切分和音频事件,并维持长时程身份一致性(identity persistence)与跨模态关联。真实场景中,身份漂移(同一实体在后续镜头被错误命名)和跨模态错位(音频事件错误绑定到视觉镜头)正是当前 MLLM 的典型失败模式。这类错误会被全局分数掩盖,却在视频问答、内容审核、具身智能等下游任务中引发严重误判。构建深度结构化评估——将预测目标拆解为可验证的原子单元——能提供故障定位和细粒度训练信号,是 omnimodal 模型迭代的关键基础设施。

行业类比

就像自动驾驶评测需要逐帧、逐物体的可归因错误审计,而非仅给出整体驾驶成功率,音视频 captioning 也需要把每一条实体引用、每个镜头、每个音频事件独立核验。

核心洞察

  • OmniCapBench 将音视频字幕评估从整体文本相似度分解为原子可验证单元(实体引用、视觉镜头、音频事件),通过确定性约束检查和局部 LLM 语义比较实现可靠评分。这一角度独特之处在于解决了现有工作中覆盖率与定位性的耦合困境:整句评分覆盖全面但无法定位错误,局部探针定位精确但覆盖不全,而无约束 LLM 评委则引入不稳定性。该框架将检测与推理分离,使评估结果可追溯、可诊断,为细粒度能力审计提供了结构化基础。
  • OmniCapBench 的深度结构化评估揭示了前沿 MLLM 的一个关键短板:局部感知能力较强,但长时程音视频推理薄弱,突出表现为身份漂移(跨镜头指代不一致)和跨模态错位(音频事件与视觉镜头关联错误)。与传统指标(如 CIDEr、SPICE)相比,这些错误在全局文本打分中会被掩盖,而 OmniCapBench 通过原子单元级别的检查将其显性化。这一发现为后续模型优化提供了明确的优先级,即需要强化时序一致性和跨模态绑定能力。

方法

输入与数据构建

OmniCapBench 接收原始音视频对,基于 786 个密集标注视频 构建基准。每个视频经人工标注与 QA 生成三类原生轨道:

  • 实体引用(entity references):人物、物体等身份标签及提及时间
  • 视觉镜头(visual shots):镜头边界与内容摘要
  • 音频事件(audio events):声音类别与起止时间 这些结构化标注作为 ground truth,支持约束检查与语义比较。

关键模块:结构化预测与评分

模型被要求直接输出原子单元集合(而非自由文本),或通过事后解析从自由文本中提取。评估分两条路径:

  1. 确定性约束检查:对每个原子单元的结构完整性、时间戳匹配、实体 ID 一致性进行硬性校验,不依赖 LLM 判断,保证稳定性。
  2. 局部 LLM 语义比较:对通过约束的单元,调用 LLM 对局部单元(如单个镜头描述 vs 参考)做语义相似度评分,避免全局判断的覆盖偏差。 两类得分汇总为各轨道指标(如实体 F1、镜头准确率、事件 IoU),并聚合出身份漂移、跨模态对齐等诊断维度。

输出与诊断

框架输出细粒度错误类型:时序定位失败、身份漂移、跨模态不一致、幻觉描述。实验表明,前沿 MLLM 局部感知强但长时程推理弱,尤其身份漂移和跨模态对齐问题突出。

与同类方法差异:OmniCapBench 通过结构化原子单元解耦全局评分与局部探针,实现可扩展、稳定的细粒度诊断,而非依赖单一 LLM 全局判断或覆盖不全的局部探针。

实验

实验设计

OmniCapBench 将音视频描述评测重构为深度结构化诊断:模型输出不再是一段自由文本,而是三轨原子化、可验证单元——entity references、visual shots、audio events。评测在 786 个密集标注视频上进行,采用确定性约束检查 与局部 LLM 语义比较 相结合,避免全局 LLM judge 带来的不稳定性。

关键发现

评测结果显示,当前前沿 MLLM 在短时局部感知上表现较强,但在长时音视频推理上明显薄弱,尤其体现在:

  • 身份漂移 (identity drift):跨镜头指代不一致
  • 跨模态错位 (cross-modal misalignment):音频事件与视觉镜头关联错误

与基线的对比解读

与全局文本级打分相比,OmniCapBench 的深结构评估能够定位错误到具体单元。传统 LLM judge 因开放性输出容易引入不稳定结论,而本框架用原子单元与确定规则先做硬性校验,再用 LLM 做局部语义对照,既保留覆盖度又获得可定位性。这为后续模型优化提供了细粒度路线图,如加强长时跨镜头指代一致性与音视频绑定。

行业影响

落地场景

OmniCapBench 作为面向音视频理解模型的细粒度评估框架,可直接服务于视频内容平台、电商直播、在线教育、智能监控等需要精细化多模态描述的业务。例如,视频平台用它评测自动字幕/描述模型能否正确绑定实体与镜头、检测音频事件,从而提升搜索与推荐相关性;电商直播分析中可自动提取产品提及与事件时间线,用于商品标签生成和精彩片段剪辑;在线教育视频可生成结构化摘要,辅助知识点定位。

商业价值

  • 降本:自动化的原子级音视频描述减少人工审核与字幕生成成本,尤其在高时长内容场景。
  • 增收:更准确的视频描述提升内容检索效率与推荐点击率,电商直播的商品标签自动化直接提升转化。
  • 体验提升:为视障用户提供结构化、可定位的音视频描述;同时减少模型幻觉与身份漂移,增强用户信任。

与现有工作流集成

OmniCapBench 可嵌入 MLOps 评估流水线,作为多模态模型的持续质量门禁。其输出的实体引用、视觉镜头、音频事件三类原子指标与确定性约束检查,比传统全局 LLM 评判更稳定,适合 CI/CD 回归测试。工程团队可将该 benchmark 作为模型选型和版本迭代的参考,并与现有视频处理组件(如实体链接、事件检测模块)对接,形成从评测到优化的闭环。

局限

  • **局限性一: LLM 语义比较的残余不稳定性**。OmniCapBench 将全局 LLM 评判替换为局部、原子单元的语义比较,并配合确定性约束检查,显著提升了稳定性;但局部语义比较部分仍依赖 LLM(如 GPT-4o 等)对实体、事件描述的相似度判断。这种判断虽在小粒度上更可控,但仍受采样温度、prompt 版本、模型偏见影响,且计算成本较高(每个视频需多次 API 调用)。对实际工程的启示是:评估流水线需要固定 LLM 版本与解码参数,并报告多次运行方差,否则跨时间或跨环境的评估结果仍可能不可复现。
  • **局限性二: 数据规模与覆盖广度有限**。论文基于 786 个密集标注视频构建,虽然每个视频标注了实体、镜头、音频事件等多层结构,但总量相对较小,领域分布可能偏向特定来源(如 YouTube 或现有数据集)。这限制了结论对开放域、长尾场景(如极端光照、嘈杂音频、多说话人混叠)的泛化性。与现有大规模视听数据集相比,OmniCapBench 更侧重诊断深度而非覆盖广度,因此作为通用排行榜可能不够,更适合作为能力审计工具。
  • **局限性三: 预测目标结构化带来的评估偏差**。将自由形式字幕转化为原子评估单元使得评分可验证,但也改变了任务性质:模型不再需要生成连贯、自然的叙事,只需命中预定义单元即可得分。这可能高估模型在真实字幕生成中的表现,忽略冗余、流畅性、风格等维度。对于实际工程,如果目标是与人类创作者协作的字幕生成,则还应结合人工评估或保留部分自由文本指标作为补充。
论文Zhongyu Yang2026-10-08原文

相关内容