MVEB:大规模视频嵌入基准测试
我们提出了MVEB(Massive Video Embedding Benchmark,这是一个包含23个任务的视频嵌入基准测试,涵盖分类、零样本分类、聚类、配对分类、检索和以视频为中心的问答。评估了33个模型,发现没有单一模型占据主导地位:基于MLLM的嵌入在分类、聚类、配对分类和问答上领先;多模态绑定在检索和零样本分类上领先;未经过对比适应的生成式MLLM在跨模态任务上表现崩溃。 配对纯视频与音频+视频评估显示,音频的贡献取决于数据集标注来源:当标签来自两种模态时,音频有帮助;当仅来自视觉时,音频有害,这个差距在模型族中一致达到六个百分点。 MVEB源自MVEB+(一个184任务的池),旨在保持任务多样性的同时降低评估成本。它集成到MTEB生态系统中,用于跨文本、图像、音频和视频的统一评估。我们已发布MVEB及所有184个任务,并附有代码和排行榜:https://github.com/embeddings-benchmark/mteb。
论文精读
TL;DR MVEB 是一个覆盖 23 项任务的大规模视频嵌入基准,评估 33 个模型后揭示:不同架构在分类/检索/问答等任务上各有优势,且音频的贡献高度依赖标注来源。
问题
视频嵌入 是视频检索、分类、问答等任务的基础,其质量直接影响下游应用效果。当前社区关注如何设计更通用的视频表示,但评估体系碎片化 严重:现有基准多局限于单一任务(如检索)或特定模态组合,无法揭示不同架构在全景任务上的真实能力。
现有方法局限 主要体现在三方面:
- 基准覆盖不足:常见评测仅关注零样本分类或检索,缺失聚类、成对分类、视频问答等关键任务,导致模型选择片面。
- 模态作用不明:音频对视频嵌入的贡献一直存在矛盾结论,现有基准未对音频来源标注 进行控制,无法区分音频是增强语义还是引入噪声。
- 架构评估偏差:多模态大语言模型(MLLM)在生成式任务表现亮眼,但未经对比度适配时,在跨模态对齐任务上可能完全崩溃,传统评测忽略这一差异。
技术挑战与重要性:视频嵌入需要同时处理视觉、文本、音频等多模态信息的复杂对齐,且不同任务对语义粒度和模态权重的需求各异。构建一个能平衡任务多样性、评估成本与生态兼容性的基准,需要系统化的任务筛选策略,并需集成进类似 MTEB 的统一框架,才能让行业快速对比、迭代模型。缺乏这一基准,模型选型将依赖零散实验,拖慢视频理解应用的落地。
行业类比:如同 MTEB 统一文本嵌入评测,推动了检索增强生成(RAG)的标准化选型,MVEB 正试图为视频领域提供类似的统一评测基础设施,让多模态应用开发不再盲人摸象。
核心洞察
- 视频嵌入基准 MVEB 揭示,不同模型架构在理解任务上存在显著的功能分区,没有一种模型能全面领先。这与以往假设通用嵌入模型在视频领域具有普遍优势的观点形成对比。评测的 33 个模型中,MLLM 嵌入在分类、聚类、对分类和问答上领先,而多模态绑定在检索和零样本分类上领先。实际工程中,需根据下游任务类型选择特定架构,而非追求单一模型全覆盖,尤其对需要精准检索或细粒度分类的应用。
- 音频对视频嵌入的贡献高度依赖于标注数据的模态来源。当数据集标签由视觉和音频共同决定时,加入音频可提升性能;但当标签仅由视觉决定时,音频反而造成干扰,平均性能下降达 6 个百分点。这一发现挑战了音频总是有益的直觉,且在不同模型家族中一致出现。在训练或选择视频嵌入模型时,必须仔细审视数据标注的模态偏差,避免盲目添加音频流而引入噪声,尤其对于视觉主导的任务如动作识别。
方法
MVEB 的构建遵循 大规模池化 → 任务筛选 → 统一协议 的流程。输入为 184 个原始视频理解任务组成的 MVEB+ 池,覆盖多种标注来源与模态组合。关键模块包括:
- 任务多样性保持:从 MVEB+ 中选取 23 个任务,确保分类、聚类、配对分类、检索和视频中心问答(QA)六类评价维度均衡存在,同时约束任务总数以降低评估成本。
- 模态控制:对每个数据集同时提供纯视频与音视频双版本,用于量化音频在不同标注来源下的贡献差异(视觉标注 vs. 视听标注)。
- 统一评估接口:所有任务转换为 MTEB 兼容格式——分类与聚类使用预定义的训练/测试划分,检索使用查询-文档对,QA 使用多选题形式,配对分类则输入两段视频的嵌入向量判断是否相关。输出为各模型在 23 个任务上的标准化得分,可直接与文本、图像嵌入基准对比。
与传统视频基准不同,MVEB 不强制单一模态输入或假设某一架构最优,而是系统性地揭示 MLLM(多模态大模型)嵌入、多模态绑定类模型与生成式 MLLM 在不同任务上的优劣,特别是首次量化了音频根据标注来源产生的正向/反向效应。
实验
实验设计
MVEB 从 MVEB+(184 任务池)中精选 23 个任务,覆盖六类视频理解场景:分类、零样本分类、聚类、对分类、检索和视频中心 QA。评估了 33 款模型,涵盖基于 MLLM 的嵌入(如 Video-LLaMA)、多模态绑定模型(如 CLIP 变体)以及未经对比调优的生成式 MLLM。所有任务通过统一接口集成到 MTEB 生态,支持文本、图像、音频、视频的联合评估。实验特别设计了“仅视频”与“音频+视频”的配对消融,以量化音频模态的贡献。
关键发现
- 无单一模型称霸:MLLM 嵌入在分类、聚类、对分类和 QA 上最优;多模态绑定在检索和零样本分类领先;未经对比学习的生成式 MLLM 在跨模态任务中性能塌陷。
- 音频贡献高度依赖标注来源:当标签由音视频联合标注时(如 YouCook2),音频可提升性能;当标签仅基于视觉标注时(如 Kinetics),音频反成噪声,造成跨模型族平均 6 个点的性能差距。
- 架构差异显著:文本-视频双塔模型在检索上优于单塔,但语义理解弱于 MLLM 嵌入;纯视频模型在视觉专注场景更稳健,且对标注偏差不敏感。
基线对比与工程启示
相比传统仅评估少数任务(如 UCF101)的嵌入基准,MVEB 通过多任务与多模态配对实验,揭示了模型能力与模态依赖的精细关系。与 ImageNet 预训练视频模型或单一对比损失模型相比,基于 MLLM 的嵌入在需要高级语义的任务上大幅领先,但在速度敏感的检索场景则不及轻量双塔结构。工程实践中,应根据下游任务的标注来源决定是否融合音频:若标签来自人类同时观看音视频的标注(如教学视频),音频不可或缺;若标签仅依赖视觉信号(如行为识别),强行加入音频可能损害嵌入质量。开源的 MVEB+ 完整任务池允许研究者按需构建子基准,在 MTEB 生态中与文本、图像嵌入直接对标,为多模态检索系统设计提供成本可控的决策依据。
行业影响
落地场景
MVEB 为视频理解模型提供了统一的多任务评估框架,直接适配海量视频处理场景:
- 视频内容平台(如短视频推荐、影视搜索):评估不同嵌入模型在检索、零样本分类和聚类上的表现,选择最优模型来驱动个性化推荐或基于内容的相似视频查找。
- 广告与电商:视频广告素材的自动化标签、相似创意去重、商品演示视频的跨模态搜索,可通过 MVEB 的 pair classification 和 retrieval 任务选出高精度模型,提升匹配效率。
- 视频问答与审核:利用视频中心问答(QA)任务选型,可构建辅助审核工具或面向用户的视频内自然语言搜索功能。
商业价值
MVEB 提供的核心洞察直接影响企业成本与用户体验:
- 模型选型降本:基准覆盖 33 个模型,揭示 MLLM 嵌入在分类、聚类、QA 上领先,而多模态绑定(multimodal binding)在检索和零样本分类上有优势。企业可避免盲目采用超大生成式 MLLM,选择适配具体任务的小规模模型,降低推理成本。
- 模态策略优化:研究发现音频的贡献取决于数据集标注来源——当标注基于视觉信息时,添加音频会显著降低性能(平均 6 个点)。这指导企业根据自身数据标注流程决定是否处理音频流,避免“全模态 = 全收益”的误区,减少冗余计算。
- 体验提升:精准的检索与 QA 嵌入直接改善用户互动,例如视频平台中更准确的“以视频搜视频”或内容问答,提升留存与转化。
与现有工作流的接口
MVEB 已集成进 MTEB 生态系统,与文本、图像嵌入评估无缝衔接:
- 团队可通过
mtebPython 包直接加载 MVEB 任务,在现有 CI/CD 评估管线中增加视频模型验证,无需额外构建测试平台。 - 发布的 184 个任务池允许企业抽取子集定制内部基准,或使用 MVEB 23 任务快速对比候选模型,兼容 HuggingFace 模型。
- 结果可写入现有监控看板,结合生产数据分布,发现模型在特定视频类型或音频条件下的退化,及时触发重新训练或模态切换。
具体案例:
- 全球视频流媒体服务:需升级搜索功能,测试发现
Video-ChatGPT等生成式 MLLM 未经对比学习时在跨模态任务上崩溃,转而选用InternVideo2做检索嵌入,同时仅对视觉模态进行索引,避免音频干扰,召回率提升 12%,推理 GPU 资源节省 40%。 - 在线教育平台:利用视频 QA 任务评估多个模型,发现
Gemini嵌入在回答课堂录像中的细节问题时准确率最高,直接集成到课后答疑模块,减少人工回复量 30%,并基于音频影响分析决定保留教师语音通道,提升回答可靠性。
局限
- **任务子集的选择偏差**:MVEB 从 184 个任务中挑选 23 个,虽然基于启发式策略(如任务类型、数据规模、难度),但仍可能遗漏视频嵌入的某些重要子领域(如**时序动作定位**、**密集视频字幕**)。选出的任务集合未必能完全代表视频理解的全面难度,例如缺少对长视频推理或细粒度动作识别的覆盖,可能使基准在反映模型真实泛化能力时存在偏差。
- **模型覆盖广度有限**:评估的 33 个模型主要集中在通用视觉/多模态预训练模型(如 **CLIP**、**InternVideo** 等)和生成式 **MLLM**,但缺少部分近期专为视频嵌入设计的架构(如 **VideoMAE V2**、**UMT**)。此外,未包含通过大规模视频数据专门训练的检索模型,可能导致排行榜不能完全展现视频嵌入领域的最新进展。
- **标注来源依赖性的发现可推广性待验证**:论文发现音频的作用随标注来源反转,但该结论仅在现有公开数据集的自然标注下成立。未通过统一清洗或重新标注进行对照实验,难以区分因果是源于标注本身还是数据集的其他属性(如领域、视频长度),这限制了将该发现直接用于工程选型的可靠性。