Video-IFBench:评估多模态 LLM 在视频理解场景中的指令跟随能力
多模态大语言模型(MLLM)在视频理解中表现出色,但其在该领域的指令跟随能力仍未充分探索。现实世界的视频理解要求模型不仅正确解读视频内容,还需满足多样化的用户约束。现有基准主要关注任务准确率而非指令遵循,导致该能力评估不足。 为解决这一问题,我们提出 Video-IFBench,一个用于评估视频理解中指令跟随的综合基准。基准要求模型满足多样化用户约束,包括基于视觉和音频内容的约束。我们构建了包含四种模板的指令分类法:单任务、多任务、选择与嵌套指令,覆盖 32 种任务类型和 39 种人工设计的约束类别,涵盖语义与格式要求。为降低标注成本,我们设计了半自动数据构建流程,结合 MLLM、程序化处理与人工验证,生成 1.5K 样本。 我们评估了 20 多个近期 MLLM,结果表明当前模型在视频指令跟随上仍面临挑战,尤其是对于包含多约束、语义约束或需要根据视频内容选择正确分支/路径的复杂条件结构指令。希望我们的工作能推动视频理解场景中指令跟随的未来研究。
论文精读
TL;DR Video-IFBench 构建了首个系统评估视频理解场景下指令遵循能力的基准,覆盖四种指令模板和 39 类约束,对 20+ 多模态大模型的评测显示当前模型在复杂约束下仍力不从心。
问题
问题背景
多模态大模型(MLLM)在视频理解任务上的准确率持续提升,但真实场景中的指令往往包含多重约束,用户不仅要求模型“看懂”视频,还要求输出符合特定格式、范围或条件。当前评测体系主要关注任务完成度,对指令遵循能力(instruction following)的系统性评估仍显不足。
现有方法局限
已有指令遵循基准(如 IFEval、FollowBench)大多面向纯文本 LLM,或仅覆盖图像模态,缺乏对视频时序信息、音频内容、跨帧关联等复杂条件的约束设计。视频指令遵循评测存在三个具体缺口:
- 约束类型单一:现有视频问答基准(如 Video-MME、MVBench)侧重选择题或开放式生成,很少纳入格式约束、条件分支、嵌套依赖等结构要求。
- 缺少音频维度:视频理解常需结合语音、环境音,但多数基准仅使用视觉信息,无法检验模型对声画联合约束的遵循。
- 数据规模与质量矛盾:人工标注高复杂度指令成本极高,自动生成又难以保证约束逻辑的自洽性,导致大规模、高质量的指令遵循数据集稀缺。
为什么这个问题难且重要
视频指令遵循要求模型在长时上下文中同时完成内容理解、约束解析、分支选择、格式控制四个环节,任何一环的失误都会导致整体失败。尤其当指令包含多个约束或嵌套条件时,模型容易忽略次要约束或产生错误分支。从产品角度看,用户对视频理解助手的需求正从“能回答”转向“按我的要求回答”,例如:
- 仅输出关键帧时间戳,而非整段描述;
- 当检测到特定音频事件时才切换回答模板;
- 同时完成摘要、分类、定位等多个子任务并统一排版。
现有 MLLM 在这些场景下常出现格式漂移或约束遗漏,直接影响实际可用性。因此,建立专门的视频指令遵循基准,对推动模型从“任务准确”到“指令可控”的升级具有关键意义。
行业类比
类似自动驾驶中规控模块不仅要识别障碍物,还要严格遵循“限速、车道保持、优先避让”等多重规则,视频指令遵循本质上是在为多模态交互系统建立可验证的“行为契约”。
核心洞察
- **视频指令遵循需要同时约束视觉与音频模态,并与格式/语义要求交叉。** 现有基准大多只评测任务准确率,而 Video-IFBench 显式区分语义约束和格式约束,并引入音频模态约束,要求模型同时处理视频帧和音频轨。这与仅针对文本或静态图像的指令遵循评估形成对比,暴露了 MLLM 在跨模态指令满足上的系统性短板。
- **条件结构与多约束叠加是当前 MLLM 在视频指令遵循中的主要失效模式。** 通过 selection 和 nested 模板,benchmark 量化了约束数量、嵌套深度、分支位置对性能的影响,发现模型在多约束和条件分支下急剧退化。以往工作将视频理解与指令遵循分离评测,容易高估真实场景表现;该基准提供了针对复杂指令鲁棒性的精确诊断。
方法
输入与数据构建
- 视频来源:从现有视频理解数据集中筛选视频片段,覆盖视觉与音频模态。
- 构建任务与约束池:手工定义 32 种任务类型、39 种约束类别(语义+格式),形成四类指令模板:单任务、多任务、选择、嵌套。
关键模块
- 半自动流水线:
MLLM 生成 + 程序化处理 + 人工校验,生成 1.5K 条视频指令数据。 - 每条指令包含一个或多个任务,并附加用户指定约束;使用 checklist 对约束逐项检查,作为评估依据。
- 评估范式:对 20+ MLLMs 进行零样本推理,使用
Qwen3.5-35B-A3B等作为 judge 模型,按 checklist 衡量指令遵循率,并分析约束级、任务/约束缩放、嵌套深度、选择分支位置等细粒度指标。
输出
- 输出为模型在视频场景下指令遵循的综合得分与分项诊断,揭示当前 MLLMs 在语义约束、复杂条件分支上的不足。
与同类差异:不同于只评估答案正确性的视频 QA 基准,Video-IFBench 将指令遵循作为独立维度,通过结构化约束与 checklist 机制细粒度度量。
实验
实验设计
Video-IFBench 评估超过 20 个 近期 MLLMs,覆盖 single-task / multi-task / selection / nested 四类指令模板,共 32 个任务类型 与 39 个约束类别(语义 + 格式)。数据构建采用半自动流水线:MLLM 生成候选 → 程序化处理 → 人工验证,最终得到 1.5K 样本。评估范式采用 checklist 核对与 LLM-as-judge 结合(论文未披露具体 judge 模型)。
关键发现
- 当前 MLLMs 在视频指令遵循上整体表现不佳,尤其当指令包含多约束、语义约束或复杂条件结构(selection 分支选择 / nested 嵌套深度)时性能显著下降。
- 条件结构中的深度敏感性与分支数量/位置影响明显,说明模型对视频内容的逻辑推理与路径选择能力不足。
与同类工作对比 / 工程启示
与主流视频理解基准(如 MSVD-QA、ActivityNet-QA 等聚焦任务准确率)不同,Video-IFBench 首次系统评估“指令遵循”而非单纯“答案正确”。工程上提示:多模态系统常忽略用户显式约束(如输出格式、限定范围),需在指令微调中加入约束感知样本;半自动构建 pipeline 可低成本扩展约束类型,适合持续迭代评测集。
行业影响
落地场景
Video-IFBench 可作为视频理解类产品的质量关卡,适用于:
- 电商短视频:自动生成商品卖点解说,需遵循“仅基于画面提及的功能”等约束;
- 内容平台:视频摘要、自动标签、章节划分,要求输出格式、长度、敏感内容过滤符合运营规范;
- 企业培训/会议:视频会议纪要、行动项提取,需按指定模板结构化输出;
- 自动驾驶/监控:对视频流进行事件检测并触发条件分支,例如“若出现行人穿行,则输出告警并附时间戳”。
商业价值
直接降低人工审核与重写成本:当前 MLLM 在视频指令遵循上常见格式或语义约束被忽略,导致人工返工。通过该基准筛选和微调模型,可:
- 提升内容生成自动化率,减少人工干预;
- 改善用户交互体验:对话式视频助手能严格遵循用户指定条件;
- 支撑合规风控:强制模型遵守禁词、时间窗口、特定格式等。
集成接口
- 作为 MLOps 评测组件:将 Video-IFBench 的 1.5K 样本纳入 CI/CD,对每次模型更新跑指令遵循回归;
- 与 prompt 工程平台结合:用其约束分类(32 任务类型、39 约束类别)生成针对性 few-shot 示例;
- 通过开源代码(GitHub)与现有视频标注/推理流水线对接,输出结构化报告(constraint-level pass rate)指导模型选型与数据增强。
局限
- 数据集规模与覆盖范围有限:Video-IFBench 仅包含 1.5K 样本,虽然半自动 pipeline 降低了标注成本,但 32 种任务类型和 39 种约束类别的组合空间巨大,当前样本量难以充分代表真实世界的多样性。视频来源主要取自现有数据集,可能偏向动作识别、场景理解等特定领域,对长视频、复杂多模态交互(如音视频同步指令)覆盖不足,限制了基准的泛化性和评估全面性。
- 评估范式依赖模型评判器:论文采用 LLM 作为评判器评估指令遵循,虽然高效,但评判器本身可能引入偏见,尤其是对细粒度语义约束的判断可靠性缺乏充分验证。人工验证仅应用于数据集构建阶段,评估阶段的自动评判误差未被严格控制。此外,指令遵循与视频内容理解正确性可能存在冲突,基准主要衡量遵循度,未同时评估最终答案的事实准确性,可能导致模型牺牲内容正确性来满足格式约束。
- 任务交互性与动态性不足:Video-IFBench 主要关注单轮静态指令,未涉及多轮对话中用户修改或追加指令的场景。约束类别虽多,但多为人工预设模板,难以完全捕捉自然语言中的隐含约束和上下文依赖。与文本/图像指令遵循基准相比,视频的时间维度和动态性带来的独特挑战(如时序约束、跨帧推理约束)尚未在指令设计中充分探索,限制了基准对真实视频交互场景的模拟能力。