VideoGAIA: 面向智能体视频理解的通用水智能助手基准
视频理解是评估多模态大语言模型(MLLMs)能力的基础任务。然而,现有顶尖模型在 Video-MME 排行榜上已取得约 90% 的准确率,表明传统的单轮视频理解任务正趋于饱和,难以再有效评估先进 MLLM 的智能水平。为此,我们提出 VideoGAIA——一个面向通用人工智能助手的智能体视频理解基准。 VideoGAIA 将视频理解从一次性问答拓展为多轮、工具增强的交互过程:模型需迭代感知视频、调用外部工具、收集补充信息,并跨轮整合多模态证据。该基准包含 271 个人机协同设计的任务,覆盖多样且复杂的真实场景。每个视频-问题-答案实例均经过三位人类专家独立验证,确保正确性与难度适中。 实验结果显示,包括 GPT-5.5 和 Kimi-K3 在内的前沿模型在 VideoGAIA 上准确率均不足 60%,凸显了其作为高质量、及时性基准的价值。我们希望 VideoGAIA 能够推动从传统视频理解向智能体视频理解的范式转变。
论文精读
TL;DR VideoGAIA 将视频理解重塑为多轮、工具增强的 agentic 交互任务,包含 271 个专家验证的复杂场景;GPT-5.5、Kimi-K3 等前沿模型准确率低于 60%,暴露现有单轮评测的饱和问题。
问题
当前多模态大模型在视频理解任务上能力快速提升,传统单轮基准(如 Video-MME)已接近 90% 准确率,评估信号趋于饱和,业界需要能区分前沿模型真实智能水平的评测方法。
现有方法局限:主流视频理解基准多为单轮问答,模型只需对给定视频进行一次感知与回答,无法考察多轮交互、工具主动调用、时序证据回溯等能力。例如,面对需要先定位关键帧、再调用 OCR 或检索外部知识的复杂查询,单轮设定既未提供工具接口,也不允许模型在信息不足时主动补齐上下文。这导致高分数与真实场景中“能用 AI 助手解决视频任务”的实际水平存在明显落差。
为什么难/重要:Agentic video understanding 要求模型具备规划、工具选择、跨模态证据整合、鲁棒推理等多重能力,视频本身非结构化、信息密度低,外部工具返回可能带噪声,模型需在长上下文中保持一致性。构建高质量评测也困难,每个实例需三位人类专家验证,成本高但必要。前沿模型 GPT-5.5 与 Kimi-K3 在 VideoGAIA 上准确率均低于 60%,说明现有模型远未达到通用视频智能体水平,该方向将成为下一代 MLLM 研发的关键标尺。
行业类比:正如 SWE-bench 将代码生成从单轮补全推进到多步工具调用的软件工程智能体评估,VideoGAIA 之于视频理解,标志着从“看懂”到“会做”的评测范式迁移。
核心洞察
- VideoGAIA 将视频理解从单轮问答重构为多轮、工具增强的代理交互过程。与 Video-MME 等传统基准仅评估单次视频 QA 不同,VideoGAIA 要求模型在多轮中调用外部工具、获取互补信息并整合多模态证据,这更接近实际 AI 助手处理复杂视频任务的流程,从而有效暴露前沿模型在长期规划、工具选择与证据综合方面的短板。
- VideoGAIA 通过模型-人类协同设计和三重专家验证,刻意构建了高难度且工具必需的评估样本。任务生成采用证据锚定与工具必要性评估,确保仅靠视频内容无法回答,必须使用外部工具。该机制使得 GPT-5.5、Kimi-K3 等前沿模型准确率均低于 60%,充分体现基准的区分度,避免了现有基准接近 90% 准确率导致的饱和问题,为下一代 MLLM 的 agentic 视频理解能力提供了及时且严格的评测标尺。
方法
输入
VideoGAIA 的构建输入为一段原始视频,以及围绕该视频定义的开放式任务目标。任务目标不限于直接问答,而是要求模型在真实场景中完成信息检索、交叉验证或决策支持等复杂需求。
关键模块
- Frame-Level Video Captioning
对视频进行逐帧密集描述,提取帧级别的关键语义、物体、动作与时序关系,为后续任务生成提供 evidence 基础。 - Evidence-Grounded Task Generation
模型与人类专家协同设计多轮、工具增强的交互式任务。生成过程强制要求每个问题都能追溯到视频中可验证的证据片段,避免凭空提问或无法回答的问题。 - 质量控制流水线
- Rubric-Based Quality Control:依据评分标准自动评估任务难度、清晰度与可回答性。
- Cross-Modal Filtering:过滤掉仅靠单模态信息即可回答的任务,确保任务必须整合视频、工具返回结果等多模态证据。
- Tool-Necessity Assessment:判定每个任务是否必须调用外部工具才能解决,剔除无需工具即可完成的伪 agentic 任务。
- Safety Screening:筛除包含有害、敏感或隐私风险的内容。
- Human Crowdsourced Annotation:最终由三位人类专家独立校验每个实例的正确性与难度,保证标签质量。
输出
最终输出为 271 个经多轮筛选与人工验证的 agentic 视频理解任务实例。每个实例包含原始视频、多轮对话上下文、可选工具接口以及基于证据整合的标准答案。在评估阶段,模型被视作一个 agent,可以自主决定何时观看视频、调用哪些工具、在多轮交互中逐步收集信息并给出最终答案;评判由独立 judge model 根据证据完备性和答案准确性进行。
差异点
与 Video-MME 等单轮视频 QA 基准不同,VideoGAIA 将评估重心从「给定视频直接作答」转向「多轮交互 + 工具调用 + 跨模态证据整合」的 agentic 流程,更接近真实世界 AI 助手的工作模式。
实验
实验设计
VideoGAIA 提出代理式视频理解基准,包含 271 个由模型-人类共同设计的任务,覆盖多样化复杂真实场景。每个视频问答实例由三位人类专家独立验证正确性与难度。评估时将多模态大模型作为 agent,置于工具增强的多轮交互环境中,模型需迭代感知视频、调用外部工具、收集补充信息并跨轮整合多模态证据。
关键发现
所有被评估的 MLLMs,包括 GPT-5.5 和 Kimi-K3 等前沿模型,在 VideoGAIA 上准确率均低于 60%,表明代理式视频理解对现有模型仍具挑战性。相比之下,传统基准 Video-MME 上领先模型已取得约 90% 准确率,任务趋于饱和。VideoGAIA 通过多轮工具增强形式暴露了模型在复杂推理、工具使用和跨轮信息整合方面的不足。
与基线对比
相较于 Video-MME 等单轮问答基准,VideoGAIA 将任务扩展为多轮交互,要求模型在每一步决定是否调用工具、如何处理反馈,并最终整合证据。该设计更贴近真实 AI 助手应用场景,避免了单纯记忆或短时模式匹配。准确率从约 90% 骤降至 60% 以下,说明现有 MLLMs 的差距主要不在视觉编码,而在规划、工具调用和长期上下文管理。该基准为评估下一代 MLLMs 提供了更具区分度的测试平台。
行业影响
落地场景
VideoGAIA 提出的多轮、工具增强视频理解范式,可直接支撑长视频内容分析、跨模态检索、智能监控联动等场景。例如:
- 电商直播回放分析:模型需调用商品数据库、订单系统等外部工具,回答“主播在 3 分 20 秒展示的裙子是否已售罄”这类多步问题。
- 企业知识库视频问答:对产品培训视频、操作手册视频,允许模型调用文档检索、OCR 等工具,逐步定位关键步骤并给出答案。
商业价值
现有单轮视频 QA 基准已饱和(如 Video-MME 上领先模型 ~90% 准确率),而 VideoGAIA 上所有模型均低于 60%,说明真实 agentic 场景仍有显著性能缺口。企业若投入针对性优化(如工具调用策略、多轮记忆),可直接提升自动化工单处理、视频内容审核等业务的完成率,降低人工介入成本,同时通过更自然的对话式交互提升用户体验与付费转化率。
与现有工作流的接口
可将 VideoGAIA 作为评测模块嵌入 MLOps 流程,用于筛选具备 agentic 能力的视频理解模型。同时,其任务设计框架(证据限定任务生成 + 工具必要性人工校验)可复用为企业内部数据集构建模板,加速垂直领域 agentic video 模型开发。
基准价值:VideoGAIA(271 任务、三专家验证)填补了从单轮视频理解到 agentic 交互的空缺,为下一代视频 AI 助手提供了高质量评测标尺。
局限
- **数据规模与多样性受限**: VideoGAIA 包含 271 个人机协同设计任务,虽然每个实例经三名专家独立验证,但绝对数量仍然偏小。视频理解场景高度多样,当前覆盖可能不足以充分测试模型在不同领域、时长、语言和交互模式下的泛化能力。此外,依赖人工验证的流程导致扩展成本高昂,后续难以快速增加新任务,可能限制 benchmark 的长期演进。与大规模自动生成的数据集相比,其统计功效有限,难以进行细粒度的能力诊断。
- **工具生态与交互简化**: 论文中工具调用被限定在预设的工具集内,且多轮交互可能遵循较为固定的流程。真实世界 AI 助手面对的工具种类、API 动态变化和失败重试等复杂情况并未完全模拟。这种简化可能导致模型在 VideoGAIA 上的表现不能完全迁移到实际部署环境,例如模型可能通过记忆工具响应模式而非真正理解视频内容来得分。此外,工具必要性评估依赖人类判断,可能存在主观性。
- **评估协议与数据泄漏风险**: 评估使用 judge 模型进行评分,虽然经过校准,但仍可能引入系统偏差。视频数据来源可能包含公开网页或已有数据集,存在被训练数据覆盖的风险。虽然作者进行了安全筛查和跨模态过滤,但无法完全排除泄漏。多轮交互的评估自动化程度有限,评测过程可能耗时且复现门槛较高,限制了社区快速验证和迭代。