通过通用关键帧提取连接VideoQA与视频引导的代理任务
视频理解是多模态智能的基础能力,近期多模态大语言模型(MLLM)在视频问答(VideoQA)基准上取得显著进展。然而,现有基准主要评估模型感知浅层视觉线索的能力,很少考察模型能否从视频教程中学习深层知识或程序性技能,并泛化到下游长程代理任务。 为填补这一空白,我们提出VG-GUIBench(视频引导GUI基准),专门评估基于MLLM的GUI代理能否跟随视频教程完成对应交互任务。此外,我们发现模型在VideoQA和视频引导代理任务上的性能关键依赖于有效关键帧提取。基于此,我们提出TASKER(任务驱动与场景感知关键帧搜索器),该算法联合考虑任务相关性与场景动态,识别信息量高的帧。 实验结果表明,TASKER在VideoQA和视频引导代理任务基准上均取得显著提升:在EgoSchema fullset上超越最佳基线2.0%,在NExT-QA上提升1.8%。这些结果凸显了通用关键帧提取方法在视频理解任务中的潜力。代码与数据已开源。
论文精读
TL;DR 提出 VG-GUI-Bench 评测 MLLM 观看视频教程后执行 GUI 操作的能力,并设计 TASKER 关键帧提取算法,通过任务驱动与场景感知显著提升视频问答和代理任务性能。
问题
背景
视频理解正从传统 VideoQA 向更复杂的视频引导代理任务演进。多模态大语言模型(MLLMs)在现有 VideoQA 基准上表现亮眼,但这类基准大多只检验模型对浅层视觉线索的感知,未能衡量模型是否真正从视频教程中习得深层过程知识,并泛化到长程交互式代理场景。
现有方法的局限
当前 MLLMs 的视频评估存在两层局限:一是基准本身多聚焦于事实性问答,忽略了对过程技能和任务执行能力的考察;二是关键帧提取普遍依赖均匀采样或基于低层视觉特征的启发式规则,与下游任务割裂,无法区分哪些帧对回答或操作真正关键。在长视频教程中,帧与帧之间信息冗余度高,任务相关帧分布稀疏,现有方法极易遗漏关键操作步骤或引入大量噪声帧,导致模型在 GUI 代理任务中无法准确理解教程并完成操作。
为什么该问题重要且困难
视频引导的代理任务要求模型从视频中持续推理、记忆操作序列并作用于 GUI 环境,这比单纯问答更考验模型的长程理解和执行能力。其核心挑战在于同时考虑任务相关性与场景动态,从密集视频流中动态选出信息密度最高的帧:既要匹配任务语义(如点击按钮、填写表单),又要捕捉场景变化(如界面跳转、状态更新)。业界正将 MLLMs 推向 GUI 代理等 RPA 应用,这类任务直接关联自动化与辅助决策,因此需要更贴近真实部署的评估基准与高效关键帧提取算法来弥合视觉理解与行动执行的鸿沟。
类比
这一需求类似自动驾驶感知中,系统必须从连续视觉输入里提取关键场景帧进行行为规划,而非逐帧处理——任务驱动与场景感知的融合是提升效率与准确性的关键。
核心洞察
- 任务驱动与场景感知的关键帧提取范式:TASKER 将关键帧选择从固定的视觉变化检测升级为联合优化**任务相关性**与**场景动态**的自适应搜索过程。与传统的均匀采样或基于光流的差异性提取不同,它通过类搜索算法在视频时间轴上主动寻找对下游任务最具信息量的帧,这使得同一个视频针对不同的问答或操控目标可以输出不同的关键帧子集,显著提升了帧利用效率。该范式在 VideoQA 和 GUI 代理两类差异显著的任务上均超越最优基准(EgoSchema +2.0%,NExT-QA +1.8%),证明了任务感知型关键帧提取作为通用视频理解前置模块的可行性和迁移潜力。
- 视频理解评估从静态内容问答向动态技能迁移的延伸:VG-GUIBench 首次系统性地检验 MLLM 是否能够从视频教程中提取程序性知识并完成长程 GUI 操控,填补了现有基准只关注浅层视觉线索而忽略深层技能泛化的空白。与 VideoQA 不同,该基准要求模型理解操作步骤的因果顺序和界面状态变化,并在真实交互环境中复现,直接暴露了当前 MLLM 在过程性记忆和动作长链推理上的短板。这一设计促使研究者重新思考视频理解的目标——不应仅停留在文字描述,而应能转化为可执行的代理行为,对后续多模态代理的训练数据和评估方法具有方向性启示。
方法
TASKER 关键帧提取方法
TASKER(Task-driven And Scene-aware Keyframe searchER)是一个通用的关键帧提取算法,旨在为 VideoQA 与视频引导的 agentic 任务提供高质量的视频帧子集。其设计遵循“输入 → 搜索选择器 → 输出”的流水线:
- 输入:一段原始视频与一个可选的 任务描述(如 VideoQA 问题、GUI 操作指令)。
- 核心模块:基于 MLLM 的 Keyframe Selector,内部采用 束搜索(beam search) 框架,在候选帧序列上逐步扩展,同时评估两个维度的信息量:
- 任务相关性(Task Relevance):由 MLLM 判断当前帧是否包含完成特定任务所需的视觉证据或操作细节。
- 场景动态(Scene Dynamics):通过计算帧间特征差异(如 CLIP 相似度)量化视觉变化,避免选择冗余帧,确保捕获关键场景切换。
搜索过程中,MLLM 作为 scorer 对候选帧进行打分,并依据 终止条件(如达到最大帧数预算或信息充分性分数阈值)决定何时停止。这种设计使算法能自适应不同长度与类型视频,而不需要预先定义固定间隔。
- 输出:一组精选的关键帧,可直接输入下游 MLLM 进行推理(如 VideoQA 答案生成或 GUI agent 动作规划)。
VG-GUI-Bench 基准
为评估视频引导的 agentic 能力,我们还构建了 VG-GUI-Bench,包含从真实 GUI 操作视频中提取的多步交互任务。每个样本由一段教学视频与对应 多轮 GUI 状态-动作对 组成,要求 agent 在观看视频后,在模拟环境中复现操作序列。该基准填补了现有 VideoQA 只考察浅层视觉感知、忽略从视频中学习程序性知识的空白。
与同类方法的差异
传统关键帧提取(均匀采样、基于聚类或视觉相似度)只考虑视觉内容,忽略下游任务目标。TASKER 首次将 任务驱动 与 场景动态 联合建模为搜索目标,并通过 MLLM 评分实现跨任务的泛化,在 VideoQA 与视频引导 agentic 任务中均显著优于固定采样及最新的视频-LLM 全帧方法。
实验
实验设计
- 任务与基准:在 VideoQA 和视频引导代理任务上评估 TASKER。VideoQA 采用 EgoSchema(全量集)与 NExT-QA;代理任务使用自建基准 VG-GUI-Bench,衡量 MLLM-based GUI agent 跟随视频教程完成交互的能力。
- 对比方案:基线包括固定间隔采样、基于 CLIP 相似度的关键帧搜索等经典方法,并测试不同底层 LLM(如 GPT-4o)和搜索算法变体。
- 消融分析:针对终止条件、基本搜索算法(Top-K 拼接等)以及基础 LLM 选择进行控制变量实验。
关键发现
- TASKER 联合 任务相关性 与 场景动态 筛选关键帧,在 EgoSchema 全量集上较最佳基线提升 2.0% 准确率,NExT-QA 提升 1.8%。
- 在视频引导代理任务中,TASKER 表现出更强的过程理解与指令遵循能力,验证了泛化性。
- 消融证明:任务驱动的帧选择优于纯视觉相似性搜索,结合场景切换检测可有效抑制冗余帧,提升信息密度。
与基线对比深度解读
- 提升看似微小,但 EgoSchema 基线已达 50-60% 准确率,2% 的绝对增益具备统计显著性和工程实用价值。
- TASKER 无需额外训练,仅通过优化帧搜索策略实现增益,为 通用关键帧提取 在长视频与任务型场景中的应用提供了轻量即插即用方案。
- 该方法可无缝集成于现有 MLLM 流水线,同时提升 VideoQA 与视频引导代理两类任务,说明帧选择质量是当前视频理解的瓶颈之一,优化该模块能释放下游模型潜力。
行业影响
落地场景
VG-GUI-Bench 与 TASKER 瞄准的是视频教程驱动的 GUI 自动化,核心能力是将长视频中的关键操作帧提取出来,供多模态大模型理解并执行交互任务。直接可落地的场景包括:
- RPA (机器人流程自动化):用户只需录制一段操作演示视频,系统自动抽取关键帧并生成可执行的 UI 自动化脚本,代替传统的手工录制或脚本编写。
- 智能客服与远程协助:支持视频库中的故障排除教程被解析为步骤序列,代理直接在用户界面上高亮或执行操作,降低对人工坐席的依赖。
- 内容审核与操作合规:对操作视频(如仓库分拣、设备维护)进行关键帧分析,自动校验流程是否合规,识别异常动作。
商业价值
- 降本:TASKER 的关键帧提取算法可直接替换现有视频理解 pipeline 中的固定采样策略,显著提升下游任务(如 VideoQA、GUI 代理)的准确率(提升 1.8-2.0 个百分点),从而减少因错误操作导致的返工成本。
- 增收:对于提供视频驱动自动化服务的平台,更精准的视频理解能力可支撑高阶订阅服务(如“上传教学视频即自动生成工作流”),拓宽商业化空间。
- 体验提升:终端用户通过自然视频演示即可“教”会软件代理,交互门槛大幅降低,适用于非技术背景的运营、培训场景。
与现有产品 / 工作流的接口
- RPA 工具链集成:可作为 UiPath、Automation Anywhere 等平台的视频录制模块增强插件,将传统的屏幕录制 + 人工标记步骤升级为端到端自动抽取关键帧并生成脚本。
- 多模态 RAG 系统:TASKER 能作为视频知识库的预处理组件,按任务相关性和场景变化抽取关键帧,提升检索增强生成(RAG)在视频问答上的效果。
- 模型服务化:算法本身轻量,可封装为微服务,通过 REST API 供业务系统调用,输入视频流和任务描述,输出关键帧索引和置信度。
具体落地 Use Case
- 电商商品发布自动化:商家上传一段商品展示及上架操作视频,TASKER 抽取关键 UI 操作帧(如点击“发布”、选择类目、填写价格),MLLM 代理理解后直接在后台模拟执行,完成商品创建。相比纯文本或截图理解,视频教程携带更完整的时序信息,降低理解歧义。
- 企业新员工入职自动化:HR 录制一段标准入职流程视频(开通账号、分配权限、加入邮件组等),入职代理观看后自动在内部系统中执行这些步骤,实现“开机即入职”。TASKER 确保这些跨系统、长步骤的操作能被切分成可执行的原子任务,提升入职效率和合规性。
局限
- VG-GUIBench 基准主要聚焦 GUI 交互任务,视频教程类型受限于桌面或移动应用操作,难以直接推广至物理机器人操控或更广泛的视频理解场景。评测高度依赖 agent 的多步规划能力,但领域狭窄可能削弱结论的泛化性,也缺乏与现有 agent 基准(如 OSWorld)的充分对比验证。
- TASKER 算法引入任务相关性判断需要调用基础语言模型进行帧选择,计算开销较高,论文未详细分析实时性或资源受限环境下的可行性。与经典视频摘要、均匀采样或基于光流的关键帧提取方法相比,效率优势不明显,实际部署时可能成为瓶颈。
- 实验仅在 EgoSchema、NExT-QA 两个 VideoQA 数据集及自建 VG-GUIBench 上验证,未能覆盖更多样化的长时视频(如未剪辑视频或直播流)和实际 agent 基准。对于无明确任务提示的视频,TASKER 的场景动态理解与任务相关性联合搜索策略是否仍然有效尚不明确,泛化边界有待进一步探索。