OmniPro: 面向全主动流式视频理解的综合基准
全主动流式视频理解(即从连续的视听流中自主决定何时发言和说什么)是全模态大语言模型的新兴能力。现有基准存在三个关键不足:主要依赖视觉信号、采用轮询或固定时间戳协议而非真正的主动评估、覆盖任务范围有限,难以可靠评估和区分全主动流式模型。 我们提出 OmniPro,首个联合评估全模态感知、主动响应和多样视频理解任务的基准。包含 2,700 个人工验证样本,覆盖 9 个子任务和 3 个认知层级,涵盖 6 项基本视频理解能力。值得注意的是,84% 的样本需要音频信号(语音或非语音),每个样本标注了模态隔离标签以支持细粒度多模态分析。 进一步引入双模式评估协议:Probe 模式 通过在每个真实触发前后查询模型来评估内容理解;Online 模式 要求模型在流式输入中自主决定响应时机,评估完整主动能力。对 11 个代表性模型的评估揭示三点核心发现:1) 音频带来一致增益但模型间利用率差异极大;2) 性能随时间显著下降,表明长时鲁棒性不足;3) 非语音音频感知仍是最薄弱维度。
论文精读
TL;DR OmniPro 是首个全面评估全模态大语言模型在流媒体视频中主动响应能力的基准,通过双模式评测揭示音频利用差异、长时序退化与非语音音频感知短板。
问题
问题背景
全模态大语言模型正在向全模态主动流式视频理解 (omni-proactive streaming video understanding) 演进——模型须从连续音视频流中自主决策“何时发言”与“说什么”,而非被动等待用户提问。
现有方法的局限
现有基准存在三个关键技术短板,导致无法可靠评估该类能力:
- 视觉中心假设:多数基准仅基于视觉信号构建,忽略音频(尤其是非语音音频)所承载的关键上下文,但真实场景中大量语义由声音触发。
- 伪主动评估协议:采用轮询 (polling) 或固定时间戳触发模型响应,而非让模型自己决定何时触发。这无法衡量真正的主动决策能力,且容易高估模型在流式输入下的表现。
- 任务覆盖狭窄:局限于少数简单问答类型,缺少对空间推理、因果推断、多轮交互等多样化视频理解任务的系统覆盖,难以区分不同模型的认知层级差距。
为什么这个问题既难又重要
技术上,全模态主动流式理解要求模型实时融合异步的视觉帧与音频片段,在无外部提示信号的情况下识别事件边界并做出适时响应。长时程上下文建模、非语音音频的细粒度感知(如物体碰撞声、环境音)以及模态间的协同推理均构成严峻挑战。业界对能够真实环境交互的 AI 助理、自动驾驶系统和智能监控需求强烈,而缺乏统一、严格且覆盖多模态的基准,严重阻碍了这类模型的迭代与落地。
行业类比
类似自动驾驶系统需要依据传感器流自主刹车或变道,流式视频理解模型也需要像一个具备“听觉”的副驾驶,无需人工询问便能在关键时刻给出有价值的信息。
核心洞察
- 音频信号对流式视频理解普遍有增益,但不同模型利用音频的效率差异极大,多模态融合能力是当前瓶颈。OmniPro 首次通过模态隔离标注,量化了各模型在纯视觉、视听结合等条件下的表现,发现即使顶级模型也未充分利用音频,且非语音音频感知尤为薄弱,为多模态对齐和融合机制优化指明了方向。
- 随着视频流持续输入,模型性能随时间显著退化,暴露了长时鲁棒性不足。传统基准多评估短片段孤立任务,而 OmniPro 的在线模式要求模型在持续流中自主决定何时响应,模拟真实场景,揭示了当前模型在长程记忆、上下文关联及时序推理上的根本缺陷,为流式架构设计提供了关键反馈。
方法
OmniPro 基准构建围绕 全模态主动流视频理解 这一新兴能力,按照“任务定义 → 数据生成 → 质量验证 → 双模式评估”链路展开。
任务体系与数据构建
构建从 任务分类法 出发,定义了 9 个子任务,覆盖 事实描述、时间推理、因果推理 三层认知水平,并对应 6 种基础视频理解能力(如对象识别、动作理解、音频事件检测)。为强制多模态依赖,样本设计注重 音频信号必要性:84% 的题目需要同时依赖语音与非语音音频才能正确作答。
源视频收集 选取包含丰富视听事件的公开数据集片段,经 自动化 QA 生成 流水线产生候选题目:先用视觉语言模型生成密集视频描述,再结合音频转写与声学事件标签,使用大语言模型生成问题、正确答案及干扰项。随后通过严格 人工质量控制 剔除歧义或纯视觉可解的题目,并为每个样本标注 模态隔离标签(指示视觉 / 语音 / 非语音音频的独立贡献),最终得到 2,700 个高质量样本。
双模式评估协议
评估模型时,引入两种互补模式:
- Probe 模式:在真实触发事件前后分别向模型提问,测试其内容理解精度,解耦“感知”与“决策”能力。
- Online 模式:模型需在连续流输入中自主决定何时响应并生成回答,完整评估 主动响应 的时序决策与内容正确性。
与同类基准的差异
不同于依赖视觉为主、采用固定时间戳轮询的现有工作,OmniPro 首次在流视频场景下同时度量 全模态感知、主动发言决策 与 多样化任务理解,并通过模态隔离标注和双模式协议提供细粒度诊断,能可靠区分不同模型的流处理能力。
实验
实验设计
OmniPro 基准包含 2,700 个人工验证样本,覆盖 9 个子任务(如视频问答、动作定位、异常检测等),横跨 3 个认知层次 与 6 种基础视频理解能力。每个样本均标注是否需要音频信号(84% 依赖语音或非语音音频)以及模态隔离标签,支持细粒度多模态分析。评估采用 双模式协议:
- Probe 模式:在真实事件触发点前后向模型提问,衡量其内容理解能力;
- Online 模式:要求模型在连续音视频流中自主决策何时发言,评价其主动响应能力与长期时序建模。
实验选取了 11 个代表性模型,包括开源全模态大模型与商业系统,统一在该协议下进行评测。
关键发现
- 音频带来一致增益,但模型利用效率差异显著:加入音频后所有模型性能均有提升,但不同模型对语音与非语音信号的理解能力严重分化。
- 长期推理能力不足,性能随时间明显退化:在流式输入中,多数模型的回答准确率随视频长度增加而下降,反映出有限的长程鲁棒性。
- 非语音音频感知成为最薄弱环节:模型在环境声、音乐等非语义声学场景中的表现远逊于纯视觉或语音任务,暴露了当前多模态融合的瓶颈。
与基线对比解读
现有流式视频理解基准(如 EgoSchema、StreamingQA)主要依赖 视觉信号,采用 轮询或固定时间戳 触发问答,无法真实模拟主动交互。OmniPro 首次联合评估 全模态感知、主动响应决策 与 多样化任务,使得模型必须在原始流中自行判断“何时有意义”以及“说什么”。与这些基线相比,OmniPro 揭示出当前模型在复杂流场景下的系统性缺陷,尤其是对非视觉线索的忽视,为下一代主动式多模态模型提供了明确的改进方向。
行业影响
主动流媒体理解将渗透实时交互与监控场景
落地场景:OmniPro 评估的全模态主动流媒体理解模型,可驱动实时视频分析平台在长时间流输入中自主触发响应,例如:
- 智能视频监控:在异常事件(如非语音音频中的破碎声、尖叫声)发生时即时告警,而非仅靠视觉触发;
- 直播 / 会议助理:从连续音视频流中自动识别提问、情绪变化或讨论焦点,主动提供信息摘要或提醒;
- 自动驾驶舱内交互:持续感知驾驶员语音及环境声音(如警报、喇叭),在关键时刻主动语音提醒。
商业价值:
- 降低人工监控成本:模型自主决定「何时响应」可减少对轮询或人工值守的依赖,尤其适合 24/7 视频流处理;
- 提升交互体验与留存:主动型用户界面(如智能家居、在线教育)能实时捕捉用户意图并主动回应,缩短等待时间,提升满意度;
- 增强安全与合规:在金融交易室、工业生产等场景,对音频异常(如机器异响)的即时感知可避免事故,降低损失。
与现有产品 / 工作流的集成: OmniPro 定义的 Probe / Online 双模评估协议 可直接转化为 CI/CD 中的质量门禁,用于多模态流处理模型的迭代评测。现有视频理解栈(如使用 Video-LLaMA、VideoChat 等)只需在其推理管道中增加流式输入接口和主动触发模块,即可利用 OmniPro 进行离线测评与在线压测,确保模型在长时流场景下的鲁棒性。
具体落地用例:
- 内容审核平台:短视频或直播平台中,模型同时在视觉(画面违规)、语音(敏感词、争吵)轨道上感知,主动拦截违规内容,比传统抽帧检测降低漏报率。
- 远程医疗导诊:患者视频问诊时,系统监听咳嗽声、呼吸音等非语音音频,结合视觉表情,主动提醒医生关注异常指标,辅助快速分诊。
局限
- - **数据集规模与多样性有限**:OmniPro 包含 2,700 个人工验证样本,覆盖 9 个子任务,但总量仍较小,且视频来源可能集中在特定领域,无法充分代表真实流媒体场景的多样性(如不同语言、口音、噪声环境、动态视觉条件)。84% 样本需要音频信号,但音频事件的类型分布可能不均,导致评估偏向常见类别,限制了对模型泛化能力的考察。
- - **评估协议与实际部署存在差距**:Probe mode 依赖 ground-truth 触发器前后的查询,无法模拟连续流输入下模型需自行决策的完整闭环;Online mode 虽要求自主响应,但触发时间点的 ground-truth 标注存在主观性,且未考虑响应延迟、计算开销等系统实时性指标。两类模式均未评估模型在真实噪声、网络中断等恶劣条件中的鲁棒性,且不涉及多轮对话交互,降低了与生产环境的对齐度。
- - **缺乏对模型改进的直接引导**:基准测试揭示了音频利用差异、长程退化、非语音音频薄弱等现象,但未提供细粒度的诊断工具(如跨模态归因、错误类型分解)或明确的改进方向,研究者难以从中直接定位模型的模态融合缺陷或时序建模瓶颈,限制了其作为“诊断性基准”的价值。