论文

ReactVAU:面向流式视频异常理解的慢-快解耦框架

ReactVAU:面向流式视频异常理解的慢-快解耦框架

本文提出 ReactVAU,一个面向实时流式视频异常理解(VAU)的慢-快解耦框架。现有 VAU 方法依赖离线推理与全局时间采样,违背因果性,难以部署于实时监控视频流。与之相对,通用流式视频模型虽然满足因果访问,却会在记忆压缩过程中稀释罕见的瞬态异常,且往往在漫长的正常区间上无差别地调用重量级 MLLM。 ReactVAU 通过三个协同组件填补这一空白: 1. 轻量级快速检测模块,基于 Spatial Grid Folding (SGF) 实现连续的异常过滤; 2. 异常感知持久记忆 (AAPM),保护关键视觉线索免受时间衰减影响; 3. 重量级慢推理模块,在正常视频流中保持休眠,仅由可疑事件唤醒,用于语义验证与因果描述。 在多个 benchmark 上的大量实验表明,ReactVAU 能在严格的流式约束下运行,在异常检测与因果推理两方面同时取得有竞争力的性能,并通过最小化重量级 MLLM 调用显著提升计算效率。项目主页:https://huiyuiui.github.io/ReactVAU/

论文精读

TL;DR ReactVAU 以慢快解耦框架实现流式视频异常理解:空间网格折叠快速检测持续过滤,异常感知记忆保护关键线索,仅在可疑事件时唤醒重型推理模块,兼顾实时性与低算力。

问题

问题背景

视频异常理解(Video Anomaly Understanding, VAU)是智能监控与公共安全的核心技术,要求系统不仅能定位异常事件,还能提供语义描述与因果推理。传统帧级异常检测(VAD)只输出标量分数,缺乏解释性;近期工作引入多模态大模型(MLLM)实现推理,但大多基于离线视频处理。

现有方法局限

  • 离线 VAU 方法依赖全局时间采样(如均匀采样整段视频帧),违反因果关系(需要未来帧),无法部署于实时流。
  • 通用流式视频模型虽满足因果访问,但其内存压缩机制(如 token 合并 / 记忆更新)会稀释罕见且瞬态的异常特征,导致漏检。
  • 这些模型在长时间正常片段中仍持续调用重型 MLLM,造成算力浪费与高延迟,难以满足实时约束。

为什么难且重要

流式异常理解面临双重挑战:既要严格因果(仅用当前与过去信息),又要捕捉持续时间极短(可能仅数帧)的异常事件。流式记忆的遗忘特性与异常事件的稀疏性天然冲突;同时重型 MLLM 推理延迟高,逐帧调用不现实。业界对实时监控、自动驾驶、工业质检等场景的需求迫切,需要在检测灵敏度与推理效率之间取得平衡。

行业类比

类似边缘智能摄像头中的事件触发推理机制:平时低功耗运行轻量检测,仅在可疑事件发生时唤醒重型模型进行语义分析,避免持续高负载。

核心洞察

  • 按需唤醒的重型推理机制:ReactVAU 通过慢快解耦,只在快速检测模块触发可疑事件时调用重型 MLLM 进行语义验证与因果描述,避免在长时间正常流中均匀运行大模型。与离线 VAU 方法(依赖全局时间采样、不满足因果)和一般流式模型(重型模型全程在线、计算浪费)相比,该设计在维持实时流式约束的同时显著降低计算开销,更贴近真实监控部署。
  • 异常感知持久记忆的防衰减设计:AAPM 对异常内容赋予优先级分数,并通过动态密集采样保护关键视觉线索,确保慢推理模块被唤醒时仍能访问完整异常上下文。不同于常规流式记忆压缩对所有帧等权重更新、容易稀释罕见瞬时异常,该模块显式偏向异常信号,是提升因果推理质量的关键,而非仅仅改进检测分数。
  • 空间网格折叠轻量过滤:SGF 作为连续异常检测的快速前端,通过低计算成本的空间特征聚合实现初步过滤,降低误报并将慢推理延迟到必要时刻。相比依赖光流或复杂特征提取的传统 VAD 方法,SGF 更适配资源受限的流式场景,同时为后续重型推理提供高性价比的触发信号。

方法

输入与总体流程

输入为因果流式视频,仅允许当前及历史帧访问。ReactVAU 采用“快-慢”解耦设计:轻量快速模块常驻运行,重型慢速模块按需唤醒。

关键模块

  1. Fast Detection Module + Spatial Grid Folding (SGF) :对连续视频帧进行轻量级异常过滤。SGF 将空间网格特征折叠压缩,降低计算量,同时保留空间异常线索;输出帧级异常分数,用于实时判断当前帧是否可疑。
  2. Anomaly-Aware Persistent Memory (AAPM) :为克服流式模型记忆压缩导致罕见瞬态异常被稀释的问题,AAPM 依据异常优先级分数 动态保留关键视觉特征。包含异常池 (存储历史异常片段)与动态密集采样 机制,在实时感知中维持对重要异常线索的长期记忆,防止时间衰减。
  3. Slow Reasoning Module :通常处于休眠状态。当快速模块检测到可疑事件(异常分数超过阈值)时被唤醒,调用重型 MLLM 对由 AAPM 提供的异常相关上下文进行语义验证和因果描述生成。正常流期间不触发,显著降低计算开销。

输出与差异点

输出包括帧级异常检测结果(实时)和对异常事件的因果描述(按需)。与现有离线 VAU 方法(依赖全局时间采样、违反因果性)以及通用流式模型(均匀调用重型 MLLM、记忆压缩丢失异常)相比,ReactVAU 通过快慢解耦和异常感知记忆,在严格流式约束下同时实现高效检测与高质量推理。

实验

实验设计

作者在多个公开视频异常检测基准上评估 ReactVAU,覆盖离线设置与严格流式约束。评估指标同时包含 VAD 的帧级 AUC 与 VAU 的因果描述质量,并统计重型 MLLM 的调用频率与端到端延迟。实验对比离线 VAU 方法(如基于全局时间采样的模型)与通用流式视频理解模型。

关键发现

  • 在流式约束下,ReactVAU 的异常检测性能与离线方法竞争,但避免了因果违背。
  • 快速检测模块有效过滤大部分正常帧,使 Slow Reasoning Module 仅对可疑事件激活,显著降低 MLLM 调用次数。
  • AAPM 通过动态密集采样保护短时异常线索,缓解了普通记忆压缩导致的异常稀释。

与基线对比的深度解读

与离线 VAU 相比,ReactVAU 牺牲少量精度换取实时因果推理可行性,这对实际监控部署至关重要。与统一调用重型模型的流式方案相比,ReactVAU 的按需唤醒策略带来数量级的计算节省,同时保持异常描述的语义完整性。工程启示:可将快速模块视为常驻轻量过滤器,重型模块作为可弹性伸缩的后端服务,实现资源效率与响应延迟的平衡。

行业影响

落地场景

ReactVAU 可直接嵌入实时视频分析产品,如云监控服务、直播内容安全审核、工业视觉质检和自动驾驶数据记录。例如,在电商直播审核中,快速检测模块 持续扫描流,实时标记可疑片段(如暴力、违禁物品),无需等待整场直播结束;触发后 慢推理模块 才被唤醒,生成语义描述与因果解释,输出可读的违规报告。

商业价值

主要收益来自降本:传统 MLLM 均匀推理长时段正常流,费用高、延迟大,而 ReactVAU 的慢快解耦使重型模型仅在异常片段运行,推理成本可降低一个数量级。实时告警减少人工审核等待,提升安全响应速度;对监控服务商而言,可按事件量计费,优化边际利润。

与现有产品/工作流的接口

可作为现有视频分析管线的 前端过滤器,部署于边缘设备或流媒体网关。输入 RTSP/WebRTC 流,输出结构化事件(时间戳、异常类型、置信度、因果描述)至 Kafka 或消息队列,下游对接告警平台、工单系统或人工审核界面。相比传统 VAD,ReactVAU 额外提供因果解释,且兼容 Apache Flink 等流处理框架。AAPM 持久记忆设计可集成到特征存储层,避免重复计算。

局限

  • - **快速检测模块的可靠性未被充分讨论**。SGF 基于轻量空间网格折叠,在密集人群、遮挡或低光照等复杂场景下可能出现漏检,导致 **AAPM** 无法捕获关键帧,**慢速推理模块** 不被触发,最终造成漏报。论文未给出检测阈值设置的自适应策略,不同监控场景(如商场 vs. 街道)可能需要重新调参,这增加了实际部署的工程成本。此外,快速模块的误报率也会影响效率,频繁误唤醒 MLLM 会抵消按需推理的收益。
  • - **实验数据与真实流式场景存在分布差异**。论文主要在 **UCF-Crime**、**ShanghaiTech** 等标准学术数据集上验证,这些数据集通常由预剪辑的视频片段组成,包含明确的事件边界,而真实监控流是连续、长时间、非平稳的。论文未在长时间真实监控流(如数小时无事件)上测试 **AAPM** 的记忆衰减与容量限制,也未评估缓慢演变的异常(如逐渐聚集的人群)能否被持久记忆捕获。因此,系统在真实部署中的鲁棒性仍待验证。
  • - **框架性能受限于底层 MLLM,且资源开销评估不足**。ReactVAU 的语义验证与因果描述依赖 **MLLM**,若 MLLM 自身对异常理解的先验偏差或幻觉问题,错误会传递到最终输出。论文主要报告了 MLLM 调用次数的减少,但对边缘设备上的内存占用、端到端延迟、以及快速与慢速模块的流水线调度开销分析不够深入。与 **StreamingLLM**、**Mamba-based** 流式模型相比,ReactVAU 在极端资源受限场景(如嵌入式摄像头)下的可行性尚不明确。
论文Chia-Hui Chen2026-09-07原文

相关内容