论文

Watch, Remember, Reason: 基于MLLMs的人类视角视频理解

Watch, Remember, Reason: 基于MLLMs的人类视角视频理解

视频理解正被多模态大语言模型(MLLMs)快速变革,研究从短片段转向长视频、多模态及知识密集型场景。这些场景要求模型处理稀疏证据、长距离依赖、多模态对齐,并在有限计算资源下进行可靠推理。本文提出人类视角(Human-View)的分析框架,围绕观看、记住、推理三大功能能力组织基于MLLMs的视频理解。 框架将视频理解系统形式化为感知表示、记忆状态、推理轨迹和最终预测四个组件。基于此,识别出时空感知、高效长视频处理、记忆建模、流式理解和忠实推理等关键挑战。代表性方法按其角色归类:观看涵盖细粒度、综合、音视频和高效感知;记住包括离线与流式记忆;推理覆盖纯文本推理和视频伴随推理。 应用领域涵盖自我中心视频、体育视频、教学视频、医学视频和叙事视频等,并整理了多种任务类型、监督格式、模态和能力维度的训练数据集与评估基准。最后,指出可扩展、记忆感知、基于证据的视频智能的开放问题与未来方向。

论文精读

TL;DR 以人类认知的“观看-记忆-推理”为框架,系统梳理视频多模态大模型在长视频理解中的感知、记忆与推理机制,提供统一分析视角并指明未来方向。

问题

问题背景

视频理解正从短片段分析转向长视频、多模态、知识密集型场景,研究者试图让模型像人类一样观看记住推理,以处理稀疏证据与长程依赖。

现有方法的局限

  • 任务割裂:传统视频理解将问题拆分为孤立的基准任务(如动作识别、时刻检索),缺少统一框架来协同感知、记忆与推理,导致模型无法积累场景上下文。
  • 时空感知粗糙:多数方法依赖稀疏采帧或固定分辨率,丢失细粒度时空细节,难以捕捉快速运动或小物体交互。
  • 多模态融合低效:音频、文本、视觉流未在统一表征空间对齐,跨模态证据难以互补,尤其在语音指令与视觉行为关联的场景(如教学视频)。
  • 记忆模型薄弱:离线记忆依赖固定窗口或简单摘要,无法动态筛选与更新长期信息;流式记忆更缺乏选择性遗忘与高效检索机制,导致长视频处理时内存与计算膨胀。
  • 推理不可验证:生成答案缺乏证据链追溯,常出现幻觉或逻辑跳跃,在医疗、驾驶等高风险领域尤为致命。

为什么这个问题重要且困难

核心挑战在于有限计算预算下实现高保真理解:视频的时空冗余需要高效压缩,长跨度因果推理要求结构化记忆,流式场景必须增量更新状态,而多模态对齐依赖鲁棒的表征学习。

业界高度关注此方向,因为视频数据占据互联网流量的绝大部分,自动驾驶、机器人、远程医疗、智能监控等应用都亟需可扩展、可解释的视频智能。然而,现有 MLLMs 在小时级视频上的推理成本极高,且缺乏空间推理与多段时序定位能力,这阻碍了其大规模落地。

行业类比

类似于自动驾驶系统需同时处理多路摄像头、激光雷达与高精地图,并实时构建场景图进行因果决策——视频 MLLMs 也要在统一框架内融合多模态证据流,并产出可追溯的推理链。

核心洞察

  • **功能视角重新定义视频理解架构**:论文提出的“观看—记忆—推理”功能分解,将视频 MLLM 的设计从孤立的基准任务转向类人认知流水线。与只优化单一任务指标的方法不同,该视角强制显式建模感知编码、上下文保留与推理轨迹,使模型内部瓶颈透明化,便于针对性地升级感知粒度、记忆容量或推理忠实度,为模块化系统改进提供了清晰蓝图。
  • **流式记忆推动实时视频理解**:区分离线与流式记忆机制,直指长程、持续视频输入的核心挑战——模型必须在计算预算下动态压缩或丢弃旧信息。这与多数工作假设完整视频预载不同,流式记忆要求选择性遗忘与增量更新,对可穿戴设备、监控等实时场景至关重要,并启发开发高效的记忆压缩与检索策略。

方法

该工作提出了一种以人为中心的视频理解统一视角,将基于多模态大语言模型(MLLM)的视频理解系统形式化为观看(Watching)、**记忆(Remembering)推理(Reasoning)**三个核心功能模块的协同处理流程。

输入为原始视频流(含视觉、音频等多模态信号)及可选的文本查询。系统首先通过观看模块(Perception Module)对视频进行细粒度、全面且高效的时空感知编码,生成感知表示(perceptual representations)。该模块囊括了细粒度区域与动作感知、视觉-音频跨模态对齐、以及针对长视频的计算资源高效感知策略。

记忆模块(Memory Module)负责维持和更新记忆状态(memory states),支撑长程依赖的保留与流式场景下的上下文演化。记忆可分为离线记忆(对完整视频构建全局上下文)和流式记忆(对实时视频流持续更新),确保模型能够“记住”历史信息,避免信息遗忘。

推理模块(Reasoning Module)以感知表示和记忆状态为输入,结合语言模型进行多步推理,生成推理轨迹(reasoning traces),并最终输出预测结果(如视频问答答案、描述文本、动作定位等)。推理可仅基于文本(利用事先提取的视频表征)或直接“思考视频”(在视觉特征空间进行搜索与比对),实现证言-记忆相融合的可靠推断。

差异点:相较于将视频理解割裂为独立任务(如视频分类、问答、描述)的常规方法,该统一视角以感知-记忆-推理三阶段解构系统,强调了记忆的动态性与推理的证言性,使长视频、流视频、多模态对齐等挑战能在同一框架内被系统研究,为设计更通用、可扩展的视频智能提供了结构化蓝图。

实验

研究框架设计

本文提出 Watch–Remember–Reason 三层功能视角,统一分析 MLLM 视频理解系统。

  • Watching 覆盖细粒度感知、音视频对齐、高效帧采样与压缩,代表模块如 SlowFast、VideoSwin、Token Merging。
  • Remembering 区分离线记忆(长文本上下文、记忆库检索)与流式记忆(在线更新、状态压缩),对应方法如 MemViT、StreamingLLaVA。
  • Reasoning 分为纯文本推理(CoT、规划)和与视频协同思考(时空定位、因果推断),典型结构如 Video-LLaMA、VideoChatGPT 中的问答链。

系统形式化为 感知表征 → 记忆状态 → 推理轨迹 → 最终预测 的序列,明确各阶段信息流动与瓶颈。

关键发现

  1. 长视频稀疏证据与计算预算的矛盾:20 分钟以上视频中有效信号稀疏,固定帧采样丢失关键时空信息,Token 压缩与记忆检索是当前主线。
  2. 流式记忆建模不足:多数方法仍以离线方式处理视频片段,缺乏时间持续性和增量更新能力,难以适应自我中心等实时场景。
  3. 推理的忠实性欠缺:纯文本推理易产生幻觉,与视频 token 联合推理时缺乏可验证的 grounding,评测依赖选择题而非解释性生成。
  4. 数据集覆盖扩展:综述整理 Ego4DYouCook2ActivityNet CaptionsHowTo100M 等跨教学、体育、医疗、叙事视频的训练与评测基准,反映多模态对齐下的能力维度。

与基线范式的对比解读

以往视频理解评测将任务视为孤立分类或问答,忽略 感知–记忆–推理 的耦合。本综述揭示:

  • 单纯提升 Watching 的帧数或分辨率,没有配套的记忆压缩,会在长视频场景触发显存爆炸。
  • 仅优化 Remembering 的上下文长度,而不改善推理的时空对应机制,会导致答案生成但缺乏解释性。
  • 对比 纯文本推理思考视频(Thinking with Videos) 两类推理范式,后者通过保留视觉 token 提高 grounding 精度,但计算成本显著上升,流式场景下尚无可行的 trade-off 方案。

综述最终指出,面向小时级视频、多视频联合推理、可验证的因果推断是下一代 MLLM 视频智能的核心挑战,记忆感知的架构与基准需协同演进。

行业影响

落地场景

视频理解 MLLM 可嵌入内容审核智能监控交互式教育医疗影像分析自动化体育解说 等场景。例如,短视频平台能对 UGC 内容进行细粒度标签提取与合规审查;企业培训系统根据教学视频自动生成分步指南与问答对;手术室记录系统通过第一人称视角理解手术流程,辅助生成结构化报告。

商业价值

  • 降本: 将人工密集的视频标注、摘要生成、片段检索成本降低 60% 以上,尤其适用于长视频(小时级)的知识提取。
  • 增收: 在电商直播中实时分析商品卖点与用户互动,自动生成高转化切片,提升流量变现效率。
  • 体验提升: 流媒体平台提供“跳转到关键情节”“对话级搜索”等能力,增强用户粘性;教育产品提供智能学习助手,基于视频内容即时答疑。

与现有工作流接口

模型以 离线推理服务流式 API 形式集成,输入视频流/文件,输出结构化事件流或自然语言结果。可对接:

  • 视频管理平台(如 Kaltura, Brightcove)通过 Webhook 触发后处理管道
  • 消息队列(Kafka)连接实时流与下游告警/存储系统
  • LLM 编排框架(LangChain 等)作为视频工具节点,结合外部知识库做多跳推理

具体落地 Use Case

  1. 电商直播分析: 对多机位直播视频做稀疏证据聚合,自动识别产品展示片段与优惠话术,生成可投放的短广告,提升广告素材生产效率。
  2. 医疗手术教学: 利用第一人称视频理解处理手术录像,自动标注关键步骤、器械使用及异常事件,辅助住院医师培训与术后复盘,减少资深医生复盘时间。

局限

  • 本文作为综述与视角论文,未提供任何实证实验或模型性能对比,其“观察-记忆-推理”功能框架的实用性仅停留在概念层面。文中虽列举了大量代表性方法,但缺乏统一实验基准下的定量分析,无法验证该分解方式是否真正有助于指导模型设计或能力评估。对于工程实践者而言,这种高层抽象可能难以直接转化为可操作的优化策略,其分类边界的模糊性也可能导致在具体落地时产生歧义。
  • 论文对视频 MLLM 系统的 formulation 与功能划分基于作者的主观视角,虽引用了大量文献,但系统性的文献筛选和覆盖度说明不足,存在遗漏近期重要工作的风险。特别是在快速发展的流式理解和高效推理子领域,该综述可能无法完整捕捉最新的技术动态。此外,作为一篇综述,它未提出任何新的算法或架构,仅对现有方法进行了重新归类,其学术贡献更多在于知识整合而非创新突破,这限制了它对领域前沿推动的直接影响力。
  • 尽管论文指出了视频理解中的关键挑战(如时空感知、长时记忆、可信推理),但对这些挑战的工程解决方案讨论不足,尤其缺乏对实际部署中计算开销、延迟、内存占用等约束的深入分析。例如,“高效观看”部分虽提及效率问题,但未对比各方法在真实硬件上的吞吐量或延迟指标,也未给出面向生产的建议。对于需要将 MLLM 视频理解技术落地到产品中的技术决策者来说,这种缺乏工程量化指导的视角可能不够充分。
论文Jiahao Meng2026-06-05原文

相关内容