论文

M^3Eval: 通过认知导向视频任务的多模态记忆评估

M^3Eval: 通过认知导向视频任务的多模态记忆评估

随着多模态模型向长视频理解发展,记忆成为关键能力。现有视频数据集和基准主要关注感知与推理,缺乏对记忆的系统评估:模型记住了什么、信息保存的保真度如何、在干扰下记忆的鲁棒性怎样。 为填补这一空白,我们提出 M^3Eval,首个全面评估多模态模型不同记忆维度的框架与基准。基于认知心理学,我们设计了精心构造的任务来隔离记忆的关键方面。利用 M^3Eval,我们在代表性多模态模型上进行了大量实验,揭示了一致的弱点和独特行为。 实验发现: 1. 模型在处理并行视频流时难以保持解耦表示; 2. 其干扰模式与人类记忆存在显著差异; 3. 在空间域的记忆溯源比时间域更可靠; 4. 符号记忆能力有限。 综上,本基准为未来研究提供了宝贵资源,同时结果表明记忆是多模态模型中被低估的基本能力,为设计更有效的记忆机制提供了见解。代码与数据集见 https://pku-value-lab.github.io/m3eval-homepage。

论文精读

TL;DR M^3Eval 首次基于认知心理学系统评估多模态模型的记忆能力,通过四个视频任务揭示模型在解缠表征、干扰模式上的显著缺陷,指明记忆机制设计的关键方向。

问题

问题背景

多模态模型正从短片段理解走向长视频理解,记忆能力成为制约模型性能的关键维度。业内大量视频基准侧重感知与推理,却缺乏对记忆机制的系统评估。

现有方法的局限

  • 评估缺口:现有数据集如 ActivityNet、Something-Something 仅考察单事件分类或动作识别,不衡量模型对跨时间信息的保持、干扰条件下的保真度。
  • 表征解纠缠失败:模型处理并行的视频流时,不同子事件的表征相互纠缠,导致记忆提取时混淆。
  • 干扰行为非人类化:记忆干扰模式与人类认知心理学中的典型模式(如首因/近因效应)显著偏离,显示记忆更新机制不健全。
  • 时空记忆偏斜:模型在空间维度定位记忆源比在时间维度更可靠,而长视频理解天然要求精确的时间顺序组织。
  • 符号记忆薄弱:在 N-Back 等符号接地任务中,模型容量与人类存在数量级差距。

为什么此问题重要且困难

记忆是多维认知构念,涉及编码、保持、对抗干扰、源归因等多个子成分。要隔离这些维度,需要精心构造可控制干扰、并行事件、时间交错等的视频任务,且评估指标需同时覆盖容量、保真度和鲁棒性。业界对视频问答、摘要、交互叙事等长程应用需求迫切,若无法可靠评估记忆,模型设计只能陷入盲目调参,无法针对性地引入记忆增强机制。

行业类比

就像自动驾驶系统需要持续记住几秒前被遮挡的行人轨迹,任何记忆失真都可能导致危险决策,长视频理解系统若无稳健记忆模块,其推理输出同样面临信任危机。

核心洞察

  • - 多模态模型在处理并行视频流时无法维持解耦表征,导致记忆干扰远高于人类。现有视频理解基准多聚焦于单流感知与推理,未系统考察并行信息编码时的记忆解耦能力,M^3Eval 通过认知心理学任务首次揭示这一缺陷,表明模型缺乏类似人类的工作记忆缓冲区来隔离并发事件。
  • - 模型在记忆定位中表现出时空不对称性,更依赖空间线索而非时间线索来追溯记忆来源。这不同于人类依赖时间结构组织记忆的习惯,暴露出当前架构在时间上下文建模上的不足,为设计时间敏感的 memory 机制提供了直接证据。

方法

M³Eval 的方法设计以认知心理学为理论根基,系统性地构建了四类视频任务,用于探测多模态模型在记忆编码、存储与提取中的差异维度。

输入与整体流程

输入为精心构造的视频片段(分为单流、平行双流等形式),每个视频对应一组基于记忆维度的问答对。流程遵循“任务定义 → 数据生成 → 模型推理 → 指标评估”的闭环。

关键模块:四维度记忆任务

  1. Divided Attention(注意分心)
    并排放置两个视频流,要求模型同时关注并回答不同流中的事件。测试模型能否在编码阶段维持解耦表示,避免信息混淆。

  2. Memory Interference(记忆干扰)
    通过在目标事件前后插入干扰片段,考察记忆对 retroactive/proactive 干扰的鲁棒性。干扰类型与强度根据认知实验设计,以揭示模型与人类遗忘模式的差异。

  3. Interleaved Events(交错事件)
    将两个事件的时间线交错剪辑,要求模型按时间顺序重组信息。重点评估模型在时间域上的源记忆,对比其在空间域上的表现。

  4. N-Back(符号接地与容量)
    连续呈现符号序列,模型需判断当前符号是否与 N 步前相同。直接衡量工作记忆容量和符号接地能力,扩展了经典 N-Back 范式至视频模态。

数据集构建

  • 视频生成:基于程序化合成或真实素材,严格控制变量以隔离记忆因素。
  • QA 构建:先对视频进行分割与层次化描述提取,再利用基于模板的 prompt 生成问题,经人工审核修正以保证质量。N-Back 问答则根据序列自动生成。
  • 评估指标:采用准确率、干扰效应差异等指标,从多个维度量化记忆性能。

与同类方法的差异点

现有视频理解基准(如 ActivityNet、Something-Something)几乎仅聚焦感知与推理,而 M³Eval 是首个系统性从记忆的心理学维度出发、覆盖多种记忆类型的评估框架,填补了多模态记忆测评的空白。

实验

实验设计

M³Eval 基准以认知心理学为指导,构建了四类任务以系统性探测多模态模型的记忆能力:

  1. 分心注意 (Divided Attention):同时呈现两个视频流,要求模型编码并发信息。
  2. 记忆干扰 (Memory Interference):在目标视频后插入干扰片段,测试模型保持信息的能力。
  3. 交错事件 (Interleaved Events):多个事件在时间线上交织,评估模型的时间组织与来源归因。
  4. N-Back:要求模型记住符号序列并回溯,衡量符号记忆容量。

评测覆盖多种代表性多模态模型,包括视频理解与通用多模态模型。


关键发现

  • 解纠缠失败:处理并行视频流时,模型难以分离不同来源的表示,经常混淆信息。
  • 非人干扰模式:模型受干扰的影响模式与人类记忆经典效应(如首因/近因效应)差异显著,表现出对近期干扰的过度敏感。
  • 时空不对称:对记忆来源的归因在空间维度(哪个视频)上明显优于时间维度(何时出现),暗示模型缺乏内在的时间组织能力。
  • 符号记忆薄弱:在 N-Back 任务中,随着步长增加,性能急剧下降,表明符号工作记忆容量远低于预期。

对比解读

不同于传统基准的关注点(感知与推理),M³Eval 首次将记忆从其他能力中解耦评估。结果揭露了当前模型在记忆层面与人类认知的显著差距,尤其记忆干扰模式并非简单的容量问题,而是架构性缺陷:模型未形成鲁棒的情境绑定与时间索引。这为未来研究指明了方向:需要设计能够建立解纠缠事件表示弹性时间记忆机制的模型,而非仅依赖长上下文窗口。工作也为后续脑启发记忆模块的开发提供了测试床。

行业影响

落地场景

M^3Eval 直接服务于需要长视频理解的 AI 产品,如视频监控分析系统自动驾驶数据管道多模态内容审核平台教育互动视频医疗影像诊断。在这些场景中,模型需要记住并关联跨时间片段的信息,区分多条并行事件流,抵抗无关干扰,并准确进行符号接地,M^3Eval 提供的记忆维度评估可帮助选择或改进模型。

商业价值

该基准能降低因记忆失效导致的错误决策成本,例如防止监控系统遗漏跨相机的同一目标、减少自动驾驶对历史轨迹关联的错误。对于提供多模态 API 的厂商,通过在 M^3Eval 上的专项提升,可增强产品竞争力与用户信任,进而带动 API 调用量增长。对于内容平台,更可靠的记忆机制能改善长视频摘要、问答等功能的用户体验,直接提高用户留存与订阅转化。

与现有产品/工作流的接口

M^3Eval 可集成到模型开发的 CI/CD 流水线中,作为多模态记忆能力的回归测试套件。平台可采用统一的数据格式(视频片段 + 问答对),与现有视频理解评估工具如 Video-MMEEgoSchema 互补,专注测量记忆健壮性。工程团队可将其嵌入 MLOps 工具链,利用提供的代码库 GitHub 自动评估每次模型迭代,监控 interference patterndisentangled representation 等关键指标,指导记忆增强模块的设计,如记忆压缩、选择性注意力机制的调优。

具体落地用例

  1. 智能视频分析服务:SaaS 厂商提供长视频事件检测 API,使用 M^3Eval 评估模型在并行视频流下维持物体身份表示的能力,指导工程师改进 temporal grounding 模块,最终提升跨时段目标跟踪准确率,减少误报带来的运维开销。
  2. 自动驾驶长尾场景挖掘:自动驾驶公司在处理数小时的路采数据时,用 M^3Eval 的 N-Back 任务考核模型的符号记忆容量,确保模型能稳定记录临时交通标志与动态目标,降低因记忆衰减导致的规划失误,从而加速安全开发周期。

局限

  • - **合成视频生态效度受限**:M³Eval 为精确控制变量,大量采用程序化生成或拼接合成视频(如并置双流、交错事件线索),这虽保证了任务纯度与可复现性,却可能偏离真实长视频的自然分布。真实场景中记忆线索常伴随复杂噪声、遮挡、多模态异步及长程时序依赖,而合成范式下的评估结果未必能线性外推至开放域视频理解系统;未来需要结合更丰富的自然视频素材,以检验记忆评估的生态效度。
  • - **离线批处理范式与在线记忆需求脱节**:当前评测假设模型一次性获取完整视频后再回答,属于离线批处理设定,未模拟实际系统中常面临的流式输入、增量编码与持续记忆更新场景。多模态智能体或视频对话系统往往需要在时间轴上按序接收帧,并在有限缓冲区下动态维护记忆,离线评测难以揭示模型在长期交互中的遗忘曲线、记忆刷新策略及计算开销权衡,可能高估或误估真实记忆能力。
  • - **行为评测缺乏内部机制的机制性归因**:M³Eval 提供了丰富的记忆任务与性能指标,但停留在行为层面的正确率、干扰效应等统计,缺乏对模型内部表征(如注意力图、隐藏状态迁移、神经元激活模式)的探查。这导致当模型在某一记忆维度表现不佳时,难以定位是编码阶段的表征坍塌、存储阶段的容量瓶颈还是检索阶段的混淆,削弱了直接指导架构改进或训练目标调整的可操作性,后续可结合可解释性工具深入诊断。
论文Jie Huang2026-06-03原文

相关内容