EM^2Mem: 面向大语言模型的事件中心多模态记忆
多模态记忆为长视频问答提供了可扩展的接口,但现有方法往往将字幕、帧、转录、摘要或图事实检索为孤立片段。尽管可搜索,这类片段并非即取即用:语言模型必须在推理时凭借有限的上下文重构跨模态与时间对齐,且难以溯源。 我们提出 EM^2Mem,一种事件中心的多模态记忆框架,在记忆构建阶段将异质证据绑定到事件锚点。每个事件索引的记忆单元对齐多模态记录、时间上下文、图关联关系、语义事实与来源出处,从而基于接地的事件而非模态特化片段进行紧凑的证据读出。在三个长视频问答基准上,EM^2Mem 相比最强记忆基线平均准确率分别提升 2.0、2.4、3.7 个百分点,严格事件级 Top-5 证据召回提升 7.0 个百分点,并将每查询延迟降低 4.67 倍、总推理 token 减少 63.66%(代码将集成至 https://github.com/zjunlp/LightMem)。
论文精读
TL;DR EM²Mem 以事件为中心绑定多模态证据,生成紧凑、可归因的记忆单元,在长视频 QA 上平均准确率提升 2.0–3.7 点,证据召回率提升 7 点,延迟降至 1/4.67,推理 token 减少 63.66%。
问题
问题背景
多模态记忆已成为长视频问答的可扩展接口,当前研究聚焦于如何高效存储与检索异构证据,以支撑大语言模型(LLM)推理。
现有方法局限
现有方法通常将视频证据抽取为独立模态片段,如 captions、frames、transcripts、summaries 或 graph facts。这些片段虽然可被检索,但彼此割裂,缺乏跨模态对齐与时间对齐,并非 generation-ready 形态。LLM 在推理时需消耗有限上下文窗口来重建对齐关系,导致:
- 证据归因困难,难以追溯答案的证据来源;
- 检索-对齐成为瓶颈,增加推理延迟与 token 开销。
为什么这个问题难且重要
长视频包含大量冗余帧与多源异构信息(视觉、音频、文本、场景图),事件边界模糊,对齐任务本身计算复杂度高。业界对长视频 QA 的可验证推理和低延迟响应需求日益增长,但“先检索碎片、再对齐”的范式难以同时满足准确率与效率。因此,在记忆构建阶段就将异构证据绑定到统一事件锚点,成为一种关键设计取向,直接影响记忆单元的紧凑性与问答系统的可扩展性。
行业类比
与 RAG 系统中构建阶段即完成元数据绑定、在线仅需少量证据拼接类似,事件中心记忆能显著降低在线推理的对齐成本。
核心洞察
- 事件绑定的构建时对齐策略把跨模态与时间对齐前移到记忆构建阶段,生成紧凑且可直接供 LLM 阅读的事件单元;现有 RAG 类方法在检索阶段返回孤立片段,推理时需重建跨模态与时间对齐,消耗大量 token 并引入延迟。EM^2Mem 在三个长视频 QA 基准上将平均准确率提升 2.0-3.7 分,同时减少 63.66% 推理 token、加速 4.67 倍,证明构建时统一对齐比检索后对齐更高效。
- 事件锚点作为统一索引,将视频帧、文本转录、图关系和来源信息绑定为“事件级”证据单元,实现单次定位即召回全部模态证据;相比逐模态检索后拼接,这种方法避免遗漏跨模态关联,证据召回更完整且可归因,严格事件级 Top-5 证据召回提升 7.0 分,为长视频记忆提供了可扩展的单一入口。
- 结构化事件字段(如 temporal context views、graph-linked relations、provenance)在记忆单元内部充当查询与证据之间的语义桥,使自然语言问题能直接匹配事件属性,而非仅依赖向量相似度检索;这一设计缓解了异构证据与自然语言问题之间的语义鸿沟,提升了 QA 准确率,并为长视频记忆的“可解释、可追溯”提供了新范式。
方法
输入与总体流程
长视频按时间轴切分为离散事件,每个事件作为记忆索引的基本单元;查询时,问题经检索模块定位相关事件并输出紧凑证据。记忆构建在离线阶段完成,降低在线推理负担。
关键模块
- 事件锚点识别:从长视频中检测或聚类关键事件,生成事件锚点(event anchor),作为记忆单元索引。
- 多模态事件记录绑定:将每个事件关联的多模态证据(帧、关键帧、转录文本、字幕)对齐,存储为结构化
EventRecord,包含时间上下文、图关系、语义事实和来源追踪(provenance)。 - 事件链接记忆图:构建事件间的关系图(时序/因果/语义),使检索能沿图传播,增强跨事件关联。
- 检索与排序:查询时,选择器从记忆库中检索 Top-K 事件,结合多模态证据排序,输出生成就绪的 evidence readout。
输出
LLM 直接消费事件级证据,而非孤立片段,从而减少推理 tokens 和延迟。
差异点:与检索后重对齐(retrieve-then-align)的片段式记忆不同,EM²Mem 在构建阶段完成跨模态对齐和事件绑定,将检索粒度从模态片段提升到语义完整的事件单元。
实验
实验设计
- 在三个长视频 QA 基准 EgoLifeQA、Ego-R1 Bench、Video-MME 上评测 EM²Mem。
- 对比最强记忆基线(如 WorldMM 等),重点评估准确率、证据召回、推理延迟与 token 开销。
- 消融覆盖事件绑定、结构化字段、构建时对齐、关键帧验证等模块。
关键发现
- EM²Mem 在三个数据集上平均准确率分别提升 2.0 / 2.4 / 3.7 个百分点(vs 最强记忆基线),证明事件锚定有效。
- 严格事件级 Top-5 证据召回提升 7.0 个百分点,检索证据更完整且对齐。
- 推理效率显著改善:单查询延迟降低 4.67 倍,总推理 token 减少 63.66%。
与基线对比解读
- 传统记忆方法检索孤立片段(字幕 / 帧 / 转录 / 图事实),LM 需在推理时重建跨模态对齐,上下文受限且归因困难。
- EM²Mem 在构建阶段将异构证据绑定到事件锚点,形成即用型记忆单元,消除检索后对齐瓶颈。
- 紧凑证据读出避免冗余拼接,延迟和 token 大幅降低,适合生产环境长视频问答服务。
行业影响
落地场景
EM²Mem:事件中心记忆框架适用于长视频驱动的业务,如视频客服、内容审核、在线教育、监控告警、自动驾驶日志分析。相比检索孤立片段(caption/frame/transcript),事件绑定将多模态证据组织为可回答单元,显著降低推理时对齐负担。例如,电商直播回放中定位商品讲解事件,或企业培训视频中检索关键操作步骤,均可直接调用事件索引回答用户问题。
商业价值
直接收益来自降本:论文报告每查询延迟降低 4.67 倍,推理 token 减少 63.66%,对视频问答 API 类产品可大幅降低算力成本。同时准确率提升(+2.0~3.7 点)和证据召回增强减少人工复核,提升自动化率与用户体验。在安全监控、远程协作等实时性敏感场景,延迟降低直接改善服务质量。
跟现有产品/工作流的接口
可作为记忆层,集成到现有 RAG 或 MLLM 管道:离线阶段构建事件索引,在线阶段提供 retrieve_events(query) 返回事件 anchor 及对齐证据,替代或增强现有片段检索。与 LangChain / LlamaIndex 等框架集成时,可设计为自定义 retriever,无需重写推理服务,方便渐进式迁移。
局限
- - **事件锚点的粒度与边界敏感性未自动适应**。方法依赖事件检测器划分视频为事件单元,但事件边界在不同视频类型中差异极大(如第一人称日常视频 vs. 纪录片),固定粒度或阈值可能导致事件过碎或过粗。论文在附录 C.7 分析了锚点粒度与边界敏感性,但未提出自适应机制,跨域部署时需要额外调参,削弱开箱即用性。
- - **离线记忆构建成本与误差传播未被充分解决**。构建阶段需要多模态模型提取事件记录、时间上下文、图关系和语义事实,计算开销高(论文 C.1 给出离线成本分析)。虽然推理时摊销后总成本降低,但初始构建仍可能成为低资源或实时场景的瓶颈。此外,事件检测、事实抽取或图构建中的错误会固化到记忆单元中,且缺乏追溯修正机制,错误可能在下游 QA 中被放大。
- - **评测基准覆盖面有限,泛化性存疑**。实验仅在 EgoLifeQA、Ego-R1 Bench 和 Video-MME 三个长视频 QA 基准上验证,视频类型偏向自我中心或剪辑场景,未包含更广泛的开放域长视频(如监控、体育、新闻纪录片)或跨模态更复杂的任务。与 WorldMM 等基线对比虽占优,但事件中心绑定对视频分布变化、噪声、低帧率等情况的鲁棒性未经验证。