Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding
流式视频理解要求多模态大语言模型(MLLMs)在严格因果性和有限内存条件下处理连续视觉输入并响应用户查询。现有方法通常将历史观察压缩到外部记忆库中,并检索与查询相关的证据作为额外视觉上下文。虽有效,但这种“存储-检索”范式将历史证据视为外部视觉上下文,阻碍其内化为紧凑且不断演进的潜在记忆,从而无法持续指导流式推理。 为弥合这一差距,我们提出 LatentStream,一种渐进式潜在工作记忆框架,将流式记忆从“存储-检索”转变为“检索-内化”。LatentStream 包含三个协同组件:查询无关的分层流式记忆通过 Jenks 引导的自适应整合,在固定记忆预算下将视觉历史组织为短期、中期和长期层次;分层潜在记忆演化使各组潜在记忆令牌具备逐步扩大的记忆感受野,能够从对应范围迭代检索历史证据并内化为紧凑的固定长度潜在记忆;渐进式置信度引导的潜在记忆优化利用组级预测熵构建分层进步奖励,联合优化潜在记忆令牌与检索证据,促进更高置信度的流式推理。 大量实验表明,LatentStream 在现有在线和离线视频基准上取得了新的最先进结果。
论文精读
TL;DR LatentStream 将流式视频理解从“存储-检索”转为“检索-内化”,通过层级潜在记忆演化,把历史证据压缩为紧凑可演化的记忆 token,在在线与离线基准上取得 SOTA。
问题
问题背景
流式视频理解要求 MLLM 在严格因果性与固定内存预算下连续处理视觉观测并响应用户查询,是实时多模态交互与具身智能的核心能力。
现有方法局限
主流范式 store-and-retrieve 将历史视觉观测压缩进外部记忆库,查询时再检索相关片段作为额外的视觉上下文。该方案存在三重局限:
- 检索成本:每次查询触发相似度计算与 top-k 筛选,延迟随记忆规模增长,难以满足实时性。
- 上下文侵占:检索到的历史证据以原始/压缩视觉 token 形式拼接到输入序列,挤占固定上下文窗口,限制可处理的历史长度。
- 记忆静态化:外部记忆在写入后保持不变,无法在推理过程中根据查询动态演化,导致历史证据只能被动复用,不能内化为可指导后续推理的紧凑潜在表示。
为什么这个问题难且重要
将记忆从外部检索转向内在演化面临多重技术挑战:
- 潜在记忆 token 需在无查询信号时预先组织历史,并能在查询到达后自适应地筛选、融合相关信息,而不会丢失长期依赖。
- 潜在记忆长度必须固定,但历史不断增长,需要设计高效的分层聚合策略以平衡信息密度与代表性。
- 优化目标需同时驱动记忆 token 的信息内化与最终预测置信度提升,避免潜在表示退化为无意义摘要。
业界对此高度关注,因为在线视频问答、实时监控分析、具身智能长期任务规划等场景都要求模型在有限资源下持续积累并利用历史上下文,单纯增加显存或检索规模不可持续。
行业类比
类似自动驾驶中的在线局部地图构建:车辆只能保留有限的历史帧与特征,却必须持续融合新观测、丢弃冗余信息,以固定大小的内部表示支撑下游决策,任何一次查询(如路径规划)都不能重新扫描全部历史。
核心洞察
- 从 store-and-retrieve 到 retrieve-and-internalize 的范式转移,将历史视频证据压缩进可微更新的潜在记忆 token,而非每次查询时拼接外部检索上下文。现有流式视频方法(如 MemoryBank 类)把历史记忆当作外部视觉 token 注入,模型内部状态不随检索结果演化;LatentStream 则让一组固定长度的 latent memory tokens 在查询到来时主动检索自身感受野内的证据并逐步内化,形成持续演进的 working memory,既避免上下文窗口膨胀,又让记忆参与梯度回传,使模型对长程因果关系的建模更稳定。
- Query-agnostic 分层记忆与 Jenks 自适应合并,在固定预算内实现多尺度时间表征。传统环形缓冲区或均匀降采样忽视视觉内容的非平稳性,导致关键事件边界丢失或冗余;LatentStream 采用 Jenks 自然断点法,根据视觉特征分布动态划分 short-/mid-/long-term 层级,同时为不同组 latent memory token 分配逐渐扩大的感受野,分别聚焦近、中、远期证据。这种设计使记忆既有局部细节保留能力,又能通过层级间的渐进检索-内化整合全局上下文,比固定窗口或均匀抽样更贴合真实流式视频的事件结构。
- Progressive Confidence-guided Optimization 以组级预测熵构造层级递进 reward,直接优化中间记忆状态而非仅约束最终答案。现有流式问答的监督信号通常只作用于输出 token,记忆压缩模块缺乏明确的中间反馈;LatentStream 从不同感受野的 latent token 组计算预测熵,鼓励模型在融入更多历史证据后自信度单调提升,并把该信号同时用于更新记忆 token 与检索到的视觉证据。这使得记忆演化路径本身成为可学习对象,缓解了流式推理中常见的过时记忆污染与不确定性累积问题,对需要长期在线服务的系统尤其重要。
方法
输入与整体流程
LatentStream 接收连续视频帧流和用户查询。历史视觉观测先进入 Query-agnostic Hierarchical Streaming Memory,在固定记忆预算下,通过 Jenks-guided adaptive consolidation 将历史组织为 短期、中期、长期 三个层级,形成多尺度记忆库。该过程不依赖查询,持续维护。
关键模块
- Hierarchical Latent Memory Evolution:查询到达时,一组 latent memory token 被分为若干组,每组具有不同的记忆感受野(memory receptive field),对应短期/中期/长期范围。各组 token 从各自的感受野中检索历史证据,并通过注意力机制将证据内部化(internalize)为固定长度的潜在记忆表示,而非保留外部视觉上下文。
- Progressive Confidence-guided Latent Memory Optimization:针对每组的预测结果计算 group-wise predictive entropy,构造从低层到高层的进展奖励(hierarchical progression reward),鼓励模型在更全局的感受野上产生更自信的预测。该优化信号联合更新 latent memory tokens 和检索到的证据,提升推理稳定性。
输出与差异
最终,模型基于内部化后的 latent memory 生成对用户查询的回答,同时保持严格因果性与有界内存。
与常见的 store-and-retrieve 方法(如把检索证据作为额外视觉上下文输入)不同,LatentStream 将历史证据压缩进持续演化的潜在工作记忆,实现 retrieve-and-internalize,无需在每次推理时附加大量外部视觉 token。
实验
实验设计
论文在在线视频基准和离线视频基准上评估 LatentStream,对比现有流式视频理解方法。实验重点考察因果性约束下的连续视觉输入处理能力,以及固定内存预算下的问答性能。具体数据集未在摘要中列出,但可推断为常见的流式视频 QA 与长视频理解基准。
关键发现
- LatentStream 在在线与离线基准上均取得新的 state-of-the-art 结果,表明从 store-and-retrieve 到 retrieve-and-internalize 的范式转换有效。
- 三个协调组件——Query-agnostic Hierarchical Streaming Memory、Hierarchical Latent Memory Evolution 与 Progressive Confidence-guided Latent Memory Optimization——联合作用,使模型能够将历史证据内部化为紧凑的演化潜在记忆,提升流式推理的置信度。
与基线对比解读
现有方法通常将历史观察压缩到外部记忆库,并检索查询相关证据作为额外视觉上下文。这种外部存储方式未能将证据真正内化为持续演化的潜在记忆。LatentStream 通过潜在记忆 token 的层级演化,逐步扩大记忆感受野,并在优化中引入预测熵的层级递进奖励,使得记忆更加紧凑且推理更自信。相对基线,该方法在相同内存预算下可更高效地利用历史信息,尤其适合长时间流式场景。
行业影响
落地场景
适合需要持续视觉流理解 的产品场景,例如:
- 直播电商:实时视频流中,用户对主播讲解内容进行问答(“刚才提到的这款商品折扣是多少?”),要求模型在有限显存内持续累积上下文。
- 智能安防 / 自动驾驶:对长时视频流或车载摄像头流进行事件回溯查询,如“之前经过的路口是否有行人?”,需要紧凑、可演化的历史记忆。
商业价值
主要落在降本 与体验提升 两条线:
- 降本:将外部 memory bank 的检索证据内部化为固定长度 latent tokens,减少存储与检索开销,降低长视频流推理的 token 消耗和 API 成本。
- 体验提升:通过分层记忆与置信度优化,提升连续推理的准确性和稳定性,减少重复提问和错误回答,直接改善直播互动、客服机器人等场景的转化率与满意度。
与现有产品 / 工作流接口
可作为即插即用记忆模块 集成进现有 MLLM 推理栈:
- 替代现有 streaming pipeline 中的外部 memory bank,以 adapter 形式与 vLLM、Hugging Face transformers 等框架对接。
- 提供 streaming 输入接口,接收连续视频帧,输出 latent memory tokens,后续接 LLM 解码,无需改动原有生成逻辑。
- 开源实现见 LatentStream,便于快速验证与移植到已有视频分析服务。
局限
- **计算效率指标缺失**:流式视频理解对延迟与内存有严格约束,但 LatentStream 引入的 **Jenks-guided 自适应合并**、层次化潜在记忆进化与置信度引导优化均涉及额外的前向/反向计算。论文未报告推理延迟、峰值内存占用或在线吞吐量等关键效率指标,使得实际部署可行性存疑。尤其在长时流场景下,层次化记忆维护与查询触发的内部化过程可能累积显著开销,与实时性要求形成冲突。
- **潜在记忆可解释性弱**:相比外部检索式记忆(可显式展示相关视频片段),LatentStream 将历史证据**内部化**为固定长度的潜在 token,其语义含义与权重分配难以直接解释。当模型产生错误回答时,追溯具体哪些历史帧或事件被利用、其贡献度如何变得困难,不利于调试与信任构建。后续工作可考虑引入注意力可视化或记忆读取机制来增强透明度。
- **评估场景覆盖有限**:虽然论文在现有在线/离线视频基准上取得 SOTA,但这些基准的视频长度、查询频率与类型可能无法全面反映真实流式环境的多样性(如数小时监控、突发密集查询、长期依赖)。此外,与近年基于压缩或选择的在线方法(如 **MovieChat**、**Flash-VStream**)的对比可能不够直接或充分,缺乏统一的效率-精度权衡分析,限制了结论的普适性。