论文

Light-Omni: 以反思取代推理——具备长期记忆的智能体视频理解

Light-Omni: 以反思取代推理——具备长期记忆的智能体视频理解

智能体视频理解通过赋予模型长期记忆,使其能够自主处理并响应连续、长期的多模态流。然而,高级视频智能体往往依赖“侦探式”的迭代推理来进行动作控制(如搜索)和证据聚合,导致高昂的成本和延迟。我们认为,这种繁重的推理主要补偿了全局上下文的缺失和检索中的语义错位。 本文介绍 Light-Omni,一个用于反思式、轻量级视频理解的多模态智能体框架。它通过双上下文状态在单次前向传播中即时构建所需上下文。首先,维护一个全局状态,即从情景记忆中持续整合的有限大小多模态脚本,作为 Light-Omni 的全局上下文。通过层次合并,它保留最近细节的同时总结过去事件。其次,基于该全局上下文,生成一个参数化潜在状态,直接驱动自主动作并产生检索嵌入,延迟极低。得益于这种耦合设计,Light-Omni 实现了语义对齐的检索和反思式响应,避免了迭代推理。 大量实验验证了 Light-Omni 在多个视频基准上的有效性。值得注意的是,它优于 M3-Agent,平均准确率提升 2.4%,速度提升 12.1 倍,GPU 内存效率提升 2.6 倍。此外,它作为记忆系统,可增强现有 MLLM 的性能和效率。项目页面:https://clare-nie.github.io/Light-Omni。

论文精读

TL;DR Light-Omni 以双状态(全局记忆与潜在向量)实现“直觉式”视频代理,单次前向完成检索与决策,避免迭代推理,速度提升 12 倍且精度更高。

问题

当前,多模态视频理解领域正从被动感知转向 智能体式工作 (agentic video understanding),要求模型具备长期记忆,自主处理连续的多模态流并做出响应。

现有方法的局限

现有强视频代理(如 M3-Agent 采用“侦探式”迭代推理:通过多轮前向传播执行动作(如 search)和证据聚合,每次决策都带来显著延迟与计算开销。作者指出,这种重推理的根本原因在于检索过程缺乏 全局上下文语义对齐 不良,迫使模型反复试探以弥补信息缺失。这类似于在长视频中“大海捞针”,查询与片段嵌入不匹配,使得代理不得不多次搜索和比对。

为何困难且重要

在实时视频监控、自动驾驶、长期人机交互等场景中,毫秒级响应与长期记忆维护是关键需求,但二者存在深层矛盾:

  • 记忆与效率的平衡:长期多模态记忆的存储、压缩和即时访问难以兼得,迭代推理的串行流程更导致时延随视频长度线性甚至超线性增长。
  • 语义鸿沟:单纯依赖查询-片段匹配易遗漏全局事件演化线索,导致代理难以“反射式”反应。 因此,设计一种能通过单次前向就获取完备上下文并直接驱动动作的框架,对推动视频代理的实用化与边缘部署至关重要。

行业类比

该问题类似于对话系统中的检索增强生成(RAG)——不精确的检索常触发多轮澄清,而 Light-Omni 通过将记忆整合与动作生成统一为反射式过程,模拟了人脑对熟悉场景的即时反应,避免每一步深思熟虑。

核心洞察

  • Light-Omni 用“反射”替代“推理”,通过维护全局记忆和生成条件化潜在状态,一次前向传播即完成上下文构建与行动决策。传统视频代理依赖多步迭代搜索和证据聚合来弥补全局上下文缺失,而 Light-Omni 的层次化合并全局状态补足了长期记忆,潜在状态确保了检索语义对齐,从而避免了迭代推理的延迟与成本。这使得它在准确率提升 2.4% 的同时,速度提高 12.1 倍,GPU 内存效率提高 2.6 倍。
  • Light-Omni 的双状态设计不仅自身高效,还可作为即插即用的记忆系统增强现有 MLLM,无需修改模型结构即可赋予其长期记忆能力。相比需定制推理流程或重新训练智能体的方案,这种轻量外挂方式显著降低了部署门槛,为视频理解任务提供了一条低成本、高兼容性的性能提升路径。

方法

输入与整体流程

Light-Omni 接收连续、长时间的视频流作为输入,旨在以轻量级方式完成自主视频理解与交互。区别于传统“侦探式”迭代推理,它在单一前向传播中直接生成所需上下文与动作,避免重复搜索与证据聚合。

关键模块:双上下文状态设计

  • 全局状态(Global State):一个固定大小的多模态脚本,通过分层合并(hierarchical merging)从外部 episodic memory 中持续整合历史视觉与文本特征。它保留近期细节,同时将旧事件总结为紧凑摘要,充当系统的长期全局上下文。
  • 参数化潜在状态(Parametric Latent State):以全局状态为条件,通过模型生成一个 compact 表示。该状态直接驱动自主行动(如搜索、问答),并产生语义对齐的检索嵌入,用于从记忆中精准获取证据,全程无需迭代。

输出与优化

在一次推理中,Light-Omni 输出动作决策或最终回答,并同步完成证据检索。训练时联合优化全局状态整合与潜在状态生成,确保检索嵌入与全局上下文语义一致。通过消除迭代,推理延迟与 GPU 内存消耗大幅下降:相比 M3-Agent,推理速度提升 12.1 倍,内存效率提升 2.6 倍。

该方法实质将“推理”转化为“反射”:利用预先构建的全局上下文代替动态的逐步推理链,从而在视频理解中实现即时、准确且资源高效的反应。

与同类方法的关键差异

不同于 M3-Agent 等依赖反复观察-推理-行动循环的方案,Light-Omni 通过双上下文状态的耦合设计,在单次前馈计算中完成情境感知、动作生成与证据检索,消除了迭代推理带来的计算开销与语义漂移。同时,其记忆系统可作为插件式模块,直接增强现有 MLLM 的性能与效率。

实验

实验设计

Light-Omni 在多个视频理解基准上进行了评估,重点验证其相对于迭代推理式智能体的效率与精度优势。实验核心是端到端地测试 双状态设计(全局状态与参数化潜在状态)在不需要多轮推理的情况下,直接驱动动作和检索的能力。对比基线包括先进的视频智能体如 M3-Agent,以及结合记忆系统后现有 MLLM 的表现提升。

关键发现

通过构建紧凑的全局状态实现一次性上下文构建,Light-Omni 在保持语义对齐的检索和反射响应同时,显著降低了延迟和计算开销。

  • 精度:平均超越 M3-Agent 2.4%,说明轻量设计并未牺牲性能。
  • 效率:推理速度提升 12.1 倍,GPU 内存效率提高 2.6 倍,对实时或大规模部署极为有利。
  • 扩展性:Light-Omni 可作为记忆系统增强现有 MLLM,证明了框架的通用性。

深度解读

传统视频智能体依赖“侦探式”迭代推理(如反复搜索、证据聚合)来弥补全局上下文缺失和检索语义不对齐,这导致高昂的计算成本。Light-Omni 的革命性在于将上下文构建前置为一次性前向过程:通过层次化合并维护一个有限大小的全局状态脚本,既保留近期细节又总结历史;再基于此生成潜在状态直接输出动作和检索嵌入。这种设计本质上消除了迭代推理的必要,用“条件反射”式的前向计算替代了推理链,从而在速度与精度上实现双赢。值得注意的是,2.4% 的精度增益并非来自更大的模型或更多计算,而是来自更优的上下文表示和语义对齐检索,这对工程落地极具启示:信息组织方式有时比算力堆积更有效

行业影响

落地场景

Light-Omni 的反射式视频理解架构主要面向需要长时程、实时响应的视频分析场景:

  • 视频监控与安防:持续分析多路摄像头流,自动检测异常事件并即时告警,无需人工轮巡。
  • 媒体资产管理:对海量视频库进行语义检索(如“查找所有出现红色车的片段”),支持粗粒度到细粒度的多轮查询。
  • 直播电商:实时理解直播内容,自动生成商品解说、检测违规话术或画面,辅助运营决策。
  • 自动驾驶与机器人:作为记忆系统融合历史帧信息,在低延迟下完成场景理解与决策。

商业价值

  • 降本:相比依赖迭代推理的 agent(如 M3-Agent),Light-Omni 实现 12.1× 推理加速和 2.6× 显存节约,显著降低云 / 边缘推理成本;单次前向即可完成上下文构建与动作生成,使高并发视频流处理在经济上可行。
  • 增收与体验提升:视频平台可借此升级智能剪辑、自动标签、精准广告插入等功能,提高内容分发效率与用户粘性;教育、客服等场景可通过长视频记忆问答提供个性化服务。

与现有产品/工作流的接口

Light-Omni 可作为记忆系统插件直接增强已有 多模态大模型(MLLM) 的长期上下文能力:

  • 输入侧接入视频帧序列,输出结构化记忆与检索嵌入;现有视觉-语言模型通过调用该记忆接口获得长时信息,无需重新训练。
  • 支持标准视频处理 pipeline(如 FFmpeg 抽帧 → Light-Omni 记忆编码 → LLaVA 等 MLLM 推理),易于集成到 LangChain 或多智能体框架中。

具体落地用例

  1. 全球电商平台的直播合规审核:对 7×24 小时的商家直播流进行实时理解,Light-Omni 维持紧凑的全局记忆,快速检测违禁商品或不当言论并生成报告,替代人工抽检,漏检率降低且处理速度满足实时要求。
  2. 视频会议知识管理:企业会议录像经 Light-Omni 记忆编码后,可快速回答“上个月讨论的预算调整依据是什么”等跨长视频的查询,无需逐帧回看,大幅提升知识复用效率。

局限

  • **反射式响应的适用边界**:Light-Omni 通过单次前向传递生成动作和检索嵌入,避免迭代推理,这适合大多数需要快速响应的视频问答和检索任务。但对于需要复杂多步推理的长视频(如「找出嫌疑人何时进入大楼,并在后续与另一事件关联」),一次性全局上下文的聚合可能不足以捕获隐含的因果链。论文未充分探讨在此类需要 **detective-style reasoning** 的任务上,与迭代推理方法的准确率差距,这限制了其在深度理解场景中的可信度。
  • **全局状态的容量约束与信息丢失**:框架维护一个固定大小的全局状态,通过分层合并新事件并总结旧事件来管理内存。尽管保留了近期细节,但对远期信息的压缩本质上是有损的,当任务突然需要回溯已被总结的旧细节时(如早期出现的物体在后期成为关键),检索或生成可能失效。论文缺乏对信息遗忘与任务性能关系的定量分析,实际部署中可能需要根据视频长度动态调整合并策略。
  • **基准泛化与集成成本**:实验主要基于现有视频理解数据集(如 Ego4D、ActivityNet),这些基准与真实世界长时视频流(如连续监控、直播分析)存在分布差异,Light-Omni 的实时性优势能否在噪声更大、语义更碎片化的场景中保持,尚待验证。此外,将其作为记忆系统插入现有 MLLM 需要适配特定接口(如 prompt 工程和 embedding 对齐),不可避免地带来工程开销,且论文未报告在不同模型上的即插即用成功率。
论文Chang Nie2026-07-06原文

相关内容