论文

OneStreamer:统一流式视频交互中的感知、记忆与主动响应

OneStreamer:统一流式视频交互中的感知、记忆与主动响应

流式视频 LLM 必须在尚不知晓证据与未来任务是否相关时就将其保留下来,并在证据充分时及时响应。核心挑战在于:如何在不损害实时感知的前提下形成可复用的 factual memory。 我们提出 OneStreamer,它通过一个共享的主动生成过程,联合学习与查询无关的证据记录和任务响应。其 Proactive Hierarchical Caption Memory(PHCM) 生成带时间定位的局部细节描述以及已完成事件的摘要;训练时用流式描述目标监督对已观测视频前缀的解读。推理阶段,模型自生成的记录与近期视觉窗口互补,无需回访历史视觉特征即可提供可复用的事实上下文。Proactive State Transition Learning(PSTL) 则在所有输出锚点保留监督,并挑选具代表性的状态变化与状态保持 token,从而削弱重复等待状态的主导地位。我们还构建了流式数据合成管线,让输出内容与时序与可用证据对齐。 将上述流式描述与 QA 同清洗后的开源数据结合,得到 OneStreamer-1M——一个覆盖广泛、包含超过一百万条记录、横跨多种任务的流式视频交互数据集。 实验上,我们的 4B 模型在全部八个流式视频理解基准上均取得对比方法中的最佳结果。消融显示:保留生成的描述可在不降低实时感知的情况下提升历史 QA;PSTL 仅监督 27.5% 的标注状态 token,却优于稠密状态监督。总体而言,这些结果支持把主动生成作为连接感知、记忆形成与及时响应的共享学习接口。

论文精读

TL;DR OneStreamer 在流式视频中,通过层级字幕记忆和状态转换学习,联合优化证据记录与任务响应,无需回看历史特征即可回答历史查询,在多个基准上取得最佳。

问题

问题背景

流式视频 LLM 领域聚焦于在连续视频流上实时理解与交互,模型需要一边感知当前画面,一边形成可复用的长期记忆。

现有方法局限

当前方法主要面临两个技术短板:

  • 短期窗口限制:仅依赖最近几帧的视觉窗口,历史证据丢失,无法回答关于过去事件的查询。
  • 回看重算代价高:若保留历史视觉特征,推理时需回溯重构上下文,计算量与延迟随视频长度线性增长,破坏实时性。

此外,训练信号设计粗糙:状态标记中“等待”类 token 占比过高,导致模型倾向延迟响应;缺乏时间对齐的监督,生成内容与证据时间戳错位。

为什么这个问题难 / 重要

核心难点在于实时感知与长期记忆的联合优化:模型无法预知未来任务的关联性,必须在线决定哪些信息值得记录;同时响应时机必须依赖于证据充分性,过早响应引入幻觉,过晚则失去实用价值。该问题对视频助手、自动驾驶、远程监控等流式场景具有高工程价值,业界迫切需要一种低延迟、高召回、可扩展的流式记忆方案。

行业类比

类比于流式语音助手:系统需要边听边理解,同时自动记下对话中的关键事实,以便用户随时追问历史细节,而无需重新播放全部音频。

核心洞察

  • 主动生成作为统一感知、记忆与响应的共享学习接口。传统流式视频 LLM 常将记忆形成与任务响应解耦,或依赖外部记忆模块,导致证据保留与实时推理之间的割裂。OneStreamer 通过训练阶段监督模型主动生成时间对齐的局部 caption 和事件摘要,使记忆形成与响应共享同一生成过程。这种设计让记忆内容自然成为生成的一部分,既保证可复用的事实留存,又不干扰对当前视觉前缀的实时感知,为流式交互模型提供了新的联合优化范式。
  • 以生成式 caption 取代历史视觉特征回溯,实现高效且无损的事实记忆。现有方法通常需要缓存或重新编码历史视觉 token 以支持长程问答,带来显著的内存和计算开销。OneStreamer 在推理时仅利用模型自己生成的 hierarchical caption 作为历史上下文,完全避免对历史视觉特征的再次访问。实验表明,保留生成 caption 能提升历史 QA 性能,且不降低实时感知指标,证明“记忆即生成”的策略在流式场景下具有工程优势,为部署轻量化长时视频理解系统提供了可行路径。
  • PSTL 通过选择性状态监督缓解流式训练中的标签不平衡问题。流式视频任务中大量时间步处于“等待”状态,导致模型倾向于输出等待动作,影响主动响应能力。PSTL 保留所有输出锚点的监督,同时挑选代表性的状态变化和状态持续 token 参与损失计算,仅监督 27.5% 的标注 token 即超越密集状态监督。这一发现表明,针对流式时序特性的训练策略设计比单纯增加监督密度更有效,为类似序列预测任务的损失构造提供了新思路。

方法

输入为逐步到达的流式视频帧,经视觉编码器提取帧级特征后,与近期视觉窗口拼接,同时维护Proactive Hierarchical Caption Memory (PHCM) 记忆模块。

关键模块

  • PHCM:在训练阶段,模型被监督生成时间对齐的局部细节字幕和已完成事件摘要。这些生成记录不依赖未来信息,而是对已观测视频前缀的主动解释。推理时,模型生成的记录被存储并补充到近期视觉窗口,提供可复用的事实上下文,无需回溯历史视觉特征。
  • Proactive State Transition Learning (PSTL):针对流式视频中大量重复的"等待"状态,PSTL 保留所有输出锚点的监督信号,并选择代表性状态变化 token 与状态持续 token 进行损失计算,避免被频繁出现的等待状态主导训练,增强模型在证据充足时主动响应的能力。
  • 共享生成过程:证据记录(字幕/摘要)与任务响应(QA/指令)由同一个自回归生成头统一输出,而非分离的感知和问答分支,实现记忆形成与实时响应的联合优化。

输出

模型在每个时间步输出三类 token:局部字幕、事件摘要、或任务响应(等待/回答)。当证据不足时输出持续等待 token;一旦关键证据到达即切换为响应。

与同类方法的差异点:现有流式视频 LLM 通常将感知、记忆和响应作为独立阶段或模块训练,导致记忆构建与任务目标不一致;OneStreamer 通过统一的主动生成接口联合学习证据记录与响应,并用 PSTL 显式解决等待状态抑制问题。

实验

实验设计

OneStreamer 在自建 OneStreamer-1M 数据集上训练,该数据集包含 流式字幕 与 流式 QA,结合清洗后的开源数据,总计超过一百万条记录。模型规模为 4B,采用 PHCM 生成时间对齐的局部细节字幕与已完结事件摘要,并通过 PSTL 减少重复等待状态的干扰。评估覆盖 8 个流式视频理解基准,涵盖感知、记忆与主动响应能力。

关键发现

  • 在全部 8 个基准上,OneStreamer 均取得 最优结果,证明了主动生成作为共享学习接口的有效性。
  • PSTL 仅监督 27.5% 的标注状态 token,性能却优于稠密状态监督,说明选择性监督能提升训练效率。
  • 保留模型生成的字幕可提升历史 QA 表现,同时不降低实时感知,表明可复用记忆不牺牲在线推理能力。
  • PHCM 生成的时间对齐记忆避免了重新访问历史视觉特征,降低了推理延迟。

与基线对比

相较于已有流式视频 LLM,OneStreamer 的核心差异在于主动式记忆形成:模型在训练阶段学习生成查询无关的证据记录,推理时用生成记录补充近期视觉窗口,既保持实时性又提供长期事实上下文。PSTL 通过保留所有输出锚点的监督并挑选状态变化与状态持续的代表 token,有效缓解了重复等待状态对训练信号的稀释。这一设计使模型从被动响应转向主动构建可复用记忆,在同等计算预算下获得更优的流式理解能力。

行业影响

落地场景

OneStreamer 适用于需要长期流式视频理解 + 实时交互的产品,例如:

  • 直播电商:实时生成商品讲解字幕,支持用户随时追问历史内容,无需回看视频
  • 智能安防:对监控流做事件检测与因果追溯,生成时间接地的事件摘要
  • 自动驾驶/机器人:持续构建环境语义记忆,用于驾驶决策或任务规划
  • 企业视频会议:自动产生分段纪要与待办,支持会后问答

商业价值

  • 降本:用生成的字幕记忆替代历史视觉特征重访,显著降低长时流处理的显存与计算开销
  • 增收:可封装为流式视频理解 API,嵌入直播助手、会议纪要、智能客服等增值服务
  • 体验提升:用户获得基于充分证据的即时回答,同时不会丢失历史细节,交互自然度接近人类助手

与现有工作流的集成

  • 模型可部署为流式推理服务,接收 RTSP/WebRTC 等视频流,输出带时间戳的结构化字幕与事件摘要
  • 生成的字幕可写入向量数据库(如 Milvus、Pinecone)或消息队列,作为下游 LLM 应用的知识来源,与 LangChain/LlamaIndex 等 RAG 框架无缝衔接
  • 其流式数据合成 pipeline 可复用:将企业已有视频库转为流式字幕与 QA 对,加速垂直领域模型定制

具体 use case

  1. 内容平台直播审核与互动:主播展示多件商品时,观众提问“刚才第三个商品的价格是多少?”模型基于实时生成的字幕记忆直接回答,提升转化率并降低审核延迟
  2. 视频会议智能助理:对会议录像做流式处理,自动提取关键决策与待办,参会者随时问「谁在十分钟前提出预算调整?」系统从记忆中定位并给出带时间戳的引用,减少人工回看成本

局限

  • 论文未充分讨论在线推理时 PHCM 生成字幕带来的计算延迟与存储增长问题。随着流持续,记忆记录会不断累积,尽管可以摘要,但长期运行可能仍需增大上下文窗口或外部存储,对实时系统的延迟和内存预算构成压力。此外,生成字幕本身会占用额外前向计算,可能影响实时响应速度。这些开销在边缘设备或低延迟场景下尤为关键。
  • OneStreamer-1M 的训练数据主要依赖流式数据合成管道,虽然结合了清洗的开源数据,但合成数据在视觉内容、事件时序和交互模式上可能仍与真实世界流式视频存在分布偏差,导致模型在分布外场景下的泛化能力存疑。论文未对合成数据的真实性进行大规模人工评估,也未在不同合成策略间进行消融,这限制了对其数据质量的全面判读。
  • 方法仅在 4B 参数规模上验证,尽管在八个基准上取得 SOTA,但扩展到更大模型或不同视觉编码器时效果未知。此外,PSTL 仅监督 27.5% 的状态令牌,虽然实验表明优于密集监督,但该比例的选择可能依赖具体任务,在其他类型的状态转换上可能丢失关键信息。未来需验证该策略在不同任务分布和模型规模下的鲁棒性。
论文Xiangyu Zeng2026-10-01原文

相关内容