论文

APM-Bench:面向第一视角流式视频助手的跨会话持久记忆基准测试

APM-Bench:面向第一视角流式视频助手的跨会话持久记忆基准测试

真实世界的个人助手需要持久记忆 来留存过往经历以备后续调用,但现有的流式视频基准与方法多聚焦于单段连续视频或短视频片段,忽视了真实交互往往具有间歇性、并要求记忆能够跨中断持续存在。 为填补这一空白,我们提出 APM-Bench,它将真实流式交互重新表述为多会话生活轨迹:包含 549 个 session、104 条 trajectory 与 2,719 个 candidate,覆盖客观题与开放式问题。每个 session 是带细粒度标注的视频,同一条 trajectory 内的 session 围绕相关活动展开。模型需借助持久记忆回答关于过往 session 的问题,并在保持实时交互的同时给出主动响应。 这带来多重挑战:持久记忆必须可存储、能选择性保留信息、在恰当时机注入,并保持高效。此外,有限的存储可能使所需证据不可用,因此助手应当能够识别证据缺失。我们系统性地评估了不同 memory protocol 下的通用视频模型以及多种专用流式记忆系统,并测试模型是否会承认证据不足。 评估揭示了效用—延迟—存储 之间的明显权衡:现有方法仍难以同时实现可靠的长期召回、低开销与有效的跨会话主动协助。APM-Bench 为在真实流式条件下开发与比较持久记忆系统提供了全面的测试平台,我们希望它推动未来工作,共同权衡效用、延迟与存储,打造更实用的真实世界流式助手持久记忆。

论文精读

TL;DR APM-Bench 用多会话生活轨迹基准评测流式视频助手的跨会话持久记忆,首次系统揭示效用、延迟与存储之间的权衡,并检验模型能否识别证据缺失。

问题

问题背景

流式视频助手正从单视频理解走向真实个人助理场景,核心诉求是在连续第一视角视觉流中实时交互,并利用持久记忆 (persistent memory) 回溯过往经历。现有研究多聚焦于单条长视频内的流式问答,但真实交互往往是间歇性的,记忆必须跨会话持久化。

现有方法局限

  • 基准缺失:主流流式基准如 Ego4D、EgoSchema 仅评测单视频或独立短片段,缺乏跨会话记忆与主动响应能力的统一评测。
  • 记忆系统局限:多数流式记忆系统设计为单视频在线缓存,episode 结束后记忆即失效;或采用全量存储,导致存储开销与检索延迟过高,无法满足实时交互。
  • 证据缺失处理空白:当有限存储导致必要证据不可用时,模型应主动识别并声明“无法回答”,现有方法缺乏此维度的评测与机制。

为什么这个问题难/重要

技术挑战:持久记忆需同时解决四大问题——可存储性 (storable)、选择性保留 (selective retention)、注入时机 (timely injection) 和计算效率 (efficiency)。此外,存储有限时必须支持证据缺失识别,避免幻觉式回答。

核心权衡:实验已揭示效用–延迟–存储三者难以同时优化,现有方法要么高召回但高延迟,要么低开销但遗忘严重,这是实际部署的硬约束。

业界关注度:可穿戴设备、AR 助手、智能家居等应用场景均依赖跨会话记忆,缺乏标准 benchmark 会阻碍系统级对比与迭代。

行业类比

如同客服机器人需要在多轮对话间记住用户历史,但这里还需处理第一视角视频流中的海量时空信息,并进行选择性压缩与主动触发,难度更高。

核心洞察

  • 跨会话持久记忆将评测从单视频流重构为多会话生活轨迹。现有流式视频基准多聚焦单段连续视频或短片段,忽略真实交互的间歇性;APM-Bench 通过 549 个会话、104 条轨迹显式要求模型跨会话回忆并主动响应,系统揭示效用、延迟、存储之间的三角权衡。这一设计比现有单一连续流基准更贴近真实个人助理场景,暴露了当前方法在长时可靠回忆与低开销主动辅助间的根本矛盾。
  • 证据不足的自我识别被显式列为评估维度。有限存储下必要证据可能缺失,APM-Bench 测试模型是否承认证据不足而非强行作答,并设计多种自适应响应任务(ERA、RCR、MPA、PRM、TPG)考察时机判断与响应质量。这推动流式模型从被动回答转向元认知判断,减少幻觉,同时揭示即使决策正确,响应内容仍可能不够贴合上下文,为工程部署中置信度阈值和主动触发策略提供直接评测依据。

方法

输入与轨迹构建

APM-Bench 将真实流式交互重构为 multi-session life trajectories。输入为 egocentric 视频流,切分为 549 个 session,并组织成 104 条轨迹;每条轨迹内的 session 围绕相关活动展开。每条 session 带有细粒度标注,共 2,719 个候选样本,覆盖客观多选题 (MCQA) 与开放式自适应响应。

关键模块

  1. 任务定义:包含五类自适应响应任务——ERA(证据就绪)、RCR(会话内条件提醒)、MPA(基于先前经验的辅助)、PRM(跨会话注册提醒)、TPG(延续任务引导)。模型需在流式输入中判断何时注入持久记忆、何时提供主动响应。
  2. 记忆协议:支持通用视频模型在不同记忆协议下运行,包括文本摘要记忆与持久化存储;同时评估专门设计的流式记忆系统。
  3. 在线推理约束:模型实时处理视频流,并需响应 evidence availability-aware prompt,即在存储有限、必要证据缺失时明确表示无法回答。

输出与指标

评估围绕三个维度:utility(长期召回、回答质量、主动响应准确率)、latency(实时交互延迟)以及 storage(持久存储开销),同时检验模型对 insufficient evidence 的拒答能力。

与原作摘要一致:现有方法仍难以在跨会话任务中同时实现可靠长期召回、低开销与有效主动辅助。

该方法与单段连续视频基准的差异在于,首次系统性地以“多会话、断续交互、有限存储”为约束,对持久记忆进行端到端评测。

实验

实验设计叙述

APM-Bench 将现实流式交互重构为多会话生活轨迹,包含 549 个会话、104 条轨迹、2,719 个候选答案,覆盖客观与开放式问题。评估协议采用在线推理,通用视频模型在多种记忆协议(如无记忆、全存储、文本摘要记忆)下测试,专用流式记忆系统则按其设计运行。另外加入证据不足感知测试,要求模型在缺少必要证据时明确承认。

关键发现

结果显示,现有方法无法同时满足可靠的长期回忆、低延迟和低存储开销,以及跨会话主动协助。在效用-延迟-存储之间存在明显权衡:增大存储或引入复杂记忆检索可提升回忆准确率,但牺牲在线推理速度和计算效率;减少存储则导致证据缺失时模型主动回答错误。证据不足承认能力普遍较弱,模型倾向于编造而非承认不知道。

跟基线对比深度解读

与单独连续视频基准(如 EgoSchema、Ego4D 等)不同,APM-Bench 强调断续会话与持久记忆,暴露出通用视频模型直接应用于跨会话任务时的不足。专用流式记忆系统虽能降低延迟或存储,但往往针对特定假设设计,缺乏通用性。该基准推动从单一指标转向多目标联合优化,为实用流式助手提供更全面的评估框架。

行业影响

落地场景

APM-Bench 面向自我中心流视频助手(如 AR 眼镜、智能摄像头、车载记录仪),核心解决跨会话持久记忆。典型应用:

  • 可穿戴个人助理:记录用户日常活动(做饭、购物、会议),跨多次间断会话记住偏好与待办,主动提醒(如“你上周提到的报告已生成”)。
  • 智能家居监控:多日视频流分析,关联历史事件(如“前门有人徘徊,与三天前同一时段相似”)。
  • 企业视频客服:跨多次服务会话记住客户问题历史,减少重复沟通。

商业价值

  • 降本:持久记忆减少重复计算与存储冗余,低开销记忆方案可降低推理硬件成本。
  • 增收:主动服务(提醒、推荐)提升产品差异化与用户付费意愿。
  • 体验提升:用户无需重复背景,获得连续个性化服务。APM-Bench 揭示的效用-延迟-存储权衡指导团队按业务需求选择记忆策略(如高精度高成本 vs 轻量低延迟)。相比现有只关注单视频的基准,APM-Bench 更贴近真实断续交互,降低产品落地风险。

与现有产品/工作流的接口

集成方式类似 RAG 流水线,但需扩展为流式多会话记忆:

  • 存储层:使用向量数据库(如 Pinecone、Milvus)存储会话嵌入,支持增量更新与淘汰策略。
  • 注入层:实时检索相关记忆并注入 LLM 上下文,需满足低延迟(如<100ms)。
  • 评估层:将 APM-Bench 作为 CI/CD 测试集,对比不同记忆协议与模型的效用、延迟、存储开销。
  • 工程启示:现有方法难以同时满足长期回忆、低延迟、低存储,需引入自适应记忆管理(遗忘机制、分层存储)。APM-Bench 可快速验证这些机制的实际效果。

局限

  • **基准规模与场景覆盖有限**:APM-Bench 目前包含 549 个会话、104 条轨迹、2,719 个候选,虽然精心组织,但相对真实世界个人助理的无限场景,数据规模和多样性仍然有限。基准主要围绕日常生活活动展开,可能无法覆盖专业领域或极端边缘案例。此外,数据收集和标注依赖人工,可能引入主观偏差,且扩展成本较高。这限制了在该基准上表现良好的方法直接泛化到更广泛真实场景的可信度。
  • **评估协议仍存在近似性**:在线推理协议和指标设计(如 `LLM-as-Judge` 评估开放回答质量、主动响应准确性)虽然力图贴近真实流式条件,但不可避免地引入近似误差。例如,`LLM-as-Judge` 的评分尺度可能不稳定,不同 LLM 或 prompt 可能给出不一致结果;主动响应的评估依赖于人工标注的“理想时机”,但真实用户偏好可能因人而异。此外,基准假设视频流以固定帧率输入,未模拟网络波动、硬件资源限制等实际部署约束,因此评估结果可能高估了系统在真实环境中的鲁棒性。
  • **记忆存储与检索协议设定相对简化**:基准虽然对比了多种记忆协议和系统,但存储上限、注入时机等超参数的设定可能过于理想化或固定,例如预定义存储预算和固定注入频率,缺乏动态调整机制。真实助理中,记忆管理需要根据上下文和任务复杂度自适应调整,而当前基准尚未充分考察这一点。此外,论文关注“缺失证据识别”,但评估主要针对二值判断,缺乏更细粒度的置信度评估,可能无法完全反映系统对不确定性的表达能力。
论文Jianguo Huang2026-09-29原文

相关内容