论文

Vinci2:在连续自我中心视频中提供主动协助

Vinci2:在连续自我中心视频中提供主动协助

当智能助手应该在未被询问时主动说话?连续自我中心视频提供了丰富、动态的上下文,使得一种新的协助形式成为可能:主动而非被动。然而,现有方法要么被动等待用户查询,要么将每个检测到的事件都视为需要响应,而不考虑用户的历史、当前活动或协助是否受欢迎。我们将主动协助重新定义为上下文相关的决策问题:智能体不仅要感知正在发生的事情,还要基于累积的时间上下文推理,以确定何时以及是否进行干预。 为此,我们提出 Vinci2,一个主动的自我中心协助系统,将设备端助手 Vinci 从被动响应推向主动。在评估方面,我们提出 EgoServe,首个用于连续自我中心视频中主动协助的大规模基准。EgoServe 包含超过 3,000 个服务实例,按 4 个时间记忆范围组织,从即时安全警报到长期习惯指导,涵盖 10 个服务类别。在建模方面,我们提出 EgoMemo,一个无需训练、记忆增强的智能体,维护三种互补的记忆表示: - 多尺度时间摘要 - 语义知识图谱 - 视觉嵌入档案 在每个时间步,EgoMemo 进行检索增强推理以确定是否需要协助,如果需要,则生成上下文基础响应。实验表明,EgoMemo 在 EgoServe 上建立了强基线,同时在现有自我中心基准上保持竞争力。我们的基准和代码公开在 https://sitonggong.github.io/EgoServe-page/{Vinci2}。

论文精读

TL;DR 将主动辅助建模为基于长期上下文的决策问题,提出首个大规模主动辅助基准 EgoServe 和无需训练的记忆增强代理 EgoMemo,让助手学会在恰当时机自主干预。

问题

问题背景

可穿戴设备与 AR 眼镜的普及,使连续第一视角视频(continuous egocentric video) 成为人机交互的新界面。现有助手多为被动响应式——由用户发起查询或触发特定事件后才介入。行业正探索 主动式协助(proactive assistance):系统在用户未明确要求时,根据上下文判断是否需要介入,提供安全提醒、任务引导或习惯建议。

现有方法的局限

目前的两类范式均未真正解决主动协助的核心矛盾:

  • 被动查询系统:等待明确的用户输入(如语音指令),完全放弃主动介入的可能性,无法服务即时性、持续性应用场景。
  • 事件触发型方案:将每一个检测到的事件(如物体识别、动作分类)都视为触发条件,频繁打断用户,缺乏对 历史时序上下文、用户接受度、当前活动语义 的建模,导致误警率高、用户体验差。

技术上,这些方法没有形式化 “何时干预” 的决策机制;也无法在连续流式视频中维护、检索与推理跨时间尺度的记忆(从几秒的安全警报到数月的习惯分析)。

为什么这个问题难且重要

主动协助是一个上下文敏感的决策问题,其难度在于:

  1. 时间依赖性:判断是否需要介入,依赖于对过去活动序列的理解,而非当前帧的孤立快照。
  2. 多层级记忆:需要融合短时突发(如危险动作)、中时程任务(如烹饪步骤)、长时程习惯(如饮食模式)等多种时间粒度的记忆。
  3. 成本敏感:错误介入比错过更有害——打扰用户会造成信任丧失,因此需要极高的精准度与可解释性。

业界关注度持续上升,因其直接关系到 下一代智能眼镜与穿戴式 AI 的落地。若无法解决“何时开口”的问题,先进的多模态模型也只能停留在被动工具阶段,无法成为真正的个人智能体。

行业类比

这一问题与 自动驾驶中“何时预警或接管” 的决策问题类似:系统必须综合短时感知、路径规划与驾驶历史,在最小化打扰与最大化安全之间权衡。同样,主动助手要在不打断用户心流的前提下,提供恰到好处的帮助。

核心洞察

  • 主动辅助被重新定义为上下文依赖的决策问题:系统需要在持续自我中心视频中,结合用户历史、当前活动及干预适宜性,推理何时及是否主动介入。这突破了现有方法要么被动等待用户查询、要么盲目对所有事件作出响应的局限,将主动辅助从事件触发提升到情境理解层面。
  • EgoServe 是首个面向主动辅助的大规模基准,通过 4 个时间记忆视野(从即时安全警报到长期习惯辅导)和 10 个服务类别,精细刻画了辅助需求的多样性。这种分层设计使得评估可以覆盖短期响应与长期规划,填补了以往基准仅关注孤立任务或被动问答的空白。
  • EgoMemo 提出训练自由、记忆增强的推理架构,同时维护多尺度时间摘要、语义知识图谱和视觉嵌入档案,并通过检索增强推理决定干预时机。与依赖微调或单一记忆的方法不同,该架构无需训练即可在流式视频中动态整合异构记忆,为资源受限的端侧主动辅助提供了灵活且可泛化的基线范式。

方法

EgoMemo 是一种训练无关 (training-free)、记忆增强的主动式辅助智能体,其核心流程为:

输入 → 连续第一人称视频流,系统逐帧或逐段处理,不依赖用户显式查询。

流式记忆构建 (Streaming Memory Construction)

从视频流中并行维护三类互补记忆:

  • 多尺度时间摘要 (Multi-scale Temporal Summaries):按不同时间粒度(如秒、分、时)记录事件梗概,捕获即时的细粒度动作与长期的上下文演化。
  • 语义知识图谱 (Semantic Knowledge Graph):以图结构存储对象、动作、场景等实体及其关系,支持语义级关联推理。
  • 视觉嵌入档案 (Visual Embedding Archives):保存关键帧的视觉特征向量,用于相似场景检索与细粒度视觉锚定。

流式检索增强推理 (Streaming Retrieval-Augmented Reasoning)

在每一个时间步,EgoMemo 执行以下步骤:

  1. 动态检索:根据当前观察,从三种记忆中分别检索最相关的历史上下文,包括时间上邻近的摘要、语义关联的图谱子图以及视觉上相似的嵌入。
  2. 上下文决策:基于检索到的多元记忆,智能体推理当前时刻是否适合主动介入。它综合考量用户当前活动、历史习惯、潜在风险或需求,而非仅检测到事件即触发。
  3. 响应生成:若判断需要介入,生成一条情境感知的自然语言提示(如危险预警或习惯提醒);否则保持沉默。

输出 → 在恰当的时刻给出简短、上下文相关的主动协助,或在多数情况下选择不打断用户。

与同类方法的差异:EgoMemo 不依赖用户查询或预设事件阈值,而是借助训练无关的记忆检索增强推理,在连续视频流中自主决策介入时机,平衡了被动响应与过度打扰。

实验

实验设计

论文在自建的大规模主动服务基准 EgoServe 上评估 EgoMemo。该基准从连续第一人称视频中构造了超过 3000 个服务实例,覆盖 4 种时长范围(即时安全提醒到长期习惯指导)和 10 个服务类别。实验将 EgoMemo 与多种基线对比,包括被动响应式智能体(如 Vinci)以及移除记忆模块的变体,并进行了消融分析。同时,在 CaptainCook4D 等现有第一人称基准上验证了泛化能力。

关键发现

  • 记忆增强的多粒度建模至关重要:EgoMemo 维持的三种记忆(多尺度时序摘要、语义知识图、视觉嵌入库)使其能根据累积上下文做出更准确的干预决策,远优于仅依赖当前帧观察的方法。
  • 检索增强推理有效权衡干预时机:在每一步对记忆进行检索并推理,使系统能有效过滤无关事件,仅在真正需要时主动提供帮助,避免了过度打扰和信息遗漏。
  • 泛化性良好:在不修改架构的情况下,EgoMemo 在现有基准上也取得了有竞争力的结果,表明其记忆与推理机制具有较好的场景适应性。

与基线对比解读

相比于被动等待用户查询的传统助手,EgoMemo 首次在连续视频流上实现了上下文感知的主动决策。与简单的事件驱动规则相比,它通过端到端的记忆检索与推理机制,显著降低了误报和漏报。消融实验表明,移除任一种记忆都会导致性能下降,验证了三种记忆互补设计的必要性。尽管目前仅在有限类别上测试,但这一范式为未来真正开启全天候第一人称主动助手提供了可扩展的技术路线。

行业影响

落地场景

Vinci2EgoServe 基准将主动式助手从被动问答推向上下文感知的适时干预,适用于 AR 眼镜、智能手表、车载 HUD 等穿戴/移动设备。典型场景包括:

  • 实时安全提醒:在工业巡检、自动驾驶测试中,当用户出现分心或危险操作时,主动告警而不等待指令。
  • 长期习惯培养:基于过去数天或数周的行为记忆,在恰当的时刻提醒用户补水、休息或纠正不良姿态。
  • 零售与服务业辅助:店员佩戴眼镜,系统根据顾客行为历史主动推送商品信息或服务建议。

商业价值

  • 降本增效:将传统需要人工回看或被动调取的辅助转化为事件驱动的主动决策,减少操作延迟和事故风险。在远程运维、医疗手术辅助等场景,可直接降低人力培训成本。
  • 体验升级:从“用户找功能”变为“功能适应用户”,提升设备黏性。例如,健身指导应用在用户动作变形时即时纠正,而非事后分析,显著提高付费转化与留存。
  • 新盈利模式:记忆增强的主动服务可作为 AIaaS 组件 授权给硬件厂商,按服务触发次数或月活计费,打开持续收入通道。

与现有产品/工作流的接口

EgoMemo 训练自由、无微调需求的架构,可通过标准 API 集成到现有实时视频处理管道中:

  1. 视频流输入层对接 视频编解码模块,输出帧序列与时间戳。
  2. 提取的特征接入 EgoMemo 的多尺度时序摘要、知识图谱和视觉存储,与现有记忆系统(如向量数据库)统一管理。
  3. 决策推理结果以结构化消息推送到前端交互组件(语音播报、文字提示),并可与现有规则引擎并行,例如当用户日程繁忙时自动降低提醒频率。

具体落地 use case

  1. 自动驾驶数据闭环:在自动驾驶测试车辆中,车载摄像头连续录制驾驶员行为与路况。EgoMemo 可集成到现有 rosbag 回放工具链,主动标记紧急接管、疲劳分心时刻,辅助工程师快速定位关键片段,替代全量人工筛选。记忆模块的历史上下文让系统能区分周期性检查后视镜的正常行为与真正分心,降低误报。
  2. 电商直播辅助:主播佩戴轻量相机,系统实时分析主播话术与观众弹幕情绪。当检测到主播遗漏介绍核心卖点或出现冷场趋势(基于过去若干场直播的历史模式),主动推送“建议强调材质优势”或“回顾优惠力度”等提示,不中断直播流。记忆模块可区分不同直播间的用户画像,动态调整干预策略。

局限

  • EgoMemo 采用 training-free 设计,虽避免了微调成本,但其推理能力高度依赖底层预训练模型(如 VLM 和 LLM)已有的知识。在需要细粒度活动理解或多步因果推理的场景下,若无针对性的持续学习机制,模型可能产生不准确的干预建议,且难以从用户反馈中在线改进。
  • EgoServe 作为首个大规模主动辅助基准,覆盖了 4 个时间记忆尺度与 10 个服务类别,但仍可能遗漏现实世界中的多样场景(如多人协作、复杂环境噪音等)。数据来源限于特定 egocentric 视频数据集,域迁移能力未经验证,可能导致基于此开发的系统在其他环境中泛化不足。
  • 离线评估指标(如推荐准确率、响应合理性等)难以完全衡量主动辅助系统的关键特性:介入时机的用户体感与接受度。缺乏与真实用户交互的在线实验或用户研究,使得系统在真实场景中的打扰率、信任度等维度无法得到有效验证。
论文Gong Sitong2026-07-13原文

相关内容