论文

LightMem-Ego: 你的日常生活AI记忆

LightMem-Ego: 你的日常生活AI记忆

移动和可穿戴设备上的个人AI助手通过视觉和音频流持续感知用户的日常生活。然而,回答有关过去经历的查询需要轻量级的多模态记忆,能够持续积累、组织和检索长期经验,这仍然具有挑战性。 为了解决这一挑战,我们提出了 LightMem-Ego ,一种用于日常生活辅助的轻量级流式多模态记忆系统。该系统持续捕获以自我为中心的视觉和音频流,将它们对齐到共享时间线上,并组织成由当前记忆、短期记忆和长期记忆组成的层次化记忆结构。给定用户查询时, LightMem-Ego 动态地将检索路由到适当的记忆层级,并生成基于多模态证据的答案。 该演示可部署在智能手机和AI眼镜上,支持物体查找、对话回忆、生活总结、例行发现和个性化辅助。代码已在 https://github.com/zjunlp/LightMem-Ego 开源。

论文精读

TL;DR LightMem-Ego 是一个可部署在手机和 AI 眼镜上的轻量流式多模态记忆系统,通过层级记忆和动态检索,实现个人日常经历的高效积累与问答,支持物品查找、对话回忆等任务。

问题

问题背景

移动与可穿戴 AI 助手正从简单指令响应转向对用户日常生活的持续感知与理解,要求能够基于视觉和音频流回答关于过往经历的查询,这催生了对长期、可积累的个人记忆系统的需求。

现有方法的局限

  • 离线批处理 vs. 在线流式:传统个人记忆系统多采用离线处理,无法持续摄入并实时组织多模态流,导致记忆更新滞后。
  • 缺乏层次化组织:多数系统将所有记忆混杂存储,没有划分当前 / 短期 / 长期记忆,检索效率低且难以定位相关经历。
  • 检索静态僵化:检索时往往遍历全量记忆,而非根据查询动态路由到合适的时间粒度,浪费计算并增加延迟。
  • 云端依赖与隐私:部分方案依赖云端大模型进行记忆编码与检索,带来网络延迟与隐私泄露风险,不适宜高度私密的日常数据。
  • 资源开销大:现有系统很少能在智能手机或 AI 眼镜等边缘设备上流畅运行,内存和算力限制是主要瓶颈。

问题的重要性与技术挑战

实现轻量级流式多模态记忆系统面临三大挑战:

  1. 时序对齐与事件分割:将非结构化的音视频流自动切分为有意义的事件,并保持多模态时间同步。
  2. 记忆的持续累积与遗忘:设计合理的分层记忆结构,模拟人脑的遗忘曲线,保留关键信息同时控制存储占用。
  3. 查询自适应检索与证据融合:根据用户查询的时效性(现在、近期、远期)动态选择记忆层级,并有效融合多模态证据生成回答。

随着AI 眼镜、智能戒指等可穿戴设备的兴起,业界迫切需要一套可在设备端运行、保护隐私、实时响应的记忆方案,以支撑下一代个人 AI 助手。

行业类比

这一问题类似于自动驾驶中的连续时空记忆系统,车辆需实时记录并理解环境变化以检索过去场景,但个人 AI 助手的记忆更侧重人际交互与物品关联,且对隐私要求更为苛刻。

核心洞察

  • **流式多模态端侧记忆系统** 将全天候自我中心感知与长期记忆融合在轻量级管线中,区别于多数工作将感知、记忆、查询解耦且依赖云端大模型的做法。LightMem-Ego 直接在手机或 AI 眼镜上连续对齐视觉与音频流,无需回传原始数据,兼顾隐私与实时性,为“AI 记住你的生活”提供了实际可部署的范式。
  • **层次化记忆与动态检索路由** 模仿人类记忆的多级结构(当前/短期/长期),根据查询语义自动选择合适层级进行证据召回,避免传统单一向量库的噪声与延迟。该设计使系统能在资源受限的边缘设备上,既支持秒级回忆“钥匙刚才放哪”,也支持周级总结“上周的主要活动”,在精度与开销之间取得工程平衡。

方法

输入与数据流

LightMem-Ego 接收来自移动或穿戴设备(如智能手机、AI 眼镜)的连续自我中心视觉流(egocentric visual stream)与音频流。两股流被实时捕获并对齐到统一时间线,形成原始的多模态生活记录。

关键模块

  1. 事件分割(Event Segmentation):从流式数据中检测语义边界,将连续记录切分为离散的生活事件片段。
  2. 层次化记忆(Hierarchical Memory):事件被组织为三层记忆——当前记忆(极短时间窗口)、短期记忆(近期事件摘要)和长期记忆(压缩存储的历史知识)。该结构支持高效读写与逐层遗忘/压缩。
  3. 边缘导向效率(Edge-Oriented Efficiency):针对移动端算力与存储约束,采用轻量模型与流式处理管线,确保记忆系统可本地部署。
  4. 经验检索与问答(Experience Retrieval and QA):收到用户查询后,系统动态路由至最相关的记忆层级,提取多模态证据(视觉片段、音频片段或结构化记忆),再交由生成模块合成自然语言答案。

输出与应用

系统输出基于多模态证据的答案,可支撑物体查找、对话回忆、生活摘要、例行发现与个性化辅助等日常任务。

与同类方法的差异

相比传统仅依赖文本或单模态检索的个人记忆系统,LightMem-Ego 首次在流式多模态记忆框架中实现分层组织与边缘高效部署,使真实场景下的长期经验积累与即时问答成为可能。

实验

实验设计

LightMem‑Ego 的评估围绕端到端日常辅助场景 展开,使用连续采集的第一人称多模态视频与音频流,模拟长时间尺度的记忆累积与查询。实验设置涵盖四个维度:记忆检索准确率经验问答准确率移动端与可穿戴设备上的端到端延迟,以及与现有助手和记忆系统的能力对比。系统对分层记忆(当前、短期、长期)执行动态路由检索,并基于多模态证据生成回答,任务包括物体查找、对话回忆、生活总结、常规发现等。

关键发现

轻量流式架构 使 LightMem‑Ego 能够在智能手机和 AI 眼镜上实时运行,延迟控制在用户可接受范围内,验证了边缘侧持续流式记忆 的可行性。分层记忆与动态路由 显著提升了长期体验检索的效率——对于近期事件直接从当前或短期记忆快速回答,对于久远事件则自动回溯长期存储,平衡了精度与速度。在经验问答中,系统能够将视觉与音频证据对齐到统一时间轴,生成可信的回答,有效支持了物体定位、对话片段回放等真实需求。

基线对比

与现有通用个人助手相比,LightMem‑Ego 的核心差异在于原生支持长期、多模态、自我中心的记忆累积,而非仅依赖本次会话的上下文。它避免了传统记忆方案需要预先定义索引或定期冷启动的局限,通过事件分割与增量层次化组织实现持续更新。相较于侧重文本的对话记忆系统,LightMem‑Ego 能直接利用可穿戴设备的流式视听输入,在移动边缘条件下保持鲁棒性。与商用助手及研究原型对比,系统在长周期个性化查询上展现出更强的证据基础与场景连贯性

行业影响

落地场景

LightMem-Ego 可嵌入智能手机、AI 眼镜、智能手表等个人边缘设备,实现连续的多模态生命日志(lifelogging)。典型产品形态包括:

  • 个人记忆助手:自动记录并索引用户所见所闻,支持“上周三会议室里讨论的预算数字是多少?”等回顾查询。
  • 生活日志摘要:为内容平台或社交应用提供每日/每周活动自动生成摘要,提升用户留存。
  • 任务辅助:在物流、维修等现场作业场景,通过 AR 眼镜记录操作流程,事后检索操作细节或异常事件。
  • 健康监测:持续记录老人日常行为与对话,辅助认知障碍筛查或生活规律分析。

商业价值

  • 边缘计算降本:系统在端侧完成多模态对齐、事件分割和分层存储,仅将必要特征上传,大幅降低云存储和带宽成本。
  • 体验护城河:长期个人记忆使 AI 助手从“单次问答”进化为“知悉用户历史”的终身伴侣,显著提升用户粘性和付费意愿(订阅制或增值服务)。
  • 新数据资产:结构化的长期经历数据可匿名化后用于训练更精准的推荐、广告或健康模型,形成数据飞轮。

与现有产品/工作流的接口

LightMem-Ego 可作为记忆后端(Memory Backend)集成进现有 AI 助手堆栈:

  • 与 LLM 框架:通过检索增强生成(RAG)模式为 LLM 提供长程记忆,类似 MemGPT 或 LangChain 的 Memory 组件,但专为多模态流式数据优化。
  • 与可穿戴 SDK:提供轻量级 SDK(如 Android/iOS 库),持续摄取摄像头与麦克风流,对外暴露统一的时间线查询 API。
  • 与云服务:支持可选云端同步,结合向量数据库(如 Milvus)实现多设备记忆合并与备份,适配现有云 AI 平台。

具体用例

  1. 电商/零售体验增强:用户佩戴 AR 眼镜逛店并咨询“上次试穿的那双鞋有折扣吗?”,系统调取记忆中的商品图像与对话,结合电商 API 返回实时优惠信息,提升转化率。
  2. 企业知识管理:工程师通过智能眼镜记录维修过程,后续语音提问“这台设备上次故障时更换了哪个零件?”,系统直接检索视频片段和当时对话,减少重复劳动,缩短平均修复时间(MTTR)。
  3. 健康保险个性化:基于连续生活规律的客观记录(如睡眠、进食、运动频率),为健康险提供动态风险评估和个性化干预建议,降低理赔率。

局限

  • **长期记忆的累积质量与遗忘机制未充分验证**。论文采用分层记忆结构(当前、短期、长期),但长期记忆如何有效压缩、融合与淘汰陈旧信息未在量化评估中深入讨论。在真实数月或数年的时间跨度下,无监督的事件分割和关键帧选择可能引入噪声,导致记忆存储膨胀或重要经历丢失。与 MemGPT 等显式记忆管理对比,缺少对记忆一致性维护的消融实验。
  • **隐私保护与端侧敏感数据处理策略模糊**。系统持续捕获以自我为中心的音视频流,涉及高度敏感的个人数据。论文未详细说明本地处理与云端传输的边界、数据匿名化或加密机制。在可穿戴 AI 眼镜场景中,连续录音和录像可能带来法律与伦理风险,而现有方案如 ScreenAI 或 ScreenAgent 通常处理屏幕内容,敏感度较低,该工作未给出对比分析。
  • **评估场景的覆盖范围有限,复杂查询与多跳推理能力未检验**。实验基于 Ego4D 等已有数据集,但自然查询可能涉及跨模态因果推理(如“为什么我把钥匙放在客厅?”),当前简单的动态路由和检索增强生成能否处理此类复杂问题尚未验证。与主流移动助手(如 Siri、Gemini)对比仅在功能列表层面进行,未提供统一基准上的端到端性能对比,说服力受限。
论文Yijun Chen2026-07-13原文

相关内容