论文

每项多模态证据一个 token:面向资源受限问答的潜在记忆

每项多模态证据一个 token:面向资源受限问答的潜在记忆

现有基于大语言模型(LLM)和视觉语言模型(VLM)的问答系统依赖外部记忆来获取多模态证据,但传统记忆范式以原始文本和图像形式存储每个证据项,导致检索系统必须将原始数据传递给生成模型,造成大量 token 消耗和存储压力,难以用于资源受限场景。 本文提出 Latent Memory,一种潜在空间记忆范式,用一个小型压缩器 LLM/VLM 将每个原始证据(文本或图像)压缩为单个高维 潜在 token,替代原始数据。系统在统一的潜在表示空间中操作:将查询嵌入该空间以检索相关潜在 token,并将检索到的 token 直接输入预训练 LLM/VLM 生成答案。为了确保每个潜在 token 同时具备可重建性、可检索性和可生成性,采用端到端联合训练压缩器,优化目标包括: 1. 重建目标:使潜在 token 能重建原始证据。 2. 对比目标:增强潜在 token 的检索区分度。 3. 蒸馏目标:使潜在 token 保留生成所需信息。 实验在 HotpotQA 等 7 个纯文本基准和多个多模态基准上进行,Latent Memory 取得了与先进 RAG 基线相当的问答性能,同时将生成器 token 消耗降低 3 倍至 10 倍。在 WebQA 上,它实现了最强的图像支撑问答性能。代码见 https://github.com/zz1358m/Latent-Memory-Master。

论文精读

TL;DR 用小型压缩模型将每条多模态证据压缩为单一隐空间 token,检索后直接注入生成器,大幅降低 token 开销与存储压力,同时在文本和多模态 QA 上保持竞争力。

问题

问题背景

当前,基于大语言模型(LLM)与视觉-语言模型(VLM)的问答(QA)系统高度依赖外部记忆来保证回答的事实性与时效性。主流方案通常采用检索增强生成(RAG)或类似框架,将外部文本/图像证据显式地拼接到 prompt 中,让模型基于原始内容进行推理。

现有方法局限

传统记忆范式将每个证据项(段落、图片)以原始格式存储与传递,带来几项关键瓶颈:

  • 推理端 token 爆炸:一条问答可能涉及数十个证据片段,拼合后可达数千 tokens,直接推高 LLM API 成本与延迟,且易突破上下文窗口限制。图像证据成本更高,VLM 需处理大量像素或 patch tokens。
  • 存储压力:原始语料库的索引体积随文档增长线性膨胀,不利于边缘部署。
  • 检索-生成割裂:检索器与生成器在输入空间独立优化,证据的抽取精度与压缩后的语义保真度缺乏联合保证。

这些限制使现有 RAG 系统难以在资源受限场景(端侧、实时交互)中落地。

为什么该问题困难且重要

将原始证据压缩到极小潜在表示面临三项技术挑战:

  1. 信息密度:一个 latent token 必须同时保留可解码的重建信息、与查询相关的检索信号,以及可被生成器直接利用的语义内容。
  2. 多目标协同:训练压缩器需调和重建、对比检索与知识蒸馏三个目标,任一失衡都会导致表示退化。
  3. 跨模态通用性:要求同一压缩范式同时处理文本与图像证据,且生成器无需改变原始预训练架构就能理解压缩 token。

业界对降低大模型推理开销的需求日益迫切,尤其当模型服务算力有限时。因此,此类高效记忆机制对推动 LLM/VLM 在更广泛场景(如本地 Agent、离线知识库查询)落地有重要价值。

行业类比

这类似于在低功耗物联网设备上部署的即时维修助手:设备不可能缓存全部维修手册的原始图文,但通过预训练的压缩“指纹”就能随时召回关键步骤,并在本地小模型中直接驱动对话与视觉指引。

核心洞察

  • - **Latent Memory** 用单一隐 token 替代原始多模态证据,在统一隐空间内完成检索与生成。与传统 RAG 将检索到的原始文本/图像直接交给生成模型不同,该方法在记忆构建阶段就将每条证据压缩为一个高维隐 token,并基于查询在隐空间中直接检索 token,随后输入给生成 LLM/VLM,彻底跳过了原始证据的解码步骤。这不仅使生成器 token 消耗降低 3--10 倍,还能保持 QA 性能,为资源受限设备上的外部记忆应用提供了全新的效率-性能平衡点。
  • - **端到端的重建、对比和蒸馏三目标联合训练** 赋予了隐 token 同时支持重建、检索和生成的多功能信息。与单目标压缩或两阶段训练(先压缩再检索)不同,Latent Memory 在一个框架内让压缩器学习到的表示既能高保真还原原始证据,又能通过对比损失保证检索排序质量,还能借助蒸馏将生成所需的知识保留在 token 中。消融实验显示,移除任一目标都会导致性能显著下降,突显了联合优化的必要性与独特性。

方法

核心流程: 从多模态证据到单 token 替代

Latent Memory 将外部记忆的检索与生成统一在潜在表示空间中, 核心思路是用 一个高维 latent token 替换原始文本或图像证据, 从而大幅降低 token 消耗和存储压力。

输入: 用户查询 (query) + 预构建的潜在记忆库 (latent memory)。记忆库中的每一项对应一条多模态证据, 但不再保存原始形式, 而是由 compressor LLM/VLM 编码成的 latent token。

关键模块与训练:

  • Compressor (小型 LLM/VLM) : 负责将原始证据压缩为单个高维 latent token。训练时同时优化三个目标:

    • 重建 (reconstruction) : 从 latent token 解码出原始证据, 确保信息保留;
    • 对比 (contrastive) : 拉近语义相似的 query 与证据 latent token 的距离, 用于检索;
    • 蒸馏 (distillation) : 让压缩后的 latent token 直接提示生成模型时, 能复制原始证据指导下的答案分布, 保证生成质量。
      三个损失联合端到端训练, 迫使 latent token 同时具备可重建、可检索、可生成三重能力。
  • 检索投影 MLP + 生成投影 MLP: 将 query、latent token 分别映射到统一潜在空间, 并用对比损失对齐; 检索时用 query embedding 检索最相关 latent token, 经生成投影 MLP 调整后直接作为 prompt 送入预训练 LLM/VLM 生成答案。

输出: 生成模型基于检索到的 latent token (而非原始证据) 直接生成答案。

与典型 RAG 方法相比, Latent Memory 不再将检索到的原始文本/图像拼入 prompt 再交由生成模型处理, 而是将全体证据前置压缩为单 token, 检索与生成均围绕压缩表示进行, 这使得 生成阶段的 token 消耗减少 3–10 倍, 且存储开销大幅下降。

实验

实验设计

Latent Memory 在7 个纯文本 QA 基准(如 HotpotQA)和多个多模态 QA 基准上进行评估,并与先进的 RAG 基线对比。模型采用一个轻量压缩器(compressor LLM / VLM)将每条原始证据编码为单个潜在 token,再通过统一潜在空间进行检索,直接将潜在 token 提示给预训练的生成器 LLM / VLM 以产生答案。训练时联合使用重建损失、对比损失和蒸馏损失进行端到端优化。

关键发现

在保持与高级 RAG 基线竞争力相当的 QA 准确率的同时,Latent Memory 将生成器 token 消耗量减少了 3 到 10 倍,极大降低了推理成本和存储开销。在多模态 WebQA 上,该方法取得了最强的图像基础 QA 性能。消融实验表明,三重训练目标共同提升了潜在 token 的检索、重构和生成质量。

基线对比解读

传统 RAG 系统必须向生成器传递完整文本或图像 token,导致高吞吐时巨大的存储和计算压力;Latent Memory 通过压缩至单一潜在 token 从根本上规避了这一问题。与同样追求压缩的检索-压缩交互方法相比,本工作不仅是事后压缩,而是将检索与生成联合优化在同一潜在空间内,因此能够以显著更低的 token 成本保持甚至超越基线性能,尤其适用于边缘设备或低算力场景。

行业影响

落地场景

Latent Memory 为资源受限的问答系统提供了一种极低 token 消耗的外部记忆机制,适合部署在端侧设备或边缘推理场景。

  • 移动端智能助手:在手机、IoT 设备上实现多模态知识库问答,避免传输大量原始文本或图像,节省带宽和推理成本。
  • 企业知识库搜索:内部文档(技术手册、合规文件)可通过压缩器预编码为潜在 token,实现高并发、低延迟的检索增强生成(RAG)。
  • 医疗影像报告生成:将 X 光片、病理切片等证据压缩为单 token,辅助小型 VLM 生成诊断意见,保护患者隐私的同时减少网络传输。

商业价值

  • 降本:生成阶段 token 用量仅为传统 RAG 的 1/3 至 1/10,大幅降低调用付费 API(如 GPT-4o、Gemini)的成本;存储从原始数据变为固定维度潜在 token,减少向量数据库开销。
  • 增收:使之前因算力或存储限制无法落地的场景成为可能,如在廉价终端上提供增值知识服务,拓展付费用户群体。
  • 体验提升:更快的检索生成速度(低延迟)直接改善交互流畅度,在客服、教育辅导等场景中提升用户留存。

与现有产品/工作流的集成

Latent Memory 可视为一种即插即用的记忆编码层,与当前 RAG 框架兼容。

  • 插入位置:在传统索引阶段,使用其小型 Compressor LLM/VLM 将每段文档或图像编码为 latent token 存入向量库;查询时,Query 经同一投影空间检索 Top-k token,直接拼入生成模型 prompt。
  • 技术栈适配:
    • 向量库:FAISS、Milvus 等直接存储高维 latent token 向量,无需修改索引结构。
    • 生成器:兼容主流 LLM(如 Llama 3、GPT-4o)和 VLM(如 Llava、Qwen-VL),通过添加 projection MLP 将 latent token 映射到其输入空间。
    • 现有 RAG 管道:可替换“检索+摘录”步骤,或作为混合检索中的一个分支,与其他稀疏/稠密检索结果融合。

具体落地 Use Case

  1. 电商商品问答:多模态商品描述(图文详情)经 Compressor VLM 压缩为单 token 存入记忆库;用户用自然语言提问时,系统检索相关 latent token 直接 prompt 给客服 LLM,生成精准回答。相比传递原始高分辨率图片和长文本,节省 API 成本且响应时间从秒级降至毫秒级,适合大促时的高并发场景。

  2. 自动驾驶长尾场景查询:车载手册、维修指南等文档被预编码为 latent token 存储在车端;驾驶员通过语音询问故障灯含义时,车载小模型检索相关 token 后生成解释,全程无需网络,保障数据隐私和实时性。

局限

  • **信息压缩瓶颈**:每项证据仅用一个潜在 token 表示,对长文本或多步推理证据可能容量不足,导致关键细节丢失。论文在 HotpotQA 等多跳任务上观察到性能与原始 RAG 存在差距,表明压缩器难以完美保留所有必要信息,尤其当证据本身复杂性高时。
  • **训练复杂度与扩展性**:联合训练压缩器需同时优化重建、对比和蒸馏三个目标,设计繁琐,且依赖特定预训练 LLM/VLM 作为生成器。迁移到新生成器或领域时需重新训练投影层,灵活性差于即插即用的 RAG 方案。虽然代码开源,但复现和适配成本仍较高。
  • **对资源受限场景的假设适应**:方法主要面向 token 消耗和存储敏感的应用,但在计算资源充足时,压缩带来的轻微性能下降可能不被接受。此外,实验仅覆盖 QA 任务,对需要证据中细粒度引用、长文本生成等场景的适用性未经验证,缺乏与向量数据库近似搜索之外的检索方法对比。
论文Zhi Zheng2026-06-09原文

相关内容