论文

LatentPress: 超越文本与视觉的上下文压缩

LatentPress: 超越文本与视觉的上下文压缩

传统的上下文压缩通常以人类可读文本或渲染图像的形式承载,即使其消费方是语言模型,也仍需解码。我们提出 LatentPress,将对话历史与长文档压缩为第三种表示:连续记忆 token(continuous memory tokens)。冻结的解码器可直接通过其输入嵌入接口读取这些 token,推理时无需重建文本。 一个与读取器匹配的小型写入器将上下文压缩 4-16 倍,同时仅训练适配器(参数量 4.2M-26.2M,约为解码器的 0.1%)。在 LongMemEval 上,LatentPress 在 7.70 倍压缩下达到 0.504 准确率,优于未压缩证据的 0.490,且大幅超过文本摘要(0.184)与基于 OCR 的压缩(0.426 至 0.312)。在 LongBench-QA 上,领域内写入器在 4-8 倍压缩下达到或超过原始上下文阅读表现,而 16 倍压缩略低于原始表现。 写作过程仅需每段对话 43 毫秒,比文本摘要或 OCR 重建快约一个数量级;读取速度比原始上下文或缓存 OCR 快 5-9 倍。我们在两种迁移设置下验证了该接口:从 UltraChat 到 LongMemEval 记忆问答的零样本迁移,以及从 LongMemEval 派生问答到未见过的 LongBench 文档领域的迁移。这些结果确立了直接软 token 作为超越文本与视觉的实用机器面向上下文接口。 实验实现见:https://github.com/xuyd16ai/contextsofttokencompress。

论文精读

TL;DR LatentPress 将上下文压缩为连续记忆 token 供冻结解码器直接读取,在 LongMemEval 上 7.7 倍压缩下精度达 0.504,超越文本/OCR 压缩方法,且读写显著加速。

问题

问题背景

当前大语言模型(LLM)在长上下文处理中,如何以低开销保留关键信息、同时维持问答精度,是推理成本优化的核心关注点。

现有方法局限

主流上下文压缩方案依赖人类可读表示,主要分为文本摘要和 OCR 重建两类:

  • 文本摘要需要生成自然语言,信息损失不可控,且摘要生成本身带来额外推理时延;摘要的可读性对下游 LLM 而言并非必需,却限制了压缩率的提升。
  • OCR 重建将上下文渲染为图像后再由视觉编码器解析,引入光学字符识别误差,额外解码步骤导致端到端延迟增加,且在高压缩率下准确率明显下降。 这类方法本质上是“为人类设计、经机器中转”,与 LLM 直接消费 token 的输入接口不匹配,造成效率与保真度的双重损失。

为什么这个问题难/重要

技术难点在于如何构建一种机器专用表示,既能被冻结的 LLM 直接读取,又无需重建为文本或图像。这要求连续向量与 LLM 输入嵌入空间良好对齐,同时保持小规模 writer 的稳定训练和跨领域泛化。业界对长上下文压缩需求迫切:模型上下文窗口持续扩大,但注意力计算和 KV 缓存开销随序列长度线性增长,成为长文档和对话系统部署的瓶颈。若能在 4–16 倍压缩率下保持甚至超越原始上下文精度,将显著降低推理成本。

行业类比

类似视频流中直接传输隐层特征供下游模型消费,而非传输原始帧再解码;LatentPress 为 LLM 上下文引入“直接软 token 接口”,为长上下文服务提供了新的效率优化路径。

核心洞察

  • LatentPress 提出以连续 memory tokens 作为上下文压缩的表示,直接通过解码器的 input-embedding 接口读取,完全绕过文本或图像重建。这改变了压缩目标的本质:当消费者是 LLM 时,中间表示无需人类可读,从而避免了文本摘要或 OCR 重建过程中引入的信息损失与额外延迟。该方法在 LongMemEval 上以 7.7 倍压缩率取得 0.504 准确率,甚至超过未压缩证据的 0.490,证明机器原生表示可以优于原始文本。
  • 该方法通过仅训练 4.2M–26.2M 参数的 writer adapter(约解码器参数 0.1%)实现压缩,冻结解码器以保留原有能力。这不仅大幅降低训练成本,还带来极高推理效率:写入一个对话仅需 43ms,读取比原始上下文快 5–9 倍。相比 text summarization 和 OCR 基线,它在保持或提升精度的同时,省去了昂贵的外部模型调用和重建过程,为延迟敏感型生产系统提供了直接可用的压缩方案。
  • LatentPress 明确量化了压缩率的实用边界:在 4–8 倍压缩下,in-domain writer 匹配或超过 raw-context 阅读性能,16 倍才明显落后;且从 UltraChat 到 LongMemEval 的 zero-shot 迁移有效。这为工程选型提供了可靠依据——压缩率并非越高越好,而应根据任务对信息保留的敏感度选择合适倍率。同时,迁移的成功说明学到的压缩策略具有一定泛化性,可降低对新领域重新训练的成本。

方法

LatentPress 将对话历史或长文档压缩为 continuous memory tokens,由冻结的 decoder 直接通过输入嵌入接口读取,推理时无需文本重建。

输入:原始上下文(对话历史 / 长文档)。

关键模块:

  • 小型 writer:仅训练 adapter(4.2M–26.2M 参数,约占 decoder 的 0.1%),将上下文压缩为 4–16× 的固定数量 soft tokens。
  • 冻结 decoder:作为 reader,直接消费这些 soft tokens,不经过文本或图像解码。
  • Bottleneck supervision:训练时通过瓶颈式监督约束压缩信息,使 writer 输出与 reader 的输入嵌入空间对齐。

输出:在 LongMemEval 等任务上,LatentPress 在 7.70× 压缩下达到 0.504 准确率,略高于未压缩证据的 0.490;在 LongBench-QA 域内 4–8× 压缩时匹配或超过原始上下文。写入耗时约 43 ms,读取比原始上下文快 5–9×。

与同类方法差异:文本摘要和 OCR 图像压缩需要先重建为可读文本或图像再解码,而 LatentPress 直接输出机器可读的 soft tokens,绕过了昂贵的重构步骤,并以更小的训练参数规模实现更快推理。

实验

实验设计

LatentPress 在两个场景验证:对话记忆(LongMemEval)和长文档 QA(LongBench-QA)。对话记忆:writer 先在 UltraChat 上训练,零样本迁移至 LongMemEval 记忆问答;对比未压缩证据、文本摘要、OCR 重建压缩。长文档 QA:域内 adapt 和跨域迁移(LongMemEval 派生 QA → 未见 LongBench 文档域),对比原始上下文读取。效率评估测量写入和读取延迟。

关键发现

  • LongMemEval 上 7.70× 压缩时准确率 0.504,超过未压缩证据(0.490),显著优于文本摘要(0.184)和 OCR 压缩(0.426→0.312)。
  • LongBench-QA 上域内 writer 在 4–8× 压缩时匹配或超越原始读取,16× 落后。
  • 写入仅 43 ms/会话,比文本摘要或 OCR 重建快一个数量级;读取比原始上下文或缓存 OCR 快 5–9 倍。
  • 仅训练 adapter(4.2M–26.2M 参数),约解码器 0.1%。

基线对比解读

文本摘要生成可读文本会丢失细节且解码成本高;OCR 重建需视觉渲染和像素解码,易引入误差且效率低。LatentPress 通过连续 soft token 直接写入解码器输入嵌入,避免重建损失,冻结解码器只训练小 writer,实现高压缩比同时保持或提升性能。但 16× 压缩落后表明信息瓶颈存在,且零样本跨域需要域内 adapt 才能达到最优。

行业影响

落地场景

LatentPress 适用于需要长上下文压缩与高效读取的 LLM 应用:多轮对话系统(客服、医疗问诊、教育辅导)、长文档问答(法律合同、金融研报)、代码库理解、个性化推荐中的历史行为建模。其核心是直接输出 连续 memory tokens,冻结 decoder 读取,无需生成可读文本,适合作为 LLM 应用的上下文缓存层。

商业价值

  • 降本:上下文 token 压缩 4–16×,推理耗时下降 5–9×,直接降低 API 调用成本和 GPU 占用。
  • 提效:写入仅 43 ms/会话,比文本摘要或 OCR 快一个数量级,可支持实时压缩。
  • 体验:在 LongMemEval 上,7.7× 压缩下准确率 0.504,超过未压缩证据的 0.490,长对话记忆更可靠。
  • 模型无关:adapter 参数仅占 decoder 约 0.1%,可低成本适配多模型。

与现有产品 / 工作流的接口

LatentPress 以 adapter 层 插入 LLM 输入 embedding 接口,不改 decoder,训练轻量。可作为 RAG 中间件:先压缩检索到的长文档或对话历史为连续 tokens,再拼入 prompt。也可与 多 agent 架构 结合,作为 agent 间传递的上下文摘要格式,避免文本解码开销,降低 pipeline 复杂度。

具体落地 use case:

  • 电商智能客服:将会话历史压缩为 soft tokens,供下游 LLM 生成个性化回答,减少 token 成本并保持上下文完整性。
  • 金融研报分析:压缩多页 PDF 为 memory tokens,支持长文档 QA,避免 OCR 或文本摘要的信息损失。

局限

  • **高压缩比下性能下降**:论文明确指出在 LongBench-QA 上,16× 压缩时 LatentPress 落后于原始上下文读取。连续 memory token 的容量有限,无法完整保留所有细节信息,尤其对于需要精确匹配或长距离依赖的 QA 任务,信息损失明显。这表明当前方法在极高压缩需求场景(如超长文档、大量会话历史)中仍需权衡压缩率与准确性,可能不适合对细节敏感的应用。
  • **依赖冻结解码器与输入嵌入接口**:LatentPress 的核心是 adapter 生成的 soft token 直接通过输入嵌入接口被冻结 decoder 读取。这要求 decoder 的嵌入空间可访问且适配,对于不同骨干模型(如不同 tokenizer、hidden size),需要重新训练 adapter,迁移成本较高。同时,方法无法利用 decoder 内部各层的表示,可能错失更丰富的上下文编码方式,限制了压缩 token 的表达能力。
  • **零样本迁移能力有限**:虽然论文验证了从 UltraChat 到 LongMemEval 以及跨领域 LongBench-QA 的迁移,但在新领域上的性能可能仍明显低于领域内训练。实际应用中,若目标域分布与训练数据差异较大,需要额外微调或适配,增加了部署复杂度。此外,writer 的训练依赖成对问答数据,对于无监督或弱监督场景,可扩展性存疑。
论文Zhengze Zhou2026-09-01原文

相关内容