大规模端到端 Context Compression
长上下文语言模型推理受限于内存,因为 KV cache 随上下文长度线性增长。现有压缩技术存在缺陷:要么大幅降低模型质量,要么需要大量时间和计算来压缩单个长提示。此外,许多方法要求输入适配目标模型的上下文窗口,且通常与现代生产推理引擎不兼容。 本文重新审视 编码器-解码器压缩器,通过架构搜索与大规模预训练填补其与 KV cache 压缩 的精度-效率差距。我们从零开始预训练多种架构变体,确定最佳设计,并持续预训练一组 0.6B 编码器、4B 解码器 的模型族,压缩比为 1:4、1:8、1:16,每个模型在超过 350B 词元上训练。 我们提出 Latent Context Language Models (LCLMs),一种改进的压缩器族,在通用任务性能、压缩速度和峰值内存占用上优化了 帕累托前沿。实验表明,LCLMs 可作为长时 agent 的高效骨干,允许 agent 浏览压缩的长上下文并按需自适应扩展相关片段。
论文精读
TL;DR 通过架构搜索与大规模预训练,LCLM 将长上下文压缩为潜在嵌入,在精度‑效率 Pareto 前沿上全面超越 KV 缓存压缩,并支持代理自适应扩展。
问题
问题背景
随着大语言模型上下文窗口从 4K 增长到 128K 甚至 1M tokens,长上下文推理成为智能体、长文档分析、多轮对话等场景的核心能力。内存瓶颈日益突出:KV 缓存随序列长度线性膨胀,使得单个请求的显存与延迟难以承受,制约了生产部署。
现有方法的局限
当前主流压缩手段可分为三类,各有明显短板:
- 硬令牌剪枝:直接丢弃部分 token,往往导致关键信息丢失,模型质量急剧下降。
- KV 缓存压缩:对缓存进行量化、稀疏化或分块,但在高压缩比下依然会显著损害生成质量;而且许多方法要求输入本身已处于目标模型的上下文窗口内,限制了压缩的实际加速效果。
- 编码器-解码器压缩:将长序列映射为少量隐嵌入,理论上可绕过 KV 缓存增长,但已有工作(如 ICAE 等)在准确率-效率 Pareto 前沿上远不如 KV 缓存压缩,难以实用。
为何困难/重要
长上下文推理的核心挑战在于 “压缩比-质量-速度”的不可能三角:
- 高压缩比意味着更强的大幅减少存储与计算,但极易丢失细粒度的上下文关联;
- 保持质量要求压缩过程必须依赖深层语义理解,而非简单的 token 取舍;
- 低延迟要求压缩与解码过程高度适配现代推理引擎(如 vLLM、SGLang),而现有方案常引入独立编码器导致的冗余计算或架构不兼容。 此外,如何在大规模语料上端到端预训练这样的压缩器,并使之成为通用长上下文系统的标准组件,仍是开放问题。业界对更高效的“流式”压缩方案需求迫切,以支撑长期自主智能体的持续运行。
行业类比
这种挑战类似视频编码中的自适应码率压缩:不仅仅做空间/时间的粗采样,而是需要从“语义”层面理解哪些帧是关键帧,才能在低码率下重建出连贯的叙事——长上下文智能体也正是需要这样语义感知的“帧内+帧间”压缩,才能在高压缩下仍保留决策所需的关键信息的脉络。
核心洞察
- - 通过大规模架构搜索和持续预训练,LCLM 重新确立了 encoder-decoder 压缩器在准确率-效率前沿的竞争力,首次全面超越主流 KV cache 压缩方法。与其他工作不同,它并非在已有模型上应用压缩,而是从头设计并预训练专门的压缩-解码架构,在压缩比 1:4 到 1:16 下保持强泛化能力,推理速度与内存占用更优。
- - LCLM 将压缩后的潜在嵌入视为可微分的上下文表示,使长程 Agent 能直接浏览压缩场景并在需要时自适应解压相关片段。这不同于传统分块检索或硬压缩,Agent 无需在原始长文本上反复检索,而是操作紧凑的潜在空间,显著降低了 Agent 推理延迟。
方法
输入与压缩目标
LCLMs 的输入为长上下文 token 序列(如 128K tokens),目标是将其压缩为固定长度的潜在嵌入(latent embeddings),供后续解码器使用,压缩比有 1:4、1:8、1:16 三种规格。
核心架构:编码器-解码器压缩器
- 轻量编码器(0.6B 规模):采用仅编码器架构,负责将原始 token 序列映射为高维表示。通过架构搜索确定最优设计,包括:
- 池化操作:对比了 token-based pooling、mean pooling、concat pooling,最终选择能更好保留位置信息的池化方式。
- 编码粒度:以固定窗口(如 256 tokens)为单位进行局部编码,再全局聚合。
- 注意力掩码:使用特殊设计的掩码,允许编码器在窗口内双向注意力,同时限制跨窗口交互以平衡效率与质量。
- 适配器模块:在编码器输出和解码器输入之间插入轻量 MLP 或注意力适配器,对齐维度并注入任务信号。
- 重型解码器(4B 规模):接收压缩后的潜在嵌入序列,通过交叉注意力机制“解压”并生成最终文本。解码器本身是一个预训练的语言模型,通过持续预训练适配压缩表示。
训练策略
- 架构搜索:先在较小规模预训练多种编码器-解码器变体,在通用任务上评估,锁定帕累托最优配置。
- 持续预训练:使用超过 350B tokens 的文本数据,对选定的架构进行大规模持续培训。训练时采用辅助重建损失:解码器需从压缩嵌入重建原始文本片段,迫使潜在表示保存关键信息。
- 指令微调:在高质量 SFT 数据上微调,提升指令遵循能力。
推理阶段
长上下文一次性通过编码器生成压缩嵌入,解码器可直接以此作为条件生成回复,无需重复扫描原始上下文。对于长周期智能体任务,还支持自适应扩展:代理可基于压缩概览快速定位相关片段,再按需解压具体段落,平衡速度与精度。
与同类方法差异
不同于现有 KV 缓存压缩(需在线计算且质量损失明显)或早期编码器-解码器压缩(性能弱于 KV 方法),LCLMs 通过从严密的架构搜索和超大规模预训练中获得的“压缩先验”,首次在性能-速度-内存的帕累托前沿上全面超越 KV 缓存方法,同时天然兼容生产级推理引擎,无需为每个新提示重复压缩。
实验
实验设计
首先进行架构搜索,从头预训练多种编码器-解码器变体,探索池化算子、编码粒度、注意力掩码、适配器设计等关键超参数。依据搜索结果,选定 0.6B 编码器和 4B 解码器为基础架构。随后在超过 350B tokens 的持续预训练数据上,分别训练压缩比为 1:4、1:8、1:16 的模型,训练包括持续预训练、SFT 和辅助重建多个阶段。
关键发现
由此得到的 Latent Context Language Models (LCLMs) 系列显著改进了通用任务性能、压缩速度和峰值内存使用的帕累托前沿。在保持任务质量的同时,大幅降低了推理时的 KV 缓存内存占用,且压缩延迟优于传统方法。LCLM 还能作为长时域智能体的高效骨干:智能体先浏览压缩后的潜在上下文,再按需自适应地扩展相关片段,实现高效长程推理。
与基线对比
对比主流 KV cache 压缩技术(如 token dropout、窗口注意力等),LCLM 避免了键值裁剪导致的质量损失,也无需为每个新提示重复高开销的压缩计算。与先前的软标记压缩或编码器-解码器方案相比,LCLM 通过大规模预训练和架构优化,首次让这类方法在准确性-效率曲线上达到甚至超越 KV 方法,并与现代生产推理引擎更兼容。
行业影响
落地场景
LCLM 直接服务于所有需要超长上下文推理的工业场景:
- 长文档理解与问答:金融合同审查、法律文书摘要、科研文献综述,输入动辄数万至数十万 token,压缩后可在有限显存内完成快速检索与生成
- 代码智能:全仓库级代码补全、跨文件 bug 定位,可将数万行代码压缩为数百个潜在嵌入,让 decoder 获得全局上下文而无需截断
- 多模态 Agent 记忆:自动驾驶、机器人操作中积累的连续传感器流(图像、点云、轨迹),经编码器压缩为紧凑记忆库,供后续决策调用
- 对话系统:超长多轮客服对话,压缩历史轮次避免遗忘,同时控制响应延迟
商业价值
- 降本:推理时内存占用与 KV cache 大小解耦,在 1:16 压缩比下,4090 等中端 GPU 即可运行 100K+ token 提示,降低硬件门槛,尤其利于 SaaS API 服务的毛利提升
- 增收:性能超越同类 KV cache 压缩方法(如 H2O、StreamingLLM),在长上下文任务(如 GSM8K 长推理)上准确率损失更小,直接提升产品竞争力;开源模型(GitHub 已开放)可吸引生态贡献,间接推动商业版授权
- 体验提升:端到端压缩延迟远低于逐 token 动态剪枝,首 token 延迟显著缩短,适合实时交互产品(如 AI 搜索、对话式 BI)
与现有产品 / 工作流的接口
LCLM 可无缝嵌入主流推理框架:
- 与 vLLM / Hugging Face TGI 集成:作为自定义模型加载,编码器独立预计算压缩潜变量,解码器复用现有 KV cache 机制,无需修改推理引擎核心
- 与 LangChain/LlamaIndex 结合:作为长上下文索引器,将原始文档批量编码为潜变量存储,检索时动态扩展关键段,实现“摘要-细节”分层访问
- 与 Agent 框架衔接:压缩后的潜变量可作为 长期记忆模块 的载体,Agent 通过轻量解码器直接查询压缩历史,支持自适应扩展,无需反复进行全文 KV cache 重计算
具体落地用例
- 电商客服知识库问答:将数千篇产品说明书、售后政策压缩为潜变量库,用户提问时,压缩查询快速定位相关片段并扩展解释,减少每次完整重编码的开销,实现毫秒级响应与高准确率。
- 企业级合同审查:投行法务需要比对数百页合同与历史案例,LCLM 将全文编码为压缩记忆,支持多步推理后的关键条款提取,同时提供可扩展的原文锚点,避免遗漏细节。
LCLM 通过 架构搜索 + 大规模预训练 弥合了编码器-解码器压缩与 KV cache 压缩之间的效率-精度差距,为长上下文推理提供了一种即插即用的轻量级方案,有望成为下一代 LLM 推理栈的标准组件。
局限
- **固定压缩比的设计限制**:本工作仅探索并训练了 1:4、1:8 与 1:16 三种固定压缩比的模型,推理时无法根据输入内容动态调整压缩强度。对于信息密度差异巨大的长上下文(如混合大量无关片段与关键细节),固定压缩比可能导致信息丢失或冗余保留,缺乏自适应编码粒度。此外,不同下游任务对信息保真度的要求差异显著,固定压缩比难以兼顾,可能需要多模型部署或额外决策模块,增加系统复杂度。
- **大模型推理的基础成本**:尽管 LCLM 在编码器一侧使用 0.6B 参数,解码器仍为 4B,整体参数量并不低。在低资源部署场景(如边缘设备或实时服务),4B 解码器的 KV 缓存与计算开销仍然可能成为瓶颈,限制了该方案在极致低时延、低内存环境下的推广。且架构搜索与大模型持续预训练消耗 350B tokens 以上数据,复现或针对新领域定制亦需高昂成本。
- **评估范围较窄,泛化性有待验证**:实验主要在英文通用基准(如 GSM8K 等)和长上下文检索任务(NIAH)上评估,尚未覆盖多语言、代码生成、结构化数据理解等复杂场景。编码得到的潜在嵌入是否保留精确数值、命名实体等细粒度信息,以及对抗条件下鲁棒性如何,均未深入检验。缺乏与最新 KV 缓存压缩方法的直接延迟-精度对比(部分基线未涵盖),也削弱了对方法相对优势的全面判断。