论文

LatentPort:超越 KV Cache —— 混合语言模型中循环记忆的跨模型迁移:无需目标前缀重放的 4B 到 9B 混合状态交接

LatentPort:超越 KV Cache —— 混合语言模型中循环记忆的跨模型迁移:无需目标前缀重放的 4B 到 9B 混合状态交接

一个语言模型能否把在线记忆 移交给另一个模型,而接收方无需重读上下文?我们在一个架构匹配的 Qwen3.5 4B-to-9B 同源模型对上,展示了可用的持久混合状态 迁移。据我们所知,这是首次在规模不同的混合语言模型之间完成持久循环推理状态的跨模型交接,且无需目标前缀重放。 仅迁移 attention KV 会留下明显缺口;加入 Gated DeltaNet (GDN) 持久状态包后,teacher-forced 负对数似然(NLL)下降 0.747 nats/token(95% 配对文档 bootstrap CI [0.6921, 0.8047]),64 篇 PG19 文档 全部改善。直接复用循环与卷积状态优于所测试的学习式 GDN 映射,与持久状态坐标存在部分功能兼容性 相符。新的组件析因实验最终选定「翻译 KV + 直接循环与卷积状态」。 一个额外 434,176 参数 的校正模块在 64 篇新 web 文档上进一步改善该基座:continuation loss 仅比原生 9B 高 0.076 nats/token(超额 NLL),Jensen-Shannon(JS)散度为 0.022,原生上下文恢复率(NCR)达 0.918。校正后的 9B 显著优于 继续推理的 4B,且处理零个历史前缀 token。 证据仅覆盖一个方向、一对几何匹配的 Base 模型,以及 4K teacher-forced 续写;near-native gate 未通过,16K 分支未运行,自由生成等价性与通用状态接口仍有待证明。

论文精读

TL;DR 首次在架构匹配的 Qwen3.5 4B→9B 混合模型间,不重放目标前缀直接交接 Gated DeltaNet 递归状态,配合 434K 参数修正使 9B 续写接近原生水平(NCR 0.918),证明跨模型持久记忆可移植。

问题

当前 LLM 推理与上下文缓存优化高度关注 KV cache 复用 与 跨模型状态迁移,目标是在长上下文、高并发场景下避免重复计算 prefix 带来的算力与延迟开销。

现有方法的主要局限是只迁移 注意力 KV cache,把源模型键值缓存投影到目标模型维度后直接注入;但现代混合架构(如 Qwen3.5 使用的 Gated DeltaNet)还维护 persistent recurrent state 与 convolutional state。这些状态同样编码历史 token 信息,仅迁移 KV 会让接收模型丢失线性注意力分支的时序记忆,在 continuation loss 上出现明显 gap。此外,本工作发现已有的 learned GDN maps 效果不如直接复用 recurrent/convolution state,说明跨尺寸模型间学习型映射在功能对齐上并不稳定。

这一问题的难度在于不同尺寸模型的隐藏层宽度、状态维度不同,且 recurrent state 并非逐元素对齐,需要判断哪些组件可直接复制、哪些需要投影或行为校正。工业界关注该方向,因为模型热升级、在线路由到更强模型、以及长会话上下文共享都要求低开销传递运行中记忆。本工作证明 混合状态包 传递比纯 KV 更接近 native 性能,为通用 state interface 提供了实证。

这类似于把正在交互的用户会话状态从一个推理实例无损切换到一个更大的模型,避免重新推送全部历史消息与重算 prefix。

核心洞察

  • 跨模型迁移混合状态(注意力 KV + 循环状态)比仅迁移 KV 显著降低损失,且直接重用循环状态优于学习映射,表明混合模型的持久状态坐标具有部分功能兼容性。传统跨模型知识迁移依赖 token 重放或参数蒸馏,本文展示了无需重放前缀即可传递“运行中”的推理状态。直接重用 GDN 循环和卷积状态比训练多层映射更有效,说明架构匹配的模型间可能存在共享的潜在状态空间,这对设计模型间状态接口有工程启示:优先利用结构一致性,而非盲目学习变换。
  • 通过极少量参数(rank-4 修正,434K 参数)的适配,零前缀交接的 9B 模型延续损失仅比原生 9B 高 0.076 nats/token,且显著优于继续推理 4B,证明小规模状态适配可实现近原生跨模型续写。该结果将“状态交接”从概念推向可部署:在架构匹配但尺寸不同的模型间,仅需微调一个低秩修正就能将大模型无缝接入小模型已处理的上下文,无需重新计算前缀。这为动态路由、模型升级或负载均衡提供了新的推理系统原语,但当下仅在单一方向、单一模型对和 4K 上下文验证,通用性待检验。

方法

输入

  • 源模型 Qwen3.5 4B 在给定前缀上完成前向传播,产生两类状态:注意力 KV cache 与 Gated DeltaNet (GDN) 持久状态包(含循环状态与卷积状态)。目标模型 Qwen3.5 9B 需要接续生成,但不接触任何原始前缀 token。

关键模块

  1. 组件翻译与直接复用:注意力 KV 通过学习的映射(translated KV)适配宽度差异;GDN 的循环与卷积状态直接复用,避免学习映射。实验表明直接复用优于训练得到的 GDN 映射。
  2. 组件因子选择:通过 component factorial 确定最优组合为“translated KV + direct recurrent + convolution state”。
  3. 附加行为校正:在基础 handoff 之上,叠加一个 rank-4 的轻量校正模块(434,176 参数),基于 64 个 fresh web documents 训练,进一步缩小与 native 9B 的差距。

输出

目标 9B 模型以 teacher-forced 方式继续生成,指标接近原生 9B:excess NLL 0.076、JS 0.022、NCR 0.918,且显著优于继续使用 4B 推理。

与同类方法的差异:LatentPort 将持久循环状态作为一等公民直接跨模型转移,而非仅迁移 KV cache 或强制对齐隐藏状态。

实验

实验设计

在架构匹配的 Qwen3.5 4B → 9B 同源模型对上验证跨模型混合状态交接。源模型 4B 处理完 prefix 后,其 KV cache 被翻译至目标维度,Gated DeltaNet (GDN) 的 recurrent 与 convolution 状态直接复用或经学习映射注入 9B。在 PG19 的 64 个文档上做 4K teacher-forced continuation 评估;另在 64 个 fresh web documents 上测试额外 rank-4 校正(434,176 参数)。基线包括目标原生 9B、仅翻译 KV、持续 4B 推理。

关键发现

  • 仅翻译 KV 后 NLL 仍有较大差距;加入 GDN 状态包使 NLL 降低 0.747 nats/token(95% CI [0.6921, 0.8047]),全部 64 文档改善。
  • 直接复用 recurrent/convolution 状态优于学习映射,说明持久状态坐标具有部分功能兼容性。
  • 校正后 9B 在 fresh web 上 excess NLL 为 0.076 nats/token、JS 散度 0.022、NCR 0.918,接近原生 9B,并显著优于继续 4B 推理,且处理 0 个历史 prefix token。
  • 限制:near-native gate 未通过,16K 分支未运行,自由生成等价性与通用状态接口仍未验证。

基线对比解读

翻译 KV 是必要但远非充分的条件;GDN 持久状态贡献了大部分增益,凸显循环记忆在上下文迁移中的核心价值。直接复用优于学习映射表明不同尺寸 sibling 模型间存在可迁移的状态几何,无需重新学习投影。校正模块使性能贴近原生 9B,但仍有 0.076 nats/token 的 excess NLL,说明小参数量适配无法完全消除架构差异。与继续 4B 相比,校正 9B 优势明显,证明状态迁移能保留大模型容量优势,同时避免重放 prefix 的推理开销。

行业影响

落地场景

跨模型记忆交接 可直接用于 LLM 网关/Agent 编排:小模型持续处理长上下文或低优先级流量,将 KV cache 与 Gated DeltaNet (GDN) 递归状态 打包转移给大模型,无需重放历史前缀。典型场景:

  • 电商客服:先用 4B 模型实时响应常见咨询,遇到复杂售后或风险投诉时动态切换 9B 模型,状态瞬时继承,用户无感。
  • 内容平台长文生成:小模型流式摄入用户写作前文,大模型按需接管续写或润色,跳过重复 prefill 计算。

商业价值

  • 降本:省去目标模型对历史前缀的 prefill 计算,长上下文场景下显著降低 GPU 时间与 token 成本;小模型承担预计算,推理成本可下降。
  • 体验提升:切换延迟接近原生,NCR 0.918、excess NLL 0.076,对实时交互类产品具备可用性。
  • 增收:支持多模型 tier 无缝协作,提高大模型实例吞吐与负载均衡效率。

与现有工作流的接口

现有 vLLM / TensorRT-LLM 等推理栈已支持 KV cache 序列化;本工作在此基础上扩展 persistent recurrent state package。集成时可新增 state export/import API,由模型路由层决定何时执行 4B→9B 交接。需要注意:当前仅验证 架构匹配 的 hybrid model 对(Qwen3.5 4B/9B),且 near-native gate 失败、自由生成等价未证明,落地初期应限制在 teacher-forced 续写或低风险任务。

局限

  • **实验覆盖范围高度受限**:论文仅验证了一个方向(`4B → 9B`)、一对几何匹配的 **Qwen3.5 Base** 模型,以及 **4K token** 的 teacher-forced continuation。摘要明确承认 **near-native gate failed**、**16K branch 未运行**,且 **free-generation equivalence** 和通用 **state interface** 均未得到证明。这意味着当前结论可能无法外推到更长上下文、自由生成场景或其他模型组合,实际部署时对门控机制和长度扩展的鲁棒性存疑。
  • **方法依赖架构匹配与直接状态重用**:论文选取的是架构匹配的 sibling pair,直接复用递归与卷积状态表现出优于学习映射的性能,但这强烈依赖 **partial functional compatibility** 的假设。对于不同架构、不同训练分布或不同隐藏维度的模型,坐标空间的对齐可能失效,且 rank-4 correction 仅注入 434,176 参数,针对更复杂的跨架构映射可能需要更强的适配器或额外训练,这削弱了方法的通用性。
  • **对比基线与成本收益不完整**:虽然相对纯 KV 缓存翻译提升明显,但 corrected 9B 的 excess NLL 仍为 `0.076 nats/token`,高于 native 9B,且论文未系统对比 **target prefix replay**、**full fine-tuning** 或已有 cross-model KV 翻译方法的组合效果。同时,状态传输过程中的计算开销、存储成本和延迟影响(如 GDN 包的序列化与反序列化)未量化,工程上是否优于简单的 context re-read 仍不清晰。
论文Simon P. Villani2026-09-07原文

相关内容