论文

Inject, Align, Recover: 用于免检索文档知识内化的分阶段后训练

Inject, Align, Recover: 用于免检索文档知识内化的分阶段后训练

大型语言模型在推理时若无法检索源文档,往往难以回答关于有限文档集合的问题。本文将这一设定研究为文档知识内化:将固定语料转化为可用的参数化知识,以支持免检索问答。为此,我们提出 IAR(Inject, Align, Recover),一种三阶段后训练框架,将结构化文档知识注入、问答行为对齐和通用能力恢复三个阶段相分离。 不同于传统的继续预训练,Inject 阶段将源文档转换为续写、改写和指令条件重建三种目标;随后,Align 阶段利用仅含答案的问答监督对注入后的模型进行适配;最后,Recover 阶段将领域适配模型与基础指令模型合并,以恢复通用能力。 在 Common Corpus (CC) 和 CCI 数据集上,以及 Llama、Phi、Qwen、SmolLM 模型家族中,IAR 提升了免检索文档内化的领域主-领域泛化前沿。在主对比实验中,相比 Vanilla SFT,IAR 在 8 组数据集-模型设置中的 7 组上,于全部四项指标上取得提升,领域问答准确率平均提升 3.6 个百分点,在 IFEval、MMLU 和 MSBench 上的平均通用性能提升 12.1 个百分点。扩展的 CC 基线表明,LoRA 和 FAPM 可在个别通用指标上占优,但在同时达到领先或接近领先领域内化的方法中,IAR 保持了最强的通用能力表现之一。

论文精读

TL;DR IAR 框架通过 Inject-Align-Recover 三阶段后训练,将固定文档集合转化为检索无关的问答能力,同时保持通用性能,在多个模型与数据集上领先。

问题

问题背景

当前 LLM 在封闭域问答中通常依赖运行时检索(RAG),但检索模块会引入延迟、基础设施依赖和隐私风险。研究重点转向文档知识内部化:将固定文档集合转化为模型参数内的结构化知识,实现无检索问答。

现有方法局限

主流做法是持续预训练(CPT)或直接 SFT。CPT 采用下一 token 预测目标,将文档视为普通文本序列,导致模型倾向续写而非回答查询,且知识提取效率低。SFT 直接用问答对微调,虽能提升领域准确率,但容易过拟合领域分布,导致通用能力显著退化(如指令跟随、推理和常识)。此外,两者都难以控制知识注入与行为对齐的耦合,训练后期常出现灾难性遗忘。

为什么这个问题难且重要

核心挑战在于领域知识内化与通用能力保持的前沿面。模型参数容量有限,新知识会覆盖原有知识,造成遗忘;同时无检索场景要求模型在推理时精确回忆文档细节,对参数化存储的准确性和可访问性要求极高。业界关注度持续上升:企业知识库、离线助手、端侧设备等场景需要低延迟、隐私友好的问答能力,而现有方法往往在领域精度与通用性能之间顾此失彼。

行业类比

类比于设备端个人助理在断网环境下访问用户私有文档:既要将关键信息压缩进模型,又不能牺牲日常对话与指令跟随能力。

核心洞察

  • 三阶段解耦是解决文档知识内化中领域性能与通用性能权衡的关键。传统 continued pretraining 或 SFT 将文档注入与任务对齐混在一起,容易导致通用能力灾难性遗忘;IAR 显式分离 Inject、Align、Recover,使各阶段目标单一,并通过模型合并恢复通用能力,避免了在领域数据上继续训练带来的干扰。
  • Inject 阶段使用 continuation、rewrite、instruction-conditioned reconstruction 等多目标替代 plain next-token 预训练,更结构化地将文档内容转化为可调用的参数化知识,为后续 QA 对齐提供更优初始化,这是与朴素 CPT 的本质差异。
  • Recover 阶段采用模型合并而非继续训练来恢复通用能力,简单且有效。与 LoRA、FAPM 等参数高效方法相比,IAR 在保持领域内化领先的同时,通用性能损失更小,为实际部署中平衡专用模型与通用模型提供了可操作的工程范式。

方法

输入与目标

IAR 面向检索自由文档知识内部化场景:给定一个固定且有限的文档集合(如 Common Corpus / CCI),模型在推理阶段不检索任何外部文档,仅依靠参数回答关于该集合的问题。

三阶段关键模块

  1. Inject(注入):将源文档转换为多种重建目标,包括 continuation、rewrite 和 instruction-conditioned reconstruction 任务。与常规继续预训练(CPT)只做下一 token 预测不同,Inject 迫使模型在指令约束下重组文档内容,从而将结构化知识更高效地写入参数。

  2. Align(对齐):在注入后的模型上,仅使用 answer-only QA supervision 进行监督微调。此阶段不提供完整思维链或文档片段,只训练模型直接输出最终答案,使行为对齐到检索自由问答模式。

  3. Recover(恢复):将领域对齐后的模型与基础指令模型进行合并(merge),以恢复在 Inject/Align 阶段可能损失的通用能力(如指令遵循、常识推理)。合并策略保证了模型在域内准确率与域外泛化之间的平衡。

输出

最终得到一个参数化文档知识内部化模型,无需检索即可回答目标文档集相关问题。在 CC 和 CCI 数据集上,IAR 在 8 个模型-数据集设置中的 7 个同时提升域内 QA 准确率(平均 +3.6 个百分点)与通用能力(IFEval / MMLU / MSBench 平均 +12.1 个百分点)。

与同类方法差异:IAR 将知识注入、行为对齐和能力恢复显式分离,并在 Inject 阶段采用多任务重建而非单一语言建模,因此能在不牺牲通用能力的前提下更有效地内部化文档知识。

实验

实验设计

  • 在 Common Corpus (CC) 与 CCI 两个文档语料上,覆盖 Llama、Phi、Qwen、SmolLM 四个模型家族,评估检索无关的文档知识内化 效果。
  • 主要基线为 Vanilla SFT,扩展对比 LoRA 与 FAPM;指标包括领域 QA 准确率与 IFEval、MMLU、MSBench 三项通用能力。

关键发现

  • IAR 在 8 个数据集-模型设定中的 7 个场景,四项指标全面超越 Vanilla SFT。
  • 平均而言,领域 QA 准确率提升 3.6 个百分点,通用能力均值提升 12.1 个百分点。
  • 扩展 CC 基线显示,LoRA 与 FAPM 能在个别通用指标上取胜,但 IAR 在保持领先或接近领先的领域内化同时,通用能力仍属最强之列。

跟基线对比的深度解读

  • 相较于 Vanilla SFT 直接做问答监督,IAR 的 Inject-Align-Recover 三阶段分离设计,将知识注入、行为对齐与能力恢复解耦,避免单一阶段导致的灾难性遗忘。
  • LoRA 与 FAPM 等参数高效或冻结部分参数的方案,可能在通用能力上有所保留,但领域内化上限较低;IAR 通过 Recover 阶段与基础指令模型合并,兼顾领域与通用能力,因此整体 frontier 更优。

行业影响

落地场景

IAR 适用于封闭文档集问答,即文档集合固定、更新频率低、需要高频访问的场景。典型产品包括:

  • 企业知识库助手:内部政策、产品手册、合规文档问答。
  • 智能客服:面向特定产品线的 FAQ 和技术支持。
  • 垂直领域助手:如医疗设备操作指南、金融法规解读。

这些场景下,推理时无需连接外部检索系统,降低延迟和运维复杂度。

商业价值

  • 降低成本:省去向量数据库、索引构建和检索服务的开发与运维成本;减少 prompt 中拼接文档带来的 token 消耗。
  • 提升体验:低延迟响应,避免检索错误导致的答非所问。
  • 可扩展:模型作为单一服务部署,无需维护检索链路,适合高并发场景。

论文主实验显示,IAR 在领域 QA 准确率上比 Vanilla SFT 平均提升 3.6 个百分点,同时通用能力(IFEval、MMLU、MSBench)平均提升 12.1 个百分点。

与现有工作流集成

IAR 可作为 post-training 流水线的一环:

  1. 从现有 instruction-tuned 模型(如 Llama、Qwen)出发,使用 Inject 阶段注入文档知识。
  2. 用 Align 阶段对齐 QA 行为,仅需少量领域 QA 数据。
  3. 通过 Recover 阶段与基座指令模型合并,恢复通用能力,输出可直接部署的统一模型。

无需额外检索组件,可直接替换现有 RAG 系统中的 LLM 部分,或作为独立问答服务上线。

具体用例

SaaS 客服机器人:某企业服务软件提供商需要为客户提供产品文档问答。使用 IAR 将最新版用户手册内化到 7B 模型,用户在帮助中心提问时,模型直接基于参数化知识回答,无需后端检索,响应时间从 ~2 秒降至 100ms 以下,同时支持多语言。

医疗器械操作支持:某医疗设备公司为手术机器人提供离线操作指导。通过 IAR 内化操作手册和安全规范,模型嵌入设备本地推理,在无网络环境下提供即时合规回答。

局限

  • IAR 的三阶段流程显著增加了训练复杂度和工程开销。相比单阶段 SFT 或 CPT+SFT,IAR 需要为 Inject 阶段设计 continuation、rewrite 和 instruction-conditioned reconstruction 三种目标,并在 Align 后通过 Recover 与基础指令模型合并。这引入了更多超参数(如各阶段学习率、token 比例、合并系数等)和阶段间协调成本,对于资源有限的团队不太友好。Recover 阶段的模型合并策略依赖经验性选择,其最优比例或方法可能需要针对具体任务重新搜索,通用性有待验证。
  • 实验覆盖的模型规模与数据多样性仍有限。论文在 Common Corpus (CC) 和 CCI 上,评估了 Llama、Phi、Qwen、SmolLM 等中小模型,但未涉及 70B 以上大模型或更多领域语料。由于文档知识内化对模型容量和语料特性敏感,IAR 在不同规模、不同领域数据上的泛化性尚不明确。此外,在 8 个数据集-模型组合中仅 7 个实现四项指标全面超越 Vanilla SFT,说明存在条件依赖;与 LoRA、FAPM 等扩展 baseline 对比也显示 IAR 并非在所有通用能力指标上均最优,只是在整体 frontier 上更均衡。
  • 论文未深入讨论知识内化的潜在风险与更新机制。将文档直接注入参数可能导致模型在检索缺失时生成看似合理但错误的内容,且难以追溯来源;同时内部化知识可能随时间过时,而 IAR 未提供增量更新或遗忘机制。Recover 阶段虽然恢复了部分通用能力,但长期部署中如何在不损害已注入知识的前提下更新模型或撤销错误知识仍是未解决的问题,这限制了其在动态知识场景下的实用性。
论文Qian Kou2026-08-20原文

相关内容