论文

OCC-RAG: 面向忠实问答的最优认知核心

OCC-RAG: 面向忠实问答的最优认知核心

近年来,语言模型的进步主要由规模驱动,新模型将更多世界知识编码进参数中。然而,许多实际应用更依赖稳健推理而非大量参数知识。针对这一场景,任务专用小型语言模型(SLM)提供了更优的设计选择。本文提出最优认知核心(OCC),一个基于此理念的SLM系列。作为OCC的变体,OCC-RAG专为基于给定上下文的忠实问答优化,要求对给定段落进行多跳推理,同时忽略记忆知识。 训练OCC-RAG时,我们实现了一条新颖的合成管道,可大规模生成多上下文、多跳问答数据,产出了超过300万样本的语料库,聚焦多跳推理、严格上下文忠实性和校准式拒答。我们发布OCC-RAG-0.6B和OCC-RAG-1.7B两个模型,均在该语料上进行中期训练。模型生成带有来源引用的结构化推理痕迹,引用直接源于上下文字面引用。 通过在HotpotQA、MuSiQue、TAT-QA(多跳推理)、ConFiQA(忠实性)和MuSiQue-Un(拒答)等基准上的实验,OCC-RAG证明紧凑的任务专用SLM在性能上可匹敌或超越体积大2-6倍的通用模型,展现了任务专用化设计的潜力。

论文精读

TL;DR OCC-RAG 通过合成超三百万条多跳推理数据训练任务专用小模型,使 0.6B/1.7B 规模在忠实问答基准上匹敌甚至超越 2-6 倍参数量的通用模型。

问题

问题背景

当前检索增强生成(RAG)系统在工业界被广泛部署,忠实性(faithfulness)——即答案严格基于提供的上下文、不引入幻觉——正成为核心质量指标。通用大模型虽具备广博世界知识,但许多场景更需要强推理能力而非海量参数记忆。

现有方法的局限

  • 参数知识与上下文冲突:大型语言模型在预训练阶段吸收了大量事实,在 RAG 任务中常过度依赖内部记忆,输出与给定文档不一致的内容。
  • 多跳推理薄弱:通用模型面对需跨多个段落组合证据的问题时,容易漏掉关键连接,甚至跨越不相关的上下文生成答案,缺乏显式推理链。
  • 紧凑模型的性能缺口:小模型通常直接微调,缺乏专门针对多上下文忠实推理的中间训练(mid-training),在复杂 QA 上远落后于大模型,且无法可靠拒绝不可回答问题。

技术挑战与重要性

让一个小模型在多跳推理、忠实性和拒答三个维度同时超越数倍参数的大模型,面临三重挑战:

  1. 合成高难度数据:需自动构建包含复杂信息跳跃、跨段落支持证据以及不可回答陷阱的 QA 对,且保证证据链可追溯。
  2. 抑制预训练记忆:训练中必须强制模型忽略自身知识,仅根据上下文推断,这对常规训练范式是反直觉的。
  3. 结构化推理:输出不仅要正确,还要附带逐字引用的推理轨迹,使答案可审计。 该问题在医疗、法律、金融等对信息准确性要求严苛的领域尤为关键,直接关系到自动化决策的信任度。

行业类比

如同一个高速客服助手,必须从庞大的内部知识库中精确抽取并链接多条政策原文,给出有据可查的结论,而非凭“经验”猜测。

核心洞察

  • 中训练(mid-training)为小模型注入特定能力提供了一条高效路径,不同于传统微调或从头预训练。该工作在预训练基座上用大规模合成数据继续训练,既保留基础语言能力,又通过结构化推理格式和严格上下文忠实性约束,使小模型在多跳推理上达到甚至超越大模型。这挑战了仅靠微调无法深度改变模型行为的观念,并为实际部署中平衡性能与成本提供了新思路。
  • 通过知识图谱驱动的合成数据生成,OCC-RAG 系统地构建了多跳推理、强上下文忠实性和拒绝回答不可答问题的训练信号,而非依赖昂贵的人工标注。管道从单跳QA出发,利用KG抽取路径构造正反向问题和不可答复示例,再结合结构化推理追踪与源引证,确保模型学会“思考出声”并只依据上下文回答。这种方法不仅缓解了幻觉,还为 RAG 场景下的可解释性提供了工程范本。

方法

核心思路

OCC-RAG 是一个任务专用的小语言模型(SLM),专为基于上下文的忠实问答而优化。其设计原则是忽略记忆的参数化知识,严格依据所提供的多个文档片段进行多跳推理并给出答案。

输入与输出

  • 输入:一个开放式问题 + 一组关联的上下文片段(多个文档/段落)。
  • 输出:一个结构化的推理轨迹,包含步骤化的分析、直接抄录上下文的原文引用(作为来源证据),以及最终答案。若上下文不足以支持回答,模型会校准性地拒绝回答

关键模块:多跳 QA 数据合成管道

这是模型能力的核心来源。我们设计了一个新颖的自动化流水线,用于从大规模文本语料中合成数百万条训练样本,步骤如下:

  1. 知识图谱提取:从原始文档中抽取实体及关系,构建知识图谱,作为多跳问题的“骨架”。
  2. 路径采样与问题生成:在知识图谱上采样多跳路径,根据路径类型自动生成不同类别的问题(如桥接、比较、推理型),并确保每个问题必须依赖多个上下文片段的组合才能回答。
  3. 不可回答问题构造:通过故意引入信息缺失或不一致,生成模型需要拒绝回答的样本,训练校准的拒绝能力。
  4. 结构化推理格式生成:为每条训练样本自动生成符合阅读习惯的推理链,明确要求模型输出“分析步骤”和“原文引用”(literal quotes),并通过过滤保证质量。
  5. 数据混合与统计:最终得到超过 300 万条样本的训练集,覆盖多跳推理、严格上下文忠实性和精准拒绝三种技能。

训练方式:Mid-training

OCC-RAG 基于预训练的小参数基座模型(如 0.6B、1.7B),在上述合成数据集上进行mid-training(即介于预训练和指令微调之间的大规模持续训练)。训练时采用标准语言建模目标,但**格式化数据为“上下文+问题→结构化推理+答案”**的配对,强制模型习得读上下文、析推理、引证据、定答案的完整行为模式。训练细节包括使用特殊的格式标记分隔各部分,并混合不同任务比例的数据。

与同类方法的差异点

不同于直接使用千亿级通用大模型进行 RAG,OCC-RAG 通过专门的数据合成+mid-training让极小的模型(0.6B)在上下文忠实性、多跳推理和拒绝能力上达到或超越 2–6 倍大模型,证明了任务特化设计可以打破参数规模的垄断。

实验

实验设计

OCC-RAG 采用 mid-training 方案,在通用基座模型上继续训练约 300 万条 合成数据。数据生成管线包含三个关键步骤:

  1. 知识图谱构建:从维基百科等多源文档抽取实体与关系,形成结构化知识网。
  2. 多跳路径采样与问题合成:随机采样 2–4 跳路径,按预定义模板生成问题,确保答案严格依赖所有跳的上下文。
  3. 结构化推理格式注入:每条样本附带推理链与原文引用,同时构造部分无答案样本以训练拒绝机制。

评估在 多跳推理(HotpotQA、MuSiQue、TAT-QA)、忠实度(ConFiQA)和 拒绝(MuSiQue-Un)三个维度进行,与 0.6B–32B 通用模型(Qwen3、Gemma3、SmolLM3 等)对比。

关键发现

  • OCC-RAG-0.6B 在平均得分上显著超越同量级通用模型,甚至超过部分 6 倍参数 的模型(如 Qwen3-4B、Gemma3-4B);OCC-RAG-1.7B 表现接近或超越 8B–14B 级别。
  • 模型输出不仅给出答案,还附带 结构化推理轨迹 和原文引用,直接支撑事实核查与可解释性。
  • MuSiQue-Un 上展示出强拒绝能力,能识别上下文不支持的问题,避免幻觉。
  • 专用训练使模型完全 忽略内部记忆知识,只依据给定段落作答,极大提升上下文忠实度。

与基线的深度对比

通用模型在参数规模增加时,多跳推理能力虽有改善,但忠实度控制不佳,常混入内部知识,导致 ConFiQA 等指标下降。OCC-RAG 则通过数据设计将"引用原文"固化为行为模式,其 0.6B 版本在 TAT-QA 上甚至超越通用 8B 模型,说明任务专用的 SLM 在限定场景中可用极低成本实现同等甚至更好的可靠性。这种"小即最优"的思路对实际部署有直接工程价值:推理延迟和显存需求大幅降低,同时保证关键指标不妥协。

行业影响

落地场景

OCC-RAG 作为紧凑、任务专用的小语言模型(SLM),专为严格上下文忠实问答设计,尤其适合需高可靠多跳推理的领域。典型场景包括:

  • 企业知识库问答:法律、医疗、金融等领域的内部文档检索问答,要求答案严格依据给定上下文,且能处理多文档间的推理链。
  • 内容审核与合规检查:对比多份政策文件或合同条款,判断合规性,并生成带引用的判断依据。
  • 教育智能辅导:基于教材或参考材料解答学生疑问,需展示推理步骤和原始出处。

商业价值

  • 降本:OCC-RAG-0.6B/1.7B 的模型尺寸大幅降低推理算力需求,可在边缘设备或低成本服务器上部署,减少 API 调用费用。
  • 增收:高精度、带引用的忠实答案提升用户信任,可用于增值服务(如高级版搜索、AI 助手订阅),或降低因幻觉导致的法律与声誉风险。
  • 体验提升:结构化推理轨迹(<think> 块)与显式引用让答案可解释、可验证,减少用户核对成本;校准过的拒答机制避免输出不可靠信息,提升系统稳健性。

与现有产品/工作流的接口

OCC-RAG 可无缝集成到标准 RAG (Retrieval-Augmented Generation) 管线中,替代传统通用 LLM 作为“阅读器”:

  • 检索层:沿用现有向量数据库(如 FAISS、Weaviate)召回的候选段落。
  • 模型即插即用:通过标准文本生成 API 接受上下文与问题,输出包含推理链与引用的固定格式 JSON。
  • 后处理:解析 quote 字段映射回原始文档片段,渲染带高亮引用的答案界面。

具体用例

  1. 医疗问诊辅助:医生查询患者病史和最新临床指南。系统检索相关段落,由 OCC-RAG 多跳综合不同来源(如症状描述 + 用药禁忌)生成答案,并附上原文引用,支持临床决策。
  2. 金融研报问答:分析师询问“某公司本季度营收下降原因是否与原材料涨价和销量下滑同时相关?”。OCC-RAG 从财报和行业报告中联合推理,给出精确句子级引用,且当信息不足时明确拒绝回答,避免误导。

局限

  • 论文对模型泛化能力的评估有限。OCC-RAG在特定的多跳推理和忠实性基准上表现优异,但仅在这些合成数据驱动的任务上进行测试,未探索其在更广泛的自然语言理解任务(如情感分析、常识推理)上的能力。由于训练数据完全基于构建的上下文问答对,模型可能过度依赖提供的语境,丧失了通用语言模型的零样本能力,这限制了它在需要综合参数化知识和上下文推理的现实应用中的实用性。
  • 合成数据生成管道虽然高效,但引入了潜在偏差。知识图谱的构建和路径采样策略可能偏好某些关系类型,导致推理模式单一。当面对真实世界中多样化的、包含噪声或隐含信息的问题时,模型的结构化推理可能不准确或过于僵化。此外,强制产生引用的训练目标可能导致模型过度自信,即使在证据不足时也生成虚假引用,而不是正确拒绝回答。
  • 与现有小模型的对比不足。论文主要将OCC-RAG与尺寸更大的通用模型比较,缺乏与同量级任务特化小模型(如SmolLM、Phi系列)的直接对比。这使得难以判断性能增益是来自模型架构、训练数据还是任务特异性设计。同时,模型高度依赖上下文输入,不能利用内部知识进行推理,应用场景局限于检索增强问答,而无法处理无上下文的口语化提问或常识问答。
论文Maksim Savkin2026-05-30原文

相关内容