Wnuan: 面向专有企业知识的问答分阶段后训练
企业问答需要模型在不丧失通用能力的前提下获取专有知识。我们提出 Wnuan,一个三阶段流水线:从文档构建任务导向监督,通过通用数据重放进行监督微调,并对残余错误应用强化学习。 在包含 707 个问题的 WnuanBench 上,主 32B 路线的可接受答案率 (AAR) 从适应前的 52.76% 提升至 SFT 后的 80.06%,并在 RL 后达到 91.51%。在匹配的 100 次更新协议下,残余错误采样相比其他策略的优势明显: - 比全池随机采样高出 3.11 个百分点 - 比大小匹配随机采样高出 2.97 个百分点 源簇自举区间在两个对比中均保持为正,同域验证集也保留了该排序。整体路线的通用基准平均分下降了 5.17 个百分点,主要集中在指令跟随。自动评估集成与权威领域专家在分层 Wnuan-Inst 响应样本上的 90.5% 上达成一致。这些结果既说明了分阶段企业适应的收益,也揭示了其通用能力代价。
论文精读
TL;DR Wnuan 通过三阶段后训练(文档生成 QA 数据、带通用数据回放的 SFT 和残差错误强化学习),将企业专有知识注入模型,使可接受答案率从 52.76% 提升至 91.51%,并量化了通用能力代价。
问题
问题背景
在企业 AI 落地中,大语言模型 (LLM) 需吸收海量非公开的企业专有文档(如产品手册、政策文件),以支撑精准的即时问答,同时必须保留已有的通用推理、指令遵循与常识对话能力。
现有方法局限
当前主流方案存在两难:
- 检索增强生成 (RAG) 在知识密集且需多步推理时,常因检索精度不足或上下文窗口限制,导致答案片面或错误;
- 直接对私有语料进行全参数监督微调 (SFT) 极易造成灾难性遗忘,严重损害模型在通用指令上的表现。
此外,企业文档多为非结构化长文,缺乏现成的(问题,答案)对,人工构建昂贵且不可扩展。现有工作大多未能系统联动数据构造、遗忘抑制与错误修正,常顾此失彼。
为何困难且关键
核心困难在于私有数据有限性与通用知识广泛性的冲突:
- 小样本领域训练易过拟合,即使进行通用数据回放,也需精确控制数据混合比与训练步数;
- 强化学习 (RL) 阶段,如何定义域内奖励、筛选“残留错误”样本作为训练信号,尚无成熟共识。
工业场景(金融、制造、法律等)对答案权威性要求极高,一个过失答案可能引发合规风险或业务中断。因此,构建一个可复现、有统计保障的端到端适应流程,成为产研结合的迫切需求。
行业类比
这如同训练一名资深客服智能体,在阅读最新产品手册时,必须无缝保留处理退款、安抚投诉等标准服务能力——知识注入与能力留存需同步优化。
核心洞察
- **残差错误采样 (residual-error sampling)** 利用模型当前错误模式构建 RL 训练数据,相比全量池或等规模随机采样,在 **WnuanBench** 上将可接受回答率 (AAR) 额外提升 3.11 和 2.97 个百分点,source-cluster bootstrap 置信区间完全位于零以上,统计显著性稳健。该策略的核心差异在于:它不是用均匀覆盖的通用数据,而是聚焦模型尚未掌握的、与正确答案存在系统性偏差的样本,从而让 RL 更高效地纠正专属知识中的错误关联,为有限训练预算下的企业部署提供了数据效率优先的工程范式。
- 企业知识适配的通用能力折衷主要集中于 **指令遵循 (instruction following)**:32B 路线在 AAR 从 52.76% 提升至 91.51% 的同时,通用基准均分下降 5.17 分,进一步分析显示损失集中在 IFEval 等指令遵循评测,而非世界知识或推理能力。这一定量结果揭示了领域专用微调与通用对齐之间存在明确的性能权衡边界,提示工程设计中需针对性控制指令数据比例或使用 replay 缓冲,避免过于激进的领域训练破坏已有对齐能力,为安全落地提供可测量的决策依据。
方法
输入与目标
给定一组企业私有文档,要求在不显著损害通用能力的前提下,使模型能够准确回答关于这些文档的知识性问题。
方法概览
Wnuan 采用三阶段训练流水线,逐步将通用模型适配到企业知识域,并在每个阶段设计特定策略以平衡知识获取与能力保留。
阶段 I:文档到 QA 数据构建 (Document-to-QA Data Construction)
- 从原始文档自动生成任务导向的监督数据,核心包括问题生成和目标对齐的答案重写(reference implementation 中详述)。
- 构建的开发验证集和测试集WnuanBench(707 题)按分层抽样设计,覆盖多维度评估。
阶段 II:带通用数据重放的 SFT (Supervised Fine-Tuning with General-Data Replay)
- 使用阶段 I 生成的 QA 对进行监督微调,同时在训练批中混入通用领域数据(general-data replay),以减缓灾难性遗忘。
- 重放比例通过消融网格(replay grid)选定,在知识注入和保留之间取得均衡。
阶段 III:基于残差错误的强化学习 (Residual-Error RL)
- 在 SFT 模型基础上,对 WnuanBench 验证集上的错误回答进行采样,构建 RL 训练样本。
- 采用残差错误采样(residual-error sampling)策略:仅从模型当前仍答错的子集中采样,相比于全池采样或等量随机采样,在 100 步更新协议下分别提升 3.11 和 2.97 个 AAR 百分点。
- RL 算法使用 GRPO(Group Relative Policy Optimization),并配置特定的奖励函数(细节见附录 D)。
输出与评估
- 适配后,主路线 32B 模型的可接受回答率(AAR) 在 WnuanBench 上从 52.76% 提升到 SFT 后的 80.06%,再经 RL 提升至 91.51%。
- 通用基准平均分下降 5.17 分,主要集中在指令遵循能力,说明了专用化代价。
- 自动评估集成模型与权威领域专家在分层 Wnuan-Inst 样本上的一致性达 90.5%。
与同类方法的差异
相较于直接将 RAG 或全量微调应用于企业文档,Wnuan 的独特之处在于:(1) 自动构造高质量、答案风格对齐的 QA 数据;(2) 在微调中系统性地融入通用数据重放以平衡能力保留;(3) 用 RL 精准修正模型残差错误,且通过有效的数据选择(残差错误采样)最大化 RL 的增益。
实验
实验设计
实验围绕 Wnuan 三阶段流水线展开:1) 从企业文档自动构建任务导向的 QA 对,并对答案进行目标对齐改写;2) 在构建数据上执行 SFT,同时混入通用数据回放以减缓遗忘;3) 针对 SFT 后仍错误的 残差案例 进行 GRPO 强化学习。
核心评估在 WnuanBench(707 道企业领域问题)上进行,主要指标为 可接受答案率 (AAR)。对比条件包括:全量池采样、大小匹配随机采样,以及预训练基线的直接推断。同时监控通用基准集合上的性能变化,并通过 Wnuan-Inst 分层样本验证自动评估与领域专家的一致性。
关键发现
- AAR 三阶段跃升:从适应前的 52.76% 提升至 SFT 后的 80.06%,再经 RL 达到 91.51%,证明阶段式注入领域知识高度有效。
- 残差采样显著优于常规采样:在相同 100 次更新协议下,残差误差采样分别比全池采样和规模匹配随机采样高出 3.11 和 2.97 个 AAR 百分点,且通过源簇 Bootstrap 区间检验保持统计显著性。
- 通用能力有所下降但可控:通用基准平均分数下降 5.17 点,主要集中在指令遵循维度,通用知识保留相对完整。
- 自动评估高度可信:与权威领域专家在分层样本上的二值判断一致率达到 90.5%,支撑了大规模自动评估的可靠性。
与基线对比的深度解读
残差采样的成功在于将 RL 信号聚焦于模型当前的 薄弱点,而非在全量数据上平均分配优化力量。全池采样可能因监督信号分散而收敛缓慢,随机采样则容易遗漏关键错误模式。 残差采样 本质上是一种在线课程学习,优先学习模型尚不能正确回答的案例,在固定更新步数下效率更高。此外,通用数据回放 虽未能完全抵消遗忘,但保证了基本常识能力,使整体下降集中在指令遵循这类与企业知识耦合较弱的格式性能力上。这种权衡在私有知识适配场景中是可接受的,也为后续减少遗忘指明了优化方向。
行业影响
落地场景
Wnuan 方法直击企业知识问答的典型痛点:从保险条款解读、金融合规查询到电商售后政策检索,任何拥有海量专有文档的组织均可应用。典型场景包括内部员工知识助手(IT 支持、HR 政策)、对外客户服务机器人(产品说明书、退换货规则),以及需要严格溯源的合规审查系统。由于不依赖检索增强(RAG),在无法部署检索服务或对延迟敏感的场景下优势明显。
商业价值
通过三阶段后训练显著提升专有知识的回答可接受率(AAR 从 52.76% 提至 91.51%),直接转化为:
- 降本:减少人工客服对重复性文档查询的介入,降低支持团队人力成本;
- 增收:更准确的客户自助服务减少订单流失,提高转化;
- 体验提升:答案可信度上升,用户无需反复追问或查证,缩短问题解决时间。
通用能力平均下降约 5 分(集中在指令遵循),部署时需权衡领域专注度与通用交互质量。
与现有产品 / 工作流的接口
Wnuan 可作为现有 LLM 微调管线的插件式模块:
- 数据准备:Stage I 从企业文档自动构建问答对,替代或补充人工标注;
- 训练:Stage II 在 SFT 中混入通用数据重放(replay),可嵌入任何标准微调框架(如 Hugging Face Trainer);
- 强化学习:Stage III 使用 GRPO 对残差错误采样,与现有 RLHF 基础设施兼容。
评估方面,自动评判器与专家一致率达 90.5%,可作为 CI/CD 中的质量门禁,持续监控企业知识表现。
具体落地用例:
- 电商平台商家支持:将规则文档(发货时效、纠纷处理)经 Stage I 生成问答对,对基座模型进行三阶段训练,使机器人直接给出符合最新政策的回答,无需维护关键词规则库。
- 金融机构内部合规助手:训练模型理解反洗钱、KYC 文档,分析师提问时直接返回带条款引用的合规结论,降低人工查阅时间,保证回答一致性。
局限
- **通用能力下降**:论文明确承认,经过三阶段适配后,模型在通用基准上的平均得分下降 5.17 分,主要集中在指令遵循能力上。这表明企业在获取领域知识的同时,必须以牺牲部分通用能力为代价,对于需要同时维护多场景应用的企业是一个现实权衡。
- **评估范围与可推广性限制**:实验仅围绕单一企业知识库 `WnuanBench` 构建,且基准仅包含 707 个问题。虽然统计检验严格,但未在不同规模、不同行业的企业文档上验证该管线,也未探讨不同基础模型的影响。在缺少多领域、多模型对比的情况下,方法的可推广性存疑。
- **资源与工程复杂度**:管线涉及从文档到 QA 的自动构建、两阶段训练(SFT + RL)以及自定义评估,数据构建环节依赖 GPT-4 级别模型生成高质量监督信号,成本较高;RL 阶段需设计奖励函数和残差采样策略,调参和实验追踪成本较大,可能阻碍中小型团队的直接复现。