Industrial-Instruction: 一个从工业技术报告构建指令微调和基准数据集的端到端框架
工业技术报告蕴含维护、故障排除和产品工程方面的高价值知识,但其异构结构(密集的叙述、规格说明、表格)使得标准检索和问答管道难以索引与推理,且目前尚无基于此类文档构建的公开指令微调或基准数据集。我们提出 Industrial-Instruction 以填补这一空白,贡献包括:(i) 两个基于真实工业技术报告构建的开放问答数据集;(ii) 生成这些数据集的端到端流水线。 我们使用 906 份公开的松下文档(共 7,525 页),应用布局感知抽取、构建语义检索索引,并在五种查询-文档关系(无关检索、单/多文档支持、单/多文档答案)下,基于检索到的证据合成多项选择问答。经过对初始 23.9k 生成样本的过滤,每个数据集提供约 13.6k 个问答对,并附有源文档和保留的基准测试划分。对小型开放大语言模型(参数量低于 10B)进行微调,在松下基准上将 Set-Match Accuracy 从 28.5% 提升至 42.0%,F1 从 46.6% 提升至 63.5%。 我们发布了由同一流水线构建的两个并行版本:一个使用开放权重的 Qwen3-30B-A3B-Instruct 模型生成,另一个使用闭源、基于 API 的 Claude-Opus-4.6 模型生成,从而可直接比较开放模型与前沿模型的数据生成效果。Claude-Opus-4.6 数据集产生更干净的原始语料和更大的微调收益,但成本约高出两个数量级。MMLU 评估显示,在 Claude-Opus-4.6 数据上训练的模型几乎保留全部通用知识,而在 Qwen 生成数据上则出现轻微但可测量的遗忘效应。总体而言,这些数据集和流水线为从真实世界文档构建可扩展的工业基准和训练数据提供了一条实用、可复现的路径。
论文精读
TL;DR 发布 Industrial-Instruction:从工业技术报告构建开放指令微调与基准数据集,含13.6k个QA对及完整管道;微调<10B模型使准确率从28.5%升至42.0%,并对比开源Qwen3与闭源Claude生成数据质量。
问题
问题背景
工业技术报告承载着维护、故障排除和产品工程的高价值知识,但因其异构结构(密集文本、规格说明、表格混合),难以用标准检索和 QA 流水线直接索引和推理。
现有方法局限
- 传统 PDF 解析丢失布局信息,表格被破坏,导致后续检索召回率低。
- 通用 RAG 或 QA 模型未见过工业文档长尾分布,多文档推理能力弱。
- 缺乏基于真实工业文档的公开指令微调数据集和基准,现有合成数据多来自百科或网页,无法覆盖工业域的复杂查询-证据关系。
为什么这个问题难且重要
- 异构结构要求布局感知提取,同时保留文本和表格内容,构建语义索引。
- 合成 QA 需显式建模五种查询-文档关系(无关检索、单/多文档支持、单/多文档答案),否则模型无法学会区分证据缺失与多源支持。
- 数据质量直接影响微调模型的通用知识保留:低质量合成数据会导致遗忘,而论文中 Claude-Opus-4.6 生成的数据几乎不遗忘,但成本高两个数量级。业界需要可复现、可扩展的流水线,在开放与闭源模型间权衡。
行业类比
类似于从法律合同或医疗报告中提取结构化知识,构建领域专用 RAG 和微调数据,提升专业 QA 精度。
核心洞察
- - 首次构建面向**工业技术报告** 的指令微调与基准数据集,显式建模五种查询-文档关系(无关检索、单/多文档支持、单/多文档答案),使基准贴近真实 RAG 部署中的失败模式。与通用领域合成 QA 数据集不同,该流水线从真实工业 PDF 中布局感知提取异质内容(散文、规格、表格),并通过严格过滤将初始 23.9k 样本筛至约 13.6k,兼顾规模与质量。
- - 在同一流水线下分别用开源 Qwen3-30B-A3B-Instruct 与闭源 Claude-Opus-4.6 生成数据,首次定量对比开放模型与前沿 API 在数据合成中的质量-成本折衷。Claude 生成的数据原始语料更干净,微调后性能提升更大(Set-Match Accuracy 从 28.5% 到 42.0%,F1 从 46.6% 到 63.5%),且 MMLU 显示无通用知识遗忘,但成本高出约两个数量级。这为数据生成策略选择提供了直接实验依据。
方法
输入
原始工业技术报告 PDF(Panasonic 文档 906 份,共 7,525 页),包含密集散文、规格说明、表格等异构结构。
关键模块
- 布局感知抽取:使用 layout-aware 文本提取工具,保留文本与表格内容,将 PDF 转换为结构化文本块。
- 知识库构建与预处理:对文本块进行清洗、分块,并构建语义检索索引(基于 embedding 相似度),支持后续证据召回。
- QA 合成:针对五种查询-文档关系(无关检索、单文档支持、多文档支持、单文档答案、多文档答案),利用大模型(Qwen3-30B-A3B-Instruct 或 Claude-Opus-4.6)以检索到的证据为上下文,生成多项选择 QA 对(问题、选项、正确答案、证据来源)。
- 质量过滤:初始生成 23.9k 样本,经过过滤去除低质量、重复或事实不一致的条目,得到约 13.6k 高质量 QA 对。
- 数据集划分:每个数据集划分训练集与 held-out benchmark 测试集,并保留源文档引用。
输出
两个并行的工业指令数据集(各约 13.6k QA 对),分别由开放权重模型与闭源 API 模型生成;同时输出可复现的端到端 pipeline(代码已开源)。
与同类方法的差异
显式建模无关检索场景,并在同一 pipeline 下对比开放/闭源模型的数据生成质量与微调效果,为工业报告场景提供基准与训练数据。
实验
实验设计
从 906 份 Panasonic 公开文档(7,525 页)出发,采用 layout-aware 提取 与 语义检索索引,合成五类查询-文档关系的多项选择 QA。初始生成 23.9k 样本,过滤后约 13.6k QA 对,并划分 held-out benchmark 测试集。分别用 Qwen3-30B-A3B-Instruct 与 Claude-Opus-4.6 生成两套数据集,微调多个 10B 以下开源 LLM,在 Panasonic benchmark 评估 Set-Match Accuracy 和 F1,并在 MMLU 上评估通用知识保留。
关键发现
微调后 Set-Match Accuracy 从 28.5% 提升至 42.0%,F1 从 46.6% 提升至 63.5%。Claude 生成的数据集原始语料更干净、微调收益更大,但成本约高两个数量级。MMLU 评估显示 Claude 数据训练的模型几乎保留全部通用知识,而 Qwen 数据有轻微但可测量的遗忘。
对比解读
基线为未微调的小模型,在工业文档 QA 上表现较弱,说明通用预训练模型难以应对工业技术文档的异构结构。微调带来显著提升,但绝对分数仍偏低,任务挑战性高。Claude 数据质量优势转化为更大提升,但闭源 API 成本制约大规模应用;Qwen 数据成本低但引入轻微知识遗忘。Industrial-Instruction pipeline 提供可复现的端到端流程,使开源与闭源数据生成能公平对比,并为后续研究提供基准。
行业影响
落地场景
该框架可直接用于工业设备维护、故障排查和产品工程的知识助手。例如,预测性维护平台 可将传感器手册、维修指南等 PDF 通过 Industrial-Instruction 管道自动生成指令微调数据,训练一个 <10B 参数的模型,现场工程师通过自然语言查询故障代码获得多文档支撑的答案。另一场景是 工业客服机器人:设备制造商基于技术公告和规格表合成 QA 对,微调现有开源 LLM,处理售后咨询。
商业价值
- 降本:自动化 QA 合成替代领域专家手工标注,论文中 23.9k 原始样本过滤后得 13.6k,大幅降低数据成本。
- 增效:微调后模型在 Panasonic 基准上 F1 从 46.6% 提升至 63.5%,减少误判导致的停机;Claude-Opus-4.6 生成的数据通用知识保持更好,可避免重复训练通用模型。
- 体验:支持多语言和多文档推理,提升客户支持响应速度和准确率。
与现有产品/工作流的接口
- 作为 RAG 系统 的增强组件:提取的文档索引(语义检索)可与 FAISS / Milvus 等向量库对接,微调模型替换通用 LLM 作为生成器。
- 集成到 MLOps 流水线:文档更新时触发数据集再生和模型重训,使用 Airflow / Kubeflow 调度。
- 提供 基准评估:开源的 held-out benchmark 可用于模型选型,对比不同 LLM 在工业文档 QA 上的表现。
局限
- 数据集来源单一是主要局限。所有 QA 实例均来自 Panasonic 公开文档,尽管覆盖多种产品类型,但工业技术文档的格式、术语和领域知识差异巨大,流水线在汽车、航空、半导体等行业的泛化能力未经验证。后续研究需引入多来源、跨领域的工业报告,评估流水线的可迁移性和基准的普适性,否则可能高估框架的通用性。
- 生成模型偏差与成本问题突出。Qwen3-30B-A3B 生成的数据集虽成本低,但原始语料噪声更高,微调后 MMLU 出现小幅遗忘;Claude-Opus-4.6 生成的数据质量更好,但成本高出两个数量级,难以在资源受限环境中复现。此外,生成模型可能引入事实性错误或偏好,过滤机制无法完全消除,可能影响 QA 对的真实性和多样性。
- 鲁棒性不足是论文明确承认的共享局限。当检索上下文受到扰动时,模型性能下降明显,说明微调后的模型过度依赖给定的检索证据,缺乏对检索错误的容忍能力。实际工业部署中,检索阶段可能返回部分相关或完全不相关的段落,此时系统可靠性存疑。未来需要改进训练策略,例如引入噪声对抗训练或强化无证据时的拒绝回答能力。
- 实验仅使用 10B 以下的小模型进行微调验证,未测试更大的开源模型(如 13B、70B)或商业 API,无法评估该数据集对更强基座模型的边际收益。同时,基准测试仅采用多选题格式,缺少生成式回答评测,可能低估复杂工业推理能力的表现。