论文

DianShi-RxnDB:面向研究人员和 AI Agents、通过全自动流程构建的大规模细粒度有机反应数据平台

DianShi-RxnDB:面向研究人员和 AI Agents、通过全自动流程构建的大规模细粒度有机反应数据平台

高质量的结构化有机反应数据是发展 AI4Chem 的关键基础,但这类知识大量散落在专利文本、图像与反应路线图中。我们提出 DianShi-RxnDB,一个通过全自动抽取与归一化流程构建的大规模细粒度有机反应数据平台,整合了专利文本、图像与反应路线图三类来源。 其语料覆盖 USPTO 与 EPO 于 1976 至 2025 年间公开的有机合成专利,产出约 2400 万 条反应实例,其中约 1480 万条(61.7%) 通过自动质量校验。每条实例对应一次具体的单步实验,记录参与者、角色、用量、温度、反应时间、收率、实验步骤,以及与来源专利的溯源链接。 - 人工评估:抽取 1300 条合格实例,字段级微平均准确率为 92.95%。 - 与 Pistachio 的匹配对比显示,本平台在去重记录数、表示粒度与字段级精确一致度方面具有优势。 平台提供用于检索、筛选、比较与原文核验的 Web 研究工作台,以及提供可组合结构化检索工具的 Model Context Protocol (MCP) 服务,便于 AI agents 直接调用。DianShi-RxnDB 已开放:https://dianshi.opendatalab.org.cn/ 。

论文精读

TL;DR DianShi-RxnDB 从 1976–2025 年 USPTO/EPO 专利中全自动提取约 2400 万条有机反应实例,细粒度字段精度 92.95%,并提供 Web 检索与 MCP 服务,规模与质量优于 Pistachio。

问题

问题背景:AI4Chem 领域正加速将深度学习用于反应预测、逆合成设计,但训练和检索依赖的高质量结构化反应数据仍严重稀缺。

现有方法局限:现有有机反应数据集多依赖人工整理或半自动提取,覆盖面窄、更新慢,难以跟上专利文献的爆炸式增长。专利中的反应信息以文本描述、分子图像和反应方案等多种模态分散存在,传统流水线通常只处理单一模态,导致字段丢失或不一致。例如,文本中的用量、温度、时间等实验条件往往与图像中的结构信息分离,需要跨模态对齐;反应角色(反应物、试剂、溶剂、催化剂)的准确分类更是难点。商业数据集如 Pistachio 虽然规模较大,但在去重记录数、表示粒度和字段级精确一致性上仍有不足,记录冗余和来源追溯弱,限制了 AI 模型训练和验证的可靠性。

为什么这个问题难/重要:从 1976 年至今的 USPTO 和 EPO 专利中提取约 2400 万反应实例,其中 1480 万通过自动质检,要求每个实例涵盖参与者、角色、数量、温度、时间、产率、实验步骤和出处链接,字段级微平均准确率达到 92.95%,这需要端到端自动化流水线具备高精度 OCR、结构解析、实体识别和关系抽取能力。同时,AI 智能体(如基于 MCP 的检索工具)需要可组合的结构化查询接口,才能完成多步反应先例检索。业界对可溯源、细粒度、大规模的反应数据库需求迫切,直接关系到 AI4Chem 模型的落地效果。

行业类比:这与从海量非结构化文档中构建高质量知识图谱并服务于 RAG 问答系统的挑战类似,多模态抽取与溯源能力决定了下游 AI 应用的可靠性。

核心洞察

  • **全自动多模态流水线** 从专利文本、图像、反应式中提取并归一化有机反应数据,解决了化学专利数据结构化效率低、覆盖不全的痛点。与现有数据库如 Pistachio 相比,其记录去重后规模更大、字段粒度更细,且全程无人工介入,可扩展到数千万实例。这一设计让 AI4Chem 模型训练获得更丰富、可溯源的反应先例数据,显著降低人工整理成本。
  • **平台内置 MCP 服务** 将反应数据库转化为 AI agents 可组合调用的结构化检索工具,使大语言模型能通过多步检索直接获取精确反应条件与来源,而非仅依赖网页浏览。这种面向 AI agent 的数据产品设计,超越了传统数据库仅供人类查询的模式,为构建自主化学研究助手提供了基础设施,也启发了其他科学领域的数据平台如何适配 agent 化交互。
  • **自动质量检查与人工评估结合** 报告了 92.95% 的字段级准确率,并公开对比 Pistachio 数据集,提供了可验证的数据质量基准。从业者可据此筛选高质量反应实例用于训练或验证,避免低质量数据引入噪声。同时,自动检查通过率与人工抽样评估的分层策略,为大规模科学数据平台的质量控制提供了可复用的工程范式。

方法

DianShi-RxnDB 的构建方法是一条全自动流水线,从专利文献中提取并归一化有机反应数据。

输入:USPTO 和 EPO 1976–2025 年公开的有机合成专利,包括文本、图像和反应方案图。

关键模块

  1. 多模态提取:解析专利全文,同时从文本段落、嵌入式图像和反应方案中识别反应信息。图像中的反应方案通过 OCR 和化学结构识别技术转化为机器可读的 SMILES 或反应式。
  2. 反应实例结构化:将提取的反应分割为单步实验,识别反应参与者(反应物、试剂、溶剂、催化剂、产物),分配角色,并提取数量、温度、时间、产率、实验步骤等字段。
  3. 归一化与去重:对化合物名称、用量单位、条件术语进行标准归一化;基于反应 SMILES 和关键字段进行专利内和跨专利去重,保留唯一反应实例。
  4. 自动质量检查:通过规则和一致性校验过滤低质量记录,例如检查原子平衡、产率范围、角色冲突等,合格实例自动标记。
  5. 对外服务:将结构化数据存入数据库,提供 Web 研究台(搜索、过滤、对比、溯源)和 MCP 服务(供 AI agent 调用检索工具)。

输出:约 2400 万反应实例,其中 1480 万通过质量检查。每个实例包含完整字段集和专利出处链接。

与 Pistachio 等既有反应数据库相比,DianShi-RxnDB 的差异点在于全自动整合专利文本、图像和反应方案的多模态流水线,以及原生支持 AI agent 的 MCP 接口,同时提供更细粒度的角色标注和字段级溯源。

实验

实验设计

DianShi-RxnDB 构建了覆盖 USPTO 与 EPO 1976–2025 年有机合成专利的全自动提取流水线,从专利文本、图片与反应方案中抽取并规范化结构化反应实例。为确保质量,论文在约 2400 万原始实例中通过自动质检过滤得到约 1480 万合格实例,并随机抽样 1300 个合格实例进行字段级人工标注复核。同时与商业数据集 Pistachio Reaction Dataset 在去重规模、表示粒度、字段级精确一致性三个维度进行匹配对比。

关键发现

  • 自动质检通过率 61.7%(14.8M / 24M),表明大量噪声被有效过滤。
  • 人工评估微平均字段级准确率达 92.95%,覆盖参与者、角色、用量、温度、反应时间、产率、实验步骤与专利溯源等字段。
  • 相比 Pistachio,DianShi-RxnDB 在去重记录数、表示粒度与字段级精确一致性上均显示优势,但论文未给出具体差值。

基线对比解读

该工作本质上是一个数据基础设施,而非算法模型,因此“基线”是以 Pistachio 为代表的成熟反应数据库。其优势体现在:

  1. 表示粒度:每条记录对应单个单步实验,明确区分物质角色、过程参数与操作步骤,更适合 AI 模型的条件反应预测和 retrosynthesis 检索。
  2. 规模与去重:通过专利内去重策略整合文本、图片和方案中的重复记录,获得更大的去重后数据量。
  3. 可溯源:平台提供 Web 工作台与 MCP 服务,支持 AI agent 直接检索并回溯到源专利,这在 Pistachio 等商业数据中通常受限。

工程启示:构建 AI4Chem 数据平台时,跨模态专利解析与严格质检同样重要;提供给 agent 的 MCP 检索接口能显著降低从文献到结构化数据的接入成本。

行业影响

落地场景

DianShi-RxnDB 可作为化学研发的数据底座,服务制药、材料、精细化工行业的合成路线设计与反应预测。典型用例:药物发现阶段,AI 模型需要大量反应先例来训练逆合成与产率预测,企业可基于该平台快速构建内部反应知识库,供研发人员检索。在材料科学中,有机反应数据库支持新型分子合成路径推荐与工艺优化。

商业价值

核心降本:从专利文献自动提取结构化数据,替代人工录入与外包标注,节省数据工程成本。约 2400 万实例规模提升模型训练数据覆盖,缩短 AI4Chem 模型迭代周期。92.95% 字段级准确率降低数据清洗开销;来源可追溯满足合规与知识产权审查要求,间接降低法律风险。

与现有产品/工作流的接口

平台提供 MCP 服务,可被 LLM Agent 直接调用查询反应记录,适合集成到企业 AI 助手(如化学 Chatbot)中。Web 工作台作为研究人员人工校验工具。数据可通过 API 导出,对接 ELN(电子实验记录本)、LIMS 或内部数据湖。与 Pistachio 等商用库相比,去重记录更多、字段粒度更细,企业可在现有反应数据库之上叠加该平台作为补充数据源,通过数据管道定时同步。

局限

  • 数据源局限:仅覆盖 USPTO 和 EPO 的有机合成专利,未包含 WIPO、JPO 等其他主要专利局及非专利文献(期刊、学位论文),可能造成反应空间偏差,尤其对特定机构或区域的研究覆盖不足。自动化提取流水线对图像和 scheme 的解析仍存在错误,手动评估 field-level 准确率 92.95%,意味着约 7% 的字段存在错误,可能影响下游模型训练数据的可靠性。
  • 反应实例粒度和角色区分:论文将每个实例定义为特定单步实验,但多步合成中步骤拆分可能不准确,尤其对于串联反应、一锅多步反应等,角色(反应物、试剂、溶剂、催化剂)的判断可能混淆,导致反应条件归并错误。与 Pistachio 对比虽显示优势,但实际化学反应语义复杂,细粒度标签仍需人工校验。
  • 平台可用性和许可限制:数据许可为 CC BY-NC-SA 4.0,禁止商业使用,限制了工业界应用;MCP 服务提供的工具虽能支持 AI Agent 检索,但未提供批量下载或 API 全量访问,可能影响大规模训练场景。此外,Web 工作台功能尚属基础,缺乏高级可视化与反应预测集成。
论文Yubin Wang2026-09-06原文

相关内容