论文

基于工作流归纳的多轮智能科学文献搜索

基于工作流归纳的多轮智能科学文献搜索

科学文献搜索往往需要超越单次检索:用户的意图不明确、依赖偏好,并在交互中不断演化。现有的搜索代理通常依赖固定流水线或隐式的纯语言推理,导致搜索策略难以控制、检查和优化。 我们提出 PaperPilot,一种多轮文献搜索代理,将科学搜索建模为工作流归纳。给定一篇锚点论文和用户查询,PaperPilot 构建一个由论文搜索算子(包括关键词搜索、引用扩展、过滤、评分、重排序和证据提取)组成的可执行有向无环图。用户反馈随后用于优化查询及工作流本身。我们通过受监督的工作流模仿学习和基于受控工作流损坏的偏好优化来训练 PaperPilot。 实验表明,在多轮交互下,PaperPilot-9B 相比基础 Qwen3.5-9B 工具集代理取得显著提升:Hit@5 从 58.0 提升至 77.0,MRR 从 47.5 提升至 59.4,nDCG@10 从 26.8 提升至 32.5,同时工作流执行错误率从 9.5% 降至 0%。这些结果表明,显式、可编辑的搜索工作流为将文献搜索代理与复杂科学意图对齐提供了有效且可控的接口。

论文精读

TL;DR PaperPilot 将科学文献搜索转化为显式、可编辑的搜索工作流 DAG,通过工作流模仿和损坏偏好优化,在多轮交互中将 Hit@5 从 58.0 提升至 77.0,并完全消除执行错误。

问题

问题背景

科学文献搜索正从单次关键词检索向多轮、交互式发现演进,用户在探索过程中意图常不明确、依赖个人偏好并随对话逐步细化,这要求搜索代理不仅要理解模糊的查询,还要能基于反馈动态调整搜索策略。

现有方法局限

主流方案通常采用固定工具流水线(如关键词搜索→重排序)或让 LLM 在幕后进行隐式语言推理,这两类方法均存在明显不足:

  • 流水线僵化:搜索步骤无法根据用户意图的演化而动态重组,例如不能自动决定何时加入引用扩展或证据提取。
  • 策略不可解释与不可控:隐式推理将搜索逻辑隐藏在语言模型的黑箱中,用户和开发者难以检查、调试或复用搜索策略。
  • 多轮反馈利用不足:现有代理多仅改写查询文本,而忽略了搜索流程本身(如算子组合、参数调整)的结构化优化空间。
  • 工具集成易出错:普通工具代理在生成 API 调用时存在幻觉,原论文观察到基础代理有 9.5% 的工作流执行错误,例如调用不存在的函数或参数格式错误。

为何重要且困难

科学文献搜索的真实场景中,意图往往涉及“找一篇种子论文的所有相关扩展”“筛选高引用且方法相似的近期工作”等复杂逻辑,这相当于一个程序归纳问题——需要从有限的交互中推断出可执行的 DAG 结构,其中节点是关键词搜索、引用扩展、评分过滤等算子,边表示数据依赖。由于不同研究领域的检索模式差异巨大,且用户反馈稀疏,让模型学会从示例中归纳并动态修正工作流,同时保证生成流程的语法正确性与语义有效性,是工具增强型搜索代理面临的核心挑战。业界对可控、可解释的 AI 助手需求日益迫切,该方向直接关系到搜索代理能否实际落地。

与相近场景的类比:该问题类似对话式推荐系统中,将用户隐式偏好转化为一系列结构化过滤规则,并用反馈迭代细化规则图本身,而非仅调整单次推荐。

核心洞察

  • 将科学文献搜索转化为可执行的工作流归纳,实现搜索策略的结构化、可检查与可迭代优化。相比依赖固定流水线或黑箱语言推理的搜索代理,PaperPilot 通过 DAG 组合关键词搜索、引用扩展、过滤、评分等具体操作,不仅透明可控,还能通过用户反馈直接修改工作流结构,解决了复杂意图下的对齐难题。
  • 受控工作流损坏下的偏好优化训练,使得小模型也能生成零错误的可执行工作流。不同于通用工具代理的指令微调,PaperPilot 通过监督模仿和偏好优化,并故意引入工作流损坏来学习修复,将执行错误从 9.5% 降至 0%,显著提高了搜索结果的可靠性和指标(Hit@5 +19%,MRR +11.9%)。

方法

PaperPilot 将多轮科学文献搜索建模为 工作流归纳 任务,输入包含一篇 锚定论文 和一个用户查询。核心方法分三步:

  1. 工作流构建:模型生成一个可执行的 有向无环图,节点是预定义的 论文搜索操作符——keyword_search(关键字检索)、citation_expansion(引用扩展)、filtering(过滤)、scoring(评分)、reranking(重排序)和 evidence_extraction(证据提取)。这些操作符显式定义了检索、过滤和排序的整个过程,替代了隐式的单步推理。

  2. 多轮交互与反馈利用:用户对返回结果进行反馈(如标注相关/不相关),系统据此同时 细化查询调整工作流(如增删节点、改变顺序或参数),实现策略级优化,而非仅仅重排结果。

  3. 训练策略:通过两阶段训练提升工作流生成质量。

    • 监督工作流模仿:从专家构建的 DAG 中学习初始生成能力。
    • 偏好优化:故意引入受控的工作流损坏(如随机删除节点、颠倒顺序),比较损坏工作流与原始工作流的执行结果,再利用偏好对齐方法(如 DPO)训练模型区分好坏,从而大幅降低执行错误率(实验中将错误率从 9.5% 降至 0%)。

输出不仅包含排序后的论文列表,还提供一个可检查和编辑的显式工作流 DAG,使搜索过程透明、可控。

与固定流水线或纯语言模型隐式推理的搜索代理不同,PaperPilot 通过显式工作流将策略外部化,既允许用户直接干预,又通过偏好优化增强鲁棒性,为复杂科学意图的对齐提供了更可控的接口。

实验

实验设计

PaperPilot 使用 Qwen3.5-9B 作为基座,通过监督工作流模仿和偏好优化进行训练。实验模拟多轮交互的科学文献搜索场景:用户提供锚点论文和初始查询,系统通过可执行 DAG 工作流(如关键词检索、引用扩展、重排序)返回结果,用户反馈用于细化查询和工作流。评估在自建的多轮搜索数据集上进行,指标包括 Hit@5、MRR、nDCG@10 以及工作流执行错误率。基线为原始的 Qwen3.5-9B toolset agent,它直接调用工具而不生成显式工作流。

关键发现

  1. 检索性能显著提升:PaperPilot-9B 将 Hit@5 从 58.0 提升至 77.0 (+19.0),MRR 从 47.5 提升至 59.4 (+11.9),nDCG@10 从 26.8 提升至 32.5 (+5.7),表明工作流归纳有效地捕捉了用户复杂的搜索意图。
  2. 错误率降至零:工作流执行错误率从 9.5% 降至 0%,证明显式 DAG 使工具调用顺序与参数变得可控,杜绝了无效操作。
  3. 工作流可解释性:可编辑的 DAG 让用户可以检查和修正搜索策略,提升了交互可靠性和用户信任度。

基线对比深度解读

相比 Qwen3.5-9B toolset agent,PaperPilot 的核心差异在于将搜索过程形式化为可执行的 DAG,而基线仅依赖隐式的语言推理,导致工具调用易出错且难以优化。工作流归纳训练使模型学会生成正确的操作拓扑,偏好优化进一步对齐用户反馈。该对比揭示:对于多轮、偏好依赖的检索任务,显式结构化流程黑盒端到端推理 具有更强的泛化能力和错误恢复率,为构建可解释的 AI 研究助手提供了可复制的范式。

行业影响

落地场景

PaperPilot 的工作流归纳范式可嵌入学术搜索引擎 (如 Semantic Scholar、OpenAlex) 和企业知识管理平台 (如制药 R&D 知识库、专利检索系统)。多轮交互与显式 DAG 编排特别适合需要复杂检索策略的场景: 从一篇种子论文出发, 自动生成关键词扩展、引用链追踪、筛选与证据提取步骤, 支持研究人员迭代优化。此外, 科技情报分析开放科学平台引用管理工具 (如 Zotero) 也可集成此类可编辑工作流, 提升用户对搜索过程的透明度和控制力。

商业价值

降本增效线: 将文献调研从数小时的手动检索压缩为分钟级交互, 直接节约高价值科研人员的时间成本; 通过零执行错误的可靠工作流, 减少无效检索带来的算力浪费。对体验提升线: 显式工作流让用户可检查、修正搜索逻辑, 解决“黑盒检索”的信任问题, 从而提升用户粘性。对增收线: 为付费知识服务 (如 Scopus、Web of Science) 提供差异化功能, 通过更精准的文献推荐吸引机构订阅。

与现有产品/工作流的接口

PaperPilot 可封装为 LLM 工具调用代理, 挂载到现有搜索架构的后端。搜索算子 (关键词、引用扩展、重排等) 设计为 API 或检索插件, 通过 OpenAPI / LangChain Tool 协议对接。前端可提供可视化 DAG 编辑器, 允许用户拖拽调整算子顺序或参数, 或直接输入自然语言反馈来修改工作流。与 RAG 框架 (如 LlamaIndex) 的结合也较自然: 用 PaperPilot 工作流替代简单的向量检索, 增强证据提取的可靠性。

具体落地 Use Case

  • 制药早期研发: 药理学家有一篇关键论文, 需系统搜索某靶点的所有相关文献。PaperPilot 从该锚定论文出发, 自动生成「关键词扩展 → 引用图遍历 → 按年份/期刊过滤 → LLM 证据评分」工作流。用户反馈某篇误召论文后, 系统自动插入额外过滤条件, 最终输出高精度的文献列表, 支撑专利分析或实验设计。
  • 科技公司竞争情报: 工程师输入一篇竞品技术论文, 查询「有哪些类似工作?」。PaperPilot 构建的 DAG 包含多源搜索 (arXiv、专利数据库)、去重、语义重排。HR 或 R&D 主管可检查工作流, 确认覆盖了所有关键数据库, 并手动添加「排除某些机构」的规则, 确保情报报告无遗漏。

局限

  • - **依赖模拟用户反馈**:论文实验中使用用户模拟器生成交互数据(见附录C.2),真实用户的反馈往往更模糊、不一致且带有主观偏好,可能使工作流执行错误率高于报告的0%。此外,训练阶段的偏好优化依赖对工作流的受控破坏,这些破坏模式可能无法覆盖真实场景中的多样性。
  • - **模型规模与领域泛化未验证**:实验仅在9B参数的Qwen3.5上完成,未探索更大模型(如70B、405B)或不同系列模型(如Llama、Gemini)的效果。此外,论文未在冷门学科或非英语文献中测试,工作流操作符的预定义集合可能对新兴跨学科领域适应性不足。
  • - **工作流构建依赖人工定义的操作符**:所有纸本搜索操作(关键词搜索、引用扩展、筛选、评分等)需预先实现为工具,限制了搜索广度。对比现有端到端搜索智能体(如基于ReAct的灵活工具调用),PaperPilot的可控性以牺牲灵活性为代价,对于需要动态生成新搜索策略的复杂查询可能失效。
论文Jisen Li2026-07-01原文

相关内容