论文

OpenBioRQ:面向智能体的未解生物医学研究问题

OpenBioRQ:面向智能体的未解生物医学研究问题

当前的智能体模型很少捏造引用(超过 99% 的可解析链接),但约 15.9% 的引用指向错误论文。现有基准未捕捉这一失败模式:当问题有固定答案键时,模型可重现预期来源而非独立验证。 为此,本文引入 OpenBioRQ——一个包含 12,553 个未解决生物医学研究问题、覆盖 12 个领域的检索驱动智能体基准,将开放问题视为忠实性与弃权探针。这是首个结合智能体设置(需多次工具调用)与无答案键未解决问题的生物医学基准。开放性通过真实后续证据而非模型参数知识验证,难度锚定于三个开放权重参考模型均失败的问题。 在最难子集上,同系列保留模型仅解决约 17%,而三个独立前沿智能体(Gemini-3-Pro、Opus-4.7、GPT-5.5)表现范围达 29-60%。基准难度高、未饱和(最佳模型仍有 33-40% 未解决),且能有效区分能力层级。此外,观察到智能体崩溃现象:在最困难问题上,智能体停止使用工具。对最易崩溃模型,完全阻止工具访问几乎不改变分数。采用冻结的每问题检查表可将评估者间一致性从 Spearman 0.35 提升至 0.82。

论文精读

TL;DR OpenBioRQ 用无答案键的未解决生物医学问题,测试智能体引用真实性与工具使用,发现前沿模型约 15.9% 的引用链接错误,并在难题上出现“智能体崩溃”,为忠于事实的推理提供了硬性探针。

问题

当前 AI 领域日益重视 agentic models 的自主检索与来源验证能力,尤其是在对事实准确性要求极高的生物医学场景。传统基准(如 PubMedQA)依赖固定答案键,模型可以从答案键反推预期来源,而非真实进行检索验证;这导致一种关键失败被掩盖——引用链接可解析,但论文内容并不支持所述主张。作者发现,现有模型虽极少虚构引用(>99% 可解析),却有 15.9% 的引用指向错误论文,这种“错误引用”是现有基准的盲区。

为何难且重要

开放性问题无标准答案,要求模型从真实文献中独立收集证据并判断充分性,而非匹配预设标签。基准以三个参考模型无法解答的问题集为难度锚点,避免了主观硬度标注,且确保基准具有高难度、非饱和性(最强模型仍遗留 33–40% 问题未解决)。在最难子集上,观察到 agentic collapse——模型停止调用工具,即使禁止工具访问分数也几乎不变,说明工具在亟需的情境下并未发挥作用。这种失效模式揭示了当前模型在复杂推理链条与工具协调上的深层短板。

类比现实应用:如同自动驾驶系统对罕见“长尾”场景的应对,agentic 模型在需要深度验证和工具配合的开放问题上仍显脆弱,这直接制约了 AI 在高风险决策中的可靠部署。

核心洞察

  • **未解决研究问题作为 faithfulness 与 abstention 探针**:传统生物医学 QA 基准提供固定答案键,模型可直接从答案键逆向推断“应该引用哪篇论文”,而非真正验证来源支撑声明。OpenBioRQ 以仍无定论的开放问题构造测试,迫使模型在无答案可作弊时自主执行检索与证据核实,从而精准测量模型何时应弃权(abstention)以及答案何时有据可查(faithfulness)。这一设计弥补了现有基准对引用事实性检验的结构性盲区。
  • **错误论文引用(15.9% 的 L2 失败)是比引用不存在更隐蔽且后果更严重的问题**:以往评估几乎只关注引用是否解析(L1 存在性),而忽略了链接到的论文内容是否真正支持声明(L2 内容支持)。该工作发现,尽管模型几乎不编造引用(解析率 > 99%),但约 15.9% 的引用指向了不相关的错误论文。这种“看似存在实则无关”的模式极易误导使用者,尤其在医学领域可能造成事实性偏差的扩散,因此必须将 L2 验证纳入 agentic 系统的质量门槛。
  • **Agentic collapse:工具在最关键处失效**:在最难的 open-hard 子集上,模型不仅解题率骤降,还显著减少工具调用,形成“难度越高,工具使用越少”的反直觉崩溃。对最严重受影响的模型,直接禁用工具后分数几乎不变,表明工具收益恰在需求最迫切的困难问题上趋近于零。这暗示现有训练范式下模型对不确定性采取退缩策略而非主动检索,对工程实践的启示是需要设计机制在模型倾向于放弃搜索时强制或激励工具调用,以对抗 collapse 模式。

方法

基准构建:从开放问题到检索基底 Agent 评估

输入:项目从 NIH RePORTER、PubMed 等公开渠道爬取12 个生物医学领域(如癌症生物学、神经科学、心血管疾病等)的研究提案与文献,提取出其中尚未解决、无现成答案的科研问题,形成原始问题池。

关键模块

  1. 自含性审计与检索基底开放性验证

    • 自含性审计:确保每个问题所必需的背景信息(如实体定义、实验上下文)直接包含在题干中,Agent 无需额外常识即可理解。
    • 两阶段开放性验证(检索基底开放性):第 1 阶段自动检索相关文献证据,第 2 阶段由 LLM 基于检索到的证据重新判断问题是否仍属未解决,并辅以 “仍开放审计” 剔除已知答案的问题,配合成员关系/反记忆检查,防止模型依赖参数化知识而非真实检索来作答。
  2. 经验难度锚定与核心集冻结

    • 经验难度:不以主观难度标签为准,而是选用三个不同规模的开源参考模型(如 Llama-3、Qwen 等)对问题池进行回答尝试,将三个模型均无法正确解答的问题定义为难例子集,再从中随机采样固定数量形成 “冻结核心集”,保证难度客观、可复现且不被后续模型进化快速饱和。
    • 同时剔除预印本等非正式来源,控制问题粒度避免过度嵌套,最终基准包含 12,553 个问题
  3. 评估协议

    • Agent 设定:模型需自主规划多次工具调用(论文检索、全文读取等),在交互环境中生成答案并附上引用。
    • 检查表评分:针对每个问题预先编写一份结构化检查表(包含事实准确性、引用恰当性、弃权合理性等条目),两位 LLM 法官按检查表并行评分,大幅提升评分一致性(Spearman 相关系数从 0.35 升至 0.82)。
    • 引文事实性双层审计:L1 级检查引用是否存在(链接能否解析),L2 级检查引用内容是否真正支持 Agent 的论断(重点揭露“错纸故障”——约 15.9% 的引用指向无关论文)。

输出:基准输出每个 Agent 模型的解决率(核心集)、弃权率工具使用行为(如工具调用频率、是否出现 “Agent 崩溃”)等多维度指标,并暴露模型在最难问题上停止使用工具的反常现象。

与同类方法的核心差异:现有医学问答基准多为固定答案的闭形测试,模型可凭借记忆或预训练模式复现正确答案来源,而 OpenBioRQ 以无答案键的未解决问题为核心,强制模型通过真实检索验证信息来源,并将开放性作为忠实度和弃权能力的探针,从而避免“出处幻觉”的虚假高分。

实验

实验设计

OpenBioRQ 基准涵盖12个生物医学领域,共12,553个未解决问题,按难度分轨,核心子集由参考模型无法回答的问题构成。评估协议使用冷冻每题检查单(frozen per-question checklist)由LLM法官打分,并双重审计引用事实性:L1(引用是否存在)与L2(引用内容是否支持声称)。代理设置下,模型可调用检索等工具,但禁用了答案键,迫使模型独立验证来源。

关键发现

  • 引用表面可靠但语义失败:L1解析率超过99%,但L2错误论文率达到15.9%——模型虽生成看似有效的引用,却常链接到与声称无关的论文,这在已有基准中难以检出。
  • 难度高且非饱和:在最难的核心子集上,同源参考模型仅解决约17%,三个前沿代理(Gemini-3-Pro、Opus-4.7、GPT-5.5)得分横跨29%–60%,最强模型仍有约40%问题未解决,表明基准具有强区分度和非饱和性。
  • 工具使用在困难处失效:观察到“代理崩溃”现象——在最困难的问题上,模型停止调用工具,此时完全阻断工具访问对分数影响几乎为零,说明工具收益在真正需要时消失。
  • 检查单提升评估可靠性:使用冷冻检查单后,评判者间Spearman相关性从0.35跃升至0.82,大幅减小主观偏差。

与基线对比解读

相比于依赖固定答案键的封闭式医学QA基准,OpenBioRQ用未解决问题探测忠实性,有效暴露了模型“重现预期答案”而非“独立验证来源”的弱点。15.9%的L2错误率突显在生物医学高风险场景下,仅靠引用存在性不足以保证可信度。前沿模型得分虽领先参考模型36–43个百分点(绝对),但远未触及天花板,且不同能力层级得分差距明显,证明该基准适合跟踪模型进步。同时,工具崩溃提示当前代理在复杂推理下的规划鲁棒性仍脆弱,即使在检索增强设置中也值得深入诊断。

行业影响

落地场景

OpenBioRQ 为需要严格引用验证的 agentic 产品提供了直接的质量探针,尤其适用于生命科学、法律、金融等高风险领域。典型产品包括:AI 辅助的文献综述生成工具(自动摘要并附带引用)、药物发现知识检索系统(靶点‑证据链接)、临床决策支持助手(回答未解决的研究问题)。该基准通过考察模型在无答案线索下的来源忠实性,探测出~15.9% 的错误论文链接,帮助团队发现“表面解析但实质错误”的隐蔽缺陷。

商业价值

错误引用在生物医学场景直接关联到责任风险与合规成本。使用本基准可:

  • 降低误判带来的经济损失:例如,药物相互作用推荐系统若链接到错误文献,可能导致研发资源浪费或患者安全事件。
  • 增强用户信任与品牌溢价:对知识库产品而言,精确溯源是付费转化的核心要素,基准可成为市场差异化的技术背书。
  • 量化工具使用退化:实验中发现的“代理崩溃”(难题下模型停止调用工具)直接暴露了架构短板,提前识别可避免生产环境雪崩。

与现有产品/工作流的接口

OpenBioRQ 可无缝嵌入现代 RAG 评估流水线

  • 作为 LLM 评测插件的测试集,集成至 LangChain、TruLens 或 DeepEval 等框架,用于模型选型和回归测试。
  • MLOps CI/CD 中充当引用质量门控,实时监控新模型部署后错误引用率是否上升。
  • 配合向量数据库与检索器(如 Pinecone、Weaviate),直接检验 agentic 流程中检索‑生成对齐程度,无需额外标注。

具体用例

  1. 学术搜索引擎的“研究摘要”功能(如 Semantic Scholar、Elicit):用户提出开放式医学问题,模型需生成综合摘要并链接支持论文。集成 OpenBioRQ 后,可定期扫描线上流量,探测摘要中链接“错误论文”的比例,触发模型回滚或微调。
  2. 制药企业内部的 RAG 问答系统:研究人员查询某个靶点的最新争议,系统需引用内部研究文档或已发表论文。利用该基准的冻结检查表(提高评委一致性至 0.82)进行自动评分,确保系统不会在高难度提问下“放弃检索”,从而保证答案的审计可追溯性。

局限

  • **开放性的时效性局限**。论文自身指出,开放性是“过时”而非永恒的——随着研究进展,当前标记为未解决的问题可能会被后续工作解决,导致基准的难度标签失效。虽然作者通过定期审计维持质量,但核心冻结集(frozen core)一旦发布即固定,无法动态反映领域前沿。这限制了基准的长期可用性,在使用时需注意发布时间与评估时间的间隔,以避免将已解决问题误判为模型能力不足。
  • **自动化检查表生成的隐式偏差**。答案检查表(rubric)由大语言模型生成,虽经人工初步校核,但仍可能继承生成模型的偏好或错误。论文揭示了合成“金标准答案”在引用上不可靠的问题,但检查表本身作为评估准则,其完备性与准确性直接影响评分可靠性。尽管通过冻结检查表提升了评审间一致性(从 Spearman 0.35 到 0.82),但若生成模型对某些问题存在系统性误解,会将偏见固化到评估基准中。
  • **领域覆盖与人类评估的有限性**。基准涵盖 12 个生物医学子领域,但主要基于公开预印本和论文,可能存在领域偏斜(如重癌症、轻罕见病)。人类评估仅对论文中报告的“错误论文率(wrong-paper rate)”进行了非专家级的初步抽查,缺乏系统性的专家注释来验证引用内容支持度(L2 级别)的判断精度。这削弱了对模型忠实性评测的最终置信度。
论文Minbyul Jeong2026-06-20原文

相关内容