Hi-Q:面向多跳问答的层次化证据引导查询精化
多跳问答(QA)的一个核心瓶颈在于:问题的表达粒度 与 语料证据的可检索粒度 通常不一致。现有方法通过施加固定图结构、迭代重构查询或执行生成式程序来应对,但并未显式决定一个查询单元何时已被证据支持、何时应当进一步精化。 本文将这一瓶颈形式化为 可检索粒度发现 问题,并提出 Hi-Q——一个证据条件化的层次化查询精化框架。在每个查询节点上,解析算子(resolution operator)测试已检索证据是否支持当前查询单元;已解析的节点终止,未解析的节点则由 保依赖二元算子(dependency-preserving binary operator)展开,并通过 语义覆盖验证器(semantic coverage verifier)检查。Hi-Q 由此生长出一棵查询树,其拓扑由语料支持信号决定,而非由固定分解模板或预建图决定。 我们在三个多跳 QA 基准上评估 Hi-Q,主要采用 全语料检索 场景,即依赖证据需从开放域干扰项中找出,而非来自小型标注池。该设置下,Hi-Q 在三个基准上平均达到 52.3 EM / 64.0 F1,相比迭代检索基线 IRCoT 平均领先 15.1 EM / 18.2 F1;在图索引 RAG 基线 PropRAG 上,于 MuSiQue-full 中领先 11.5 EM / 12.0 F1,且无需全语料图构建。在先前工作所用的受限支持/干扰项设置下,Hi-Q 同样取得最佳准确率,平均 57.9 EM / 69.3 F1,领先 PropRAG 5.6 EM / 3.9 F1、领先 IRCoT 13.7 EM / 15.8 F1。
论文精读
TL;DR Hi-Q 基于证据支持信号动态细化多跳查询为层次树,显式解决问题与证据粒度不匹配,在 full-corpus 检索下平均 EM 52.3,比 IRCoT 高 15.1,比 PropRAG 高 11.5。
问题
问题背景
多跳问答 (Multi-hop QA) 要求模型组合多篇证据才能回答一个复杂问题,而目前主流方案是检索增强生成 (RAG) 与图增强检索。
现有方法局限
现有方法主要走三条路线:
- 固定图结构:预先在语料上构建实体图或段落图,再沿图路径检索,但图构建成本高、覆盖有限,且真实语料中的证据依赖关系往往不是固定拓扑。
- 迭代查询重构:如 IRCoT 每轮根据前一轮结果改写查询,但缺少显式的“停止细化”判断,容易过度扩展或过早终止。
- 程序化执行:生成并执行查询程序(如 DSPy、ReAct 风格 agent),但程序执行中“当前子查询是否已由证据充分支持”仍是一个隐含决策,未被显式建模。
一个共同的技术缺口是 可检索粒度发现 (retrievable granularity discovery):模型无法在查询执行过程中判断某个查询单元是否已经“被证据支持”,因此无法决定该停止还是进一步分解。
为什么这个问题难/重要
多跳 QA 的核心矛盾在于:问题表达的自然粒度与语料中证据的可检索粒度经常不一致。例如问题中一个短语可能对应多篇文档中的多个分散事实,或者多个短语共同对应一篇文档中的一段话。若模型强制使用单一固定粒度检索,要么检索结果噪声过大(过粗),要么丢失关键依赖(过细)。而且真实场景中证据分布在开放域海量干扰项中,而非预先标注的小候选池,这进一步放大了粒度不匹配的影响。业界对复杂问答、企业知识库检索、科研文献推理等场景的准确率要求不断提高,因此显式建模“何时细化、如何细化”的证据信号具有直接工程价值。
行业类比
类似 AI 代码生成中的层级任务分解:当 agent 拿到一个模糊需求时,需要判断是直接调用现有 API 还是进一步拆分子任务——Hi-Q 的核心思想可类比为“用检索证据作为信号来决定函数拆分的终止条件”。
核心洞察
- **证据驱动的层级查询细化** 将多跳 QA 的核心瓶颈形式化为可检索粒度发现:对每个查询节点,用解析算子判断现有证据是否支持当前查询单元,支持则终止,不支持才按依赖保留方式二分展开。与 IRCoT 的迭代式查询改写、PropRAG 的固定图结构不同,Hi-Q 的查询树拓扑由语料库支持信号动态决定,而非预设模板或全局图。
- **未解决支持信号作为控制信号** 可以直接路由分解:论文证明该信号足够精确,无需学习分类器即可执行 STOP/EXPAND,并且在可回答与对抗性不可回答输入上均保持保守。这不同于需要额外训练策略或奖励模型的 agentic 方法,工程上只需一个阈值即可将检索置信度转化为推导控制,降低系统复杂度与延迟。
方法
输入与初始化
给定多跳问题,Hi-Q 将其视为根查询节点,并检索相关证据。初始证据可能无法直接回答整个问题,因为问题表达粒度与证据粒度不匹配。
关键模块
- 解析算子(resolution operator):判断当前查询节点是否被检索证据充分支持。若支持,节点解析终止;若未解析,则进入扩展阶段。
- 依赖保持的二元扩展算子(dependency-preserving binary operator):将未解析节点分解为两个子查询,显式保留它们之间的依赖关系(如实体引用或条件约束),避免分解时丢失语义连接。
- 语义覆盖验证器(semantic coverage verifier):检查分解后的子查询是否覆盖原查询的语义空间,防止过度细化或遗漏关键意图。
- 未解析支持信号(unresolved support signal):基于证据支持度计算一个标量信号,通过与阈值比较决定 STOP 或 EXPAND。该信号是证据条件的,不依赖固定模板。
输出与差异化
经过多轮扩展,Hi-Q 构建一棵查询树,其拓扑由语料库支持信号动态决定:叶子节点为已解析的、证据可回答的子查询,用于后续检索与答案合成。
与典型迭代检索或图 RAG 方法的差异在于:Hi-Q 不预先构建语料图,也不采用固定分解模板,而是让证据支持度显式控制查询粒度的细化过程,从而在开放域全语料检索下更精准地定位依赖证据。
实验
实验设计
Hi-Q 在三个多跳 QA 基准上评测,包括 MuSiQue-full 在内的全语料检索设置,依赖证据需从开放域干扰项中定位;同时报告先前工作使用的受限支持/干扰设置。基线包括 IRCoT(迭代检索)与 PropRAG(图 RAG)。评估指标为 EM 与 F1。
关键发现
在全语料检索下,Hi-Q 平均达到 52.3 EM 与 64.0 F1,较 IRCoT 提升 15.1 EM / 18.2 F1;在 MuSiQue-full 上较 PropRAG 提升 11.5 EM / 12.0 F1,无需构建全局图。在受限设置中,Hi-Q 同样最优,平均 57.9 EM / 69.3 F1。对 unresolved-support 信号的分析表明:该信号可指导分解,无需学习分类器,且对对抗性不可回答问题保持保守。
与基线的深度对比
Hi-Q 的核心优势在于 证据条件化的层次查询细化:通过 resolution operator 判断当前查询单元是否已被证据支持,仅对未支持节点进行 依赖保持的二元分解 并验证语义覆盖。相比 IRCoT 的盲目迭代改写,Hi-Q 减少了无效查询;相比 PropRAG 的固定语料图,Hi-Q 避免预建图的高昂成本与结构偏差。实验表明,单纯提高原始检索召回率并不必然提升多跳答案质量,凸显了证据引导的控制回路价值。
行业影响
落地场景
Hi-Q 适合需跨文档、跨证据链的复杂问答产品,如企业知识库助手、合规审查、金融研报分析。它不依赖固定知识图谱,可对任意语料动态构建查询树,降低部署成本。
商业价值
- 降本:省去人工构建/维护知识图谱,减少多轮检索的 token 与延迟;提升准确率(全语料下平均 EM 52.3 / F1 64.0)直接降低人工复核成本。
- 增收/体验:证据条件化推理减少幻觉,提升用户信任与转化,尤其适合付费订阅型专业问答。
与现有产品/工作流接口
Hi-Q 可作为 RAG 流水线中的查询精化层:
- 初始向量检索返回候选后,由 resolution operator 判断是否已支撑当前查询单元;
- 未解决节点触发 binary expansion operator 拆分,并通过 semantic coverage verifier 检查覆盖;
- 最终将查询树叶子节点的证据合并给 reader 生成答案。
可直接封装为微服务,输入 query + 检索上下文,输出结构化的 query tree 与证据列表;替换现有 graph-based RAG(如 PropRAG)或 iterative retrieval(如 IRCoT)的调度模块,保留现有 embedding 模型与向量库。
具体 Use Case
- 电商客服:用户问“这款笔记本支持双 4K 外接、续航 10 小时且保修期延保政策如何?”,Hi-Q 能跨产品页、规格表、售后政策分别定位证据。
- 金融投研:分析师问“某监管新规如何影响三家公司下一季度营收指引和一致预期?”,系统需连接财报、新闻、监管文件,Hi-Q 逐层验证证据支撑,减少漏检。
局限
- **计算开销较高**:每次展开都需要 LLM 调用(`resolution operator`、`binary expansion`、`semantic coverage verifier`),且查询树深度可能随问题复杂度增长;在 full-corpus 检索下还需对每个节点执行检索,端到端推理成本明显高于 IRCoT 或单次 RAG。论文虽报告了成本,但未给出与精度增益匹配的延迟优化策略,实际部署时需要权衡吞吐与准确率。
- **检索质量仍是前提**:`resolution operator` 依据 retrieved evidence 判断支持度,若底层 embedding 或检索系统漏检关键段落,节点会被错误标记为 unresolved 或 resolved,导致查询树在错误位置停止或展开。论文在固定 embedding 模型上实验,未充分分析不同检索器弱点及语义覆盖 verifier 的误判传播,这可能限制跨语料迁移的鲁棒性。
- **评估范围受限**:实验集中在英文多跳 QA(HotpotQA、MuSiQue、2WikiMultiHopQA)且以 extractive answer 为主,未涉及对话式多跳、多语言或需要长答案生成的任务;binary decomposition 对三元及以上逻辑组合问题(如 arithmetic/comparison 或高 arity 关系)可能产生次优拆分,附录虽讨论 high arity,但主结果未展示对应复杂性上限下的表现。