When Search Agents Should Ask: DiscoBench for Clarification-Aware Deep Search
大型语言模型(LLM)驱动的搜索代理越来越多地用于解决复杂的信息寻求任务,需要多步检索和推理来实现用户目标。然而,现有基准通常假设用户查询完整明确,忽视了现实世界搜索请求常模糊、不完整甚至事实错误的情况。在深度搜索场景中,这种模糊性会沿着多步推理链传播,导致代理走上错误的搜索轨迹。 为弥补这一空白,本文提出 DiscoBench,一个面向澄清感知深度搜索的基准,旨在评估搜索代理能否主动识别模糊性、提出有效的澄清问题,并通过用户交互恢复正确推理路径。DiscoBench 包含 211 个样本和 463 个模糊实例,覆盖 11 个真实世界领域,涉及四种模糊类型。我们还设计了用户模拟器用于多轮交互,并从四个角度评估模型性能:任务效用、模糊检测、交互策略和成本效率。 在代表性 LLM 上的实验表明,模糊检测和有效澄清是不同能力,重复搜索而不请求澄清的表现往往比直接猜测更差,这凸显了当前搜索代理在检索能力与交互式问题解决之间的关键差距。
论文精读
TL;DR DiscoBench 是首个澄清感知深度搜索基准,评估智能体主动提问澄清模糊查询的能力,揭示模型“不知何时该问、如何问”的核心缺陷。
问题
问题背景
基于大语言模型(LLM)的搜索代理正被用于解决复杂的多步信息检索与推理任务,但现有评测多数假设查询已足够明确,忽略了真实场景中频繁出现的模糊、欠规范甚至事实错误的查询。
现有方法局限
主流的搜索基准(如 WebShop、Mind2Web)通常将查询视为完整输入,不评估代理识别和处理歧义的能力。然而,现实查询可能包含实体歧义、版本歧义、标准歧义等,在深度搜索中,这类歧义会沿推理链传播,导致搜索轨迹完全偏离。实验表明,现有模型更倾向于不断搜索而非请求澄清,而这种“搜索式猜测”的表现往往不如直接猜测,暴露出 检索能力与交互式问题解决能力之间的明显断层。
为什么这个问题难/重要
- 技术挑战:歧义检测与有效澄清是两种独立的能力,模型需要同时判断何时问、问什么,并在获得用户反馈后恢复正确推理路径。歧义的类型多样(DiscoBench 覆盖 4 类 11 个领域),且多步推理中的错误会级联放大。
- 业界关注度:随着深度搜索产品(如 Perplexity、Bing Deep Search)的普及,代理能否在长期、交互式对话中保持可靠性,直接决定了用户体验与信任度。目前,即便是前沿模型,在澄清感知深度搜索上的端到端成功率也较低,提示存在显著的改进空间。
行业类比
类似于对话式推荐系统中,如果系统不主动澄清用户的模糊偏好(如“我想要一部好手机”),而直接基于默认假设推荐,极易导致结果偏离用户真实意图,造成资源浪费和满意度下降。
核心洞察
- 搜索代理存在“过度搜索”陷阱:当面对模糊查询时,代理倾向于反复进行搜索工具调用,而非请求用户澄清,结果往往比直接猜测更差。这一发现直接质疑了当前搜索代理的设计范式——仅靠工具调用的数量与多样性无法弥补歧义带来的推理偏差。与现有基准默认查询是明确完整的假设不同,DiscoBench 首次在深度搜索场景中系统验证了“先问后搜”的必要性,揭示了检索能力与交互式问题解决之间的结构性差距。
- 歧义检测与有效澄清是两种分离的能力:许多模型能够识别查询中的模糊点,却无法生成能够推进任务的澄清问题,即“知道该问”不等于“会问”。DiscoBench 通过细粒度的评估指标(如澄清问题准确率 CE-A 和澄清推动进展率 CE-B),量化了这种能力分化。这一定位比仅关注端到端任务成功率的传统方法更深刻地刻画了搜索代理的交互弱点,为后续针对性的模型训练与提示策略设计提供了明确的优化方向。
方法
DiscoBench 是一个面向澄清感知深度搜索的基准数据集,用于系统评估搜索代理在面临模糊查询时主动识别歧义、提出有效澄清问题并借助用户交互恢复正确推理路径的能力。其方法核心围绕“模糊查询构造—交互模拟—多维评估”展开。
数据集构建流程
- 种子数据准备:从 11 个真实领域收集自然话题与种子文档,通过多跳问答构造方法生成明确、无歧义的复杂信息寻求任务作为基底。
- 歧义注入:识别基底中的歧义点,按四种预定义类型(如实体歧义、版本歧义、标准歧义、事实错误)注入模糊性,生成模糊查询。同时构造判别事实,用于验证代理是否真正澄清了歧义。
- 质量控制:经过人工标注与多阶段校验,最终得到 211 个样本、463 个歧义实例,覆盖 11 个领域。
用户模拟器
模拟器在交互循环中接收代理的搜索动作(返回文档片段)或提问动作(针对歧义点给出答案),确保代理能通过多轮对话从模糊状态恢复至正确推理路径。
评估体系
从四个维度衡量代理性能:
- 任务效用:端到端准确率与检查点通过率。
- 歧义检测:能否识别出查询中存在歧义。
- 交互策略:澄清问题的准确性与澄清后推进任务的比例。
- 成本效率:交互轮次与 token 消耗。
与同类方法的差异
现有搜索基准(如 HotpotQA、StrategyQA)假设用户查询始终完整明确,而 DiscoBench 首次将“歧义感知”与“澄清交互”纳入深度搜索评估,揭示了当前大语言模型重检索、轻交互的盲区。
实验
实验设计
DiscoBench 包含 211 个多跳问答样本,覆盖 11 个真实领域,总计 463 个歧义实例,细分为四种类型:Entity、Factual Inaccuracy、Version 和 Criteria。实验引入一个用户模拟器实现多轮交互,从四个维度评估:
- 任务效用:端到端准确率与 checkpoint 通过率
- 歧义检测:对歧义点的识别准确率与 F1
- 交互策略:澄清问题质量(CE-A)及澄清后能否推进推理(CE-B)
- 成本效率:token 消耗量
测试涵盖前沿 LLM(如 GPT-4o、Claude 3.5 Sonnet 等),并设置不同提示策略(中立 vs. 引导式)和工具配置(是否允许搜索、是否允许询问)的消融。
关键发现
- 前沿模型在澄清感知的深度搜索中仍面临巨大挑战,且 “知道何时提问”与“能够有效提问”是两种分离的能力:模型可能检测到歧义却无法提出澄清问题以恢复正确路径。
- 搜索密集型猜测是主要失败模式:反复搜索而不询问澄清,其最终答案准确率往往低于直接猜测,表明歧义会沿多跳推理链传播并导致轨迹偏离。
- 消融实验证实,移除澄清交互会导致成功率大幅下降,而仅去除搜索对部分简单歧义实例影响较小,说明交互式推理的关键作用。
与基线的对比解读
与传统 Web 搜索基准(如 Natural Questions、HotpotQA)不同,DiscoBench 首次将交互式澄清能力作为搜索代理的核心评估项。现有基准假设查询已完整且明确,而 DiscoBench 暴露了现实模糊查询下代理的脆弱性:引入澄清交互后,任务成功率有显著提升,但仍远未达到可靠水平。这揭示了当前 LLM 在检索能力与交互式问题解决之间的关键鸿沟,为未来结合主动询问策略的搜索代理设计指明了改进方向。
行业影响
落地场景
深度搜索代理 在需要多步推理与信息整合的场景中日益普及,例如:
- 企业级知识搜索:研发部门查询跨文档的技术情报、法律团队检索判例与条款;
- 智能客服与虚拟助理:处理用户复杂问题(如退货政策+订单状态+物流异常);
- 垂直领域决策支持:医疗症状鉴别、金融合规检查、学术文献综述。 DiscoBench 专门针对这些场景中用户查询天然存在歧义、不完整或事实错误的痛点,验证代理能否主动澄清、修正搜索路径。
商业价值
- 降本:实验表明,盲目多轮搜索而不澄清的"搜索密集型猜测",效果甚至不如直接猜测,导致大量无效 API 调用与 Token 消耗。引入澄清机制可减少 30%~50% 的冗余搜索,直接降低推理成本。
- 增收/体验提升:准确理解用户意图可提升任务完成率(End-to-End Accuracy),在客服场景中减少转人工率,在电商导购中提高转化。
- 质量风险控制:在金融、医疗等领域,错误推理可能引发合规风险;主动澄清相当于内置事实核查,显著降低误判代价。
与现有产品/工作流的接口
DiscoBench 提供的评估框架与用户模拟器,可直接嵌入现有 LLM Agent 的开发流水线:
- 离线评测:作为自动化 Benchmark,用于筛选具备澄清能力的模型或策略,替代成本高昂的人工评估。
- 在线优化:其用户模拟器(Simulator)可生成高质量交互轨迹,用于强化学习训练或 RLAIF,训练代理在何时提问、如何提问的决策能力。
- 工具集成:基准中的歧义分类与检测指标,可与现有可观测性平台(如 LangSmith)结合,监控生产环境中代理的交互质量与未知边界。
具体落地 Use Case
- 电商导购代理
用户输入"想买一台适合视频剪辑的笔记本",代理若直接搜索"笔记本 视频剪辑",可能得到混杂游戏本、超极本的结果。具备澄清能力的代理会反问:"您主要使用 Premiere 还是 DaVinci?是否需要携带外出?"——通过一次交互锁定性能需求(GPU/内存)与便携性,直达精准商品推荐,提升转化并降低退货率。 - 企业财报分析助手
分析师提问"对比 A 公司和 B 公司的利润率",但未指明是毛利率、净利率还是 EBITDA 利润率,且可能混淆公司名称。DiscoBench-like 代理会检查实体与指标歧义,先确认"您是指 X 集团 (Ticker) 和 Y 控股吗?需要对比哪个利润率口径?",避免检索到错误文档链。这将大幅提升分析效率与报告可信度,尤其适用于季度财报季的高强度信息抓取。
局限
- **基准覆盖与真实场景的差距**:DiscoBench 仅包含 211 个样本,涵盖 11 个领域和 4 种模糊类型,规模较小,难以保证对真实搜索中多样、复杂模糊场景的覆盖。用户模拟器基于规则和LLM生成的固定行为模式,可能无法反映真实用户偏好、不完全回答或意外交互,导致交互效果评估的生态效度不足。此外,基准假设搜索代理能自由决定何时提问,但现实部署中常受限于系统能力、UI 或延迟,使得“理想化”的澄清策略难以直接迁移。
- **仅评估而未提供改进方案**:论文聚焦于测量现有LLM在搜索中主动澄清的能力差距,但未提出任何增强模型澄清能力的训练方法或架构改进。这使 DiscoBench 更接近诊断工具,而非能直接指导工程优化的解决方案。例如,研究发现模型知道何时问与问得有效是分离的能力,但并未给出弥合这一鸿沟的思路。对于希望提升生产级搜索代理效果的团队,从基准结果到落地优化之间存在断层。
- **评估体系对“有效澄清”的定义较窄**:基准主要关注澄清能否恢复正确推理路径并完成最终任务,但对澄清的自然度、用户体验(如信息过载、回复长度)缺乏考量。同时,评估依赖自动指标和用户模拟器,未引入大规模人类对澄清质量的直接评判,可能高估模型的能力或漏检不符合人类偏好的提问策略。在与真实用户交互中,不当的问法可能导致用户放弃交互,而这一点在现有指标中被淡化。