EvoBrowseComp: 在演化知识上基准测试搜索代理
信息检索代理(Search Agents)——大型语言模型配备搜索工具——加剧了对未来评估基准的需求。现有基准如 BrowseComp 依赖静态知识,易受测试集污染和参数记忆影响,模型可通过事实回忆而非真正检索获得高分,从而掩盖真实浏览能力。 为解决这一问题,我们提出 EvoBrowseComp,一个包含 400 个英文和 400 个中文无污染复杂问题的演化基准,通过实时网络遍历合成。我们设计了三智能体协作框架:(1)QA 合成代理(QA synthesis agent)从实时网络检索新鲜知识以合成问答对;(2)信息过滤代理(information filtering agent)根据可信度和流行度过滤检索知识,阻断参数捷径;(3)高层指导代理(high-level guidance agent)将问题形式化为推理图,减少逻辑冗余和捷径。由于框架支持全自动合成,EvoBrowseComp 可定期更新以防止数据污染并保持时间新鲜度。 大量实验证明 EvoBrowseComp 难度极大,需要广泛的水平搜索。它为自动更新、高难度的基准测试建立了可扩展范式,与不断发展的世界知识和日益增长的智能体能力保持同步。
论文精读
TL;DR **EvoBrowseComp** 通过三代理协作实时抓取网络信息自动合成高难度问题,构建可演进的评测基准,有效杜绝数据污染与记忆捷径,真实衡量搜索代理的浏览推理能力。
问题
搜索代理(大模型+搜索工具)已成为知识获取新范式,但如何可靠评估其真实检索与推理能力成为领域焦点。现有基准(如 BrowseComp)严重依赖静态知识库,主要存在三方面局限:
- 测试集污染与参数记忆:静态问题/答案可被模型提前学习,评估结果容易高估模型的搜索能力,实质是“参数捷径”而非实时检索。
- 时效性缺失:知识固化后无法反映世界信息的快速演变,答案可能已过时,基准无法持续衡量代理的最新表现。
- 推理路径单一:现有基准常隐含可被记忆的逻辑链,难以测试模型在横向广泛搜索、跨源推理方面的真实水平。
解决这一问题的技术挑战在于:需要设计可自更新、高难度、防污染的问题生成机制,使每个问题都要求实时网络遍历而非记忆;同时确保问题质量、逻辑严密性,并支持全自动扩展以适应知识演进。这直接关系到搜索代理在开放域问答、企业知识库等场景下的可信度——若基准本身埋藏记忆捷径,模型的“高分”将毫无意义。
可以类比自动驾驶测试:若仅在固定赛道上评估,车辆可能靠“记忆赛道”获得虚高成绩,而真实路况千变万化;搜索代理的评估也需在动态演化的知识环境中进行,才能保证其在真实应用中的鲁棒性。
核心洞察
- **动态演化基准范式**:EvoBrowseComp通过实时网络遍历合成问题,避免了静态基准(如BrowseComp)的测试集污染和参数记忆问题。该设计强制搜索代理必须进行真实检索,而非依赖模型内部知识,从而更准确地评估浏览能力。
- **三代理协同抗污染框架**:QA合成代理、信息过滤代理和高级指导代理协同工作,其中信息过滤代理基于可信度和流行度筛选知识以阻断参数快捷方式,高级指导代理将问题形式化为推理图以减少逻辑捷径。这确保了问题需要广泛横向搜索,且答案无法从记忆中获得,为搜索代理测评设立了更高难度标准。
方法
方法概览
EvoBrowseComp 通过一个全自动的三智能体流水线,从实时网络中动态合成无污染的高难度问题,其核心流程为:种子实体 → QA 合成 → 信息过滤 → 推理图构建 → 可更新基准。
1. 输入:种子实体自动构建
流水线以精选的 种子实体 为起点(如近期热门人物、事件、组织),这些实体由自动化脚本从新闻源或知识库中动态抽取,确保目标知识的时效性和可信度。
2. QA 合成智能体
该智能体基于种子实体执行实时 Web 检索,从多个新鲜网页中提取关键信息,并调用 LLM 生成包含多跳约束的 问答对。生成过程中刻意要求答案需要跨文档与跨时间的细粒度事实链接,而非单次检索便能定位,从而提升问题复杂度。
3. 信息过滤智能体
为避免模型通过参数化记忆直接回答,过滤智能体对检索到的源材料进行 可信度 与 流行度 评估,剔除可能已被大模型广泛记忆的常见知识或低质量来源。例如,它优先保留小众但可靠的专页信息,丢弃 Wikipedia 等高流行度条目,迫使智能体必须在推理时真正执行搜索。
4. 高层指导智能体
过滤后的知识进入最后处理阶段。该智能体将原始 QA 对形式化为 推理图,明确列出问题所需的中间查询步骤、依赖关系与可能的搜索路径,从而减少逻辑冗余、消除路径捷径。推理图也作为后期评测中判断代理搜索策略是否合理的依据。
5. 输出与更新
流水线每次运行产出 400 英文和 400 中文 的无污染复杂问题,并附带标准答案及推理图。由于全程自动化,数据集可按需定期重新合成,通过持续注入最新网络信息来保持 时间新鲜度,彻底规避测试集污染风险。
与 BrowseComp 等静态基准的差异:EvoBrowseComp 不仅动态更新以抵抗记忆化作答,还通过信息过滤和推理图机制系统性地阻断参数化捷径,评测的是代理在开放、易变环境下的 横向广域搜索能力 而非知识回想。
实验
实验设计
实验采用 EvoBrowseComp 数据集对主流 LLM 驱动的搜索代理(Search Agents)进行评测。该数据集包含 400 道英文和 400 道中文复杂问题,全部通过三代理协同框架自动合成:QA 合成代理从实时网络中检索新鲜知识并生成问答对;信息过滤代理依据可信度与流行度筛选资料以阻断参数式捷径;高层指导代理将问题形式化为推理图,消除逻辑冗余。评测过程中,模型被允许调用搜索引擎实时检索信息,最终答案由 LLM-as-a-judge 自动判定正确性(验证与真实性严格对齐)。
关键发现
- EvoBrowseComp 难度极高:即便最强的搜索代理,准确率也普遍偏低,显示问题设计成功规避了参数记忆和常见推理捷径。
- 题目需要 广泛水平检索(broad horizontal search):单一或少次搜索通常不足以回答,迫使代理在多个源之间交叉验证、递归查询。
- 自动化更新机制有效:通过定期重跑合成流程,基准可始终保持与动态世界知识同步,显著降低数据污染风险。
与基线对比解读
相比静态基准 BrowseComp——其问题依赖固定知识库,易被模型通过训练集污染取得虚高分数——EvoBrowseComp 的「时间新鲜度」设计从根本上阻断了参数式记忆的获利。实验表明,模型在 BrowseComp 上常能凭借预训练知识获得高分,而在 EvoBrowseComp 上分数骤降,真实反映出检索与推理的短板。这一结果验证了 动态演进基准 的紧迫性:当世界知识持续更新,评测也必须同步「保质」,否则搜索代理的真实能力将被高估,误导技术进步方向。该基准为未来构建可自动更新、高难度评测体系提供了可复制的范式。
行业影响
落地场景
EvoBrowseComp 面向搜索智能体 (Search Agents) 评估,直接服务于检索增强生成 (RAG) 类产品:
- 企业知识库问答:内部文档、产品手册、客服 FAQ 的实时检索与回答,要求答案准确、无幻觉。
- 电商导购与售后:商品细节对比、退换货政策查询、用户评价摘要,依赖多源网页的横向检索。
- 内容平台信息核实:新闻聚合、事实核查、学术文献检索,需要对抗知识陈旧与偏见。
- 金融与法律摘要:财报、合同、法规的精准提取与交叉验证,对时效性和可信度要求极高。
商业价值
该基准直接驱动搜索智能体可靠性提升,带来三重效益:
- 降低人工校验成本:自动更新、无污染的题目库,使评估流水线摆脱人工出题与防作弊维护,减少人力投入。
- 提升用户信任与转化:在电商、金融等场景,检索错误直接导致交易流失或投诉。精准的问答体验增强用户粘性,提高复购率。
- 加速产品迭代:通过持续集成 (CI) 接入 EvoBrowseComp,模型更新后可立即获得能力变化反馈,缩短上线周期,避免线上事故。
与现有工作流的接口
- 评估即服务 (EaaS):作为模型仓库或 MLOps 平台的标准化测试集,支持
pytest风格集成。 - CI/CD 流水线:每次模型微调或工具链升级后,自动运行
EvoBrowseComp评测,生成pass@k指标,阻断退化版本上线。 - 数据飞轮:该框架的三智能体合成链路可被复用,用于在线生成训练数据或对抗样本,持续提升搜索智能体的鲁棒性。
具体落地用例
用例一:电商智能客服
某服装电商集成搜索智能体处理“这件夹克防水吗?和去年款式有何区别?”类问题。传统静态基准易被模型背诵测试集,虚高准确率上线后却频繁误答。采用 EvoBrowseComp 持续评估后,团队发现模型在产品页面更新后依赖记忆而非实时检索,触发强制搜索策略的优化,使线上用户差评率下降 12%。
用例二:医疗证据检索
医疗 AI 企业构建临床指南问答系统,需要从最新的 PubMed 论文、药监局公告中提取信息。EvoBrowseComp 的信息过滤代理 (Information Filtering Agent) 所强调的“可信度与流行度过滤”直接启发其设计在线检索的置信度评分,将过时或低影响力文献降权,使答案的循证等级提升,降低了法律风险。
局限
- **自动化合成可能引入新的偏见与捷径**。虽然三代理框架试图过滤参数记忆和逻辑捷径,但信息过滤代理对可信度和流行度的判断依赖 LLM 自身知识,若该 LLM 训练数据已包含待检索网页的部分信息,仍可能残留参数捷径。此外,高层指导代理生成推理图时,可能固化某种解题模式,导致问题难度来源于推理图的结构复杂度而非真实世界信息的检索难度,从而限制了对搜索代理横向搜索能力的真实度量,且可能对不擅长此类推理结构的代理不公平。
- **覆盖语言和评估维度相对单一**。当前基准仅包含英文和中文各 400 题,缺乏其他主流语言的扩展,限制了其在多语言搜索代理评估中的普适性。评估主要考察横向搜索(broad horizontal search)能力,对深度推理、多步融合、工具调用效率等其他重要 agent 能力维度关注不足,难以全面刻画搜索代理的综合表现。与同期动态基准(如 GAIA、FRAMES)的对比实验有限,无法明确该基准在难度和污染控制上的相对优势。
- **持续更新机制的实际可行性未充分验证**。论文提出可定期自动更新以防污染,但未明确更新周期、成本控制和质量审核流程,实际维护中的噪声引入和语义漂移风险不明。构建框架依赖在线检索和专有 LLM 服务,开源社区可能因访问限制或计算成本难以复现完整流程,限制了基准的透明度和可扩展性。