论文

LiveBrowseComp: 搜索代理是在搜索,还是仅仅验证已有的知识?

LiveBrowseComp: 搜索代理是在搜索,还是仅仅验证已有的知识?

基于LLM的搜索代理是否真正在进行搜索,还是仅仅利用网络验证已知信息?我们通过在BrowseComp上设计三项诊断来研究这一问题。分析揭示了内在知识依赖(IKD)现象:即使具备工具访问权限,代理也倾向于依赖内在知识(即检索前模型已编码的信息),而非外部证据。具体表现为: 1. 代理在没有工具的情况下能回答44.5%的BrowseComp问题; 2. 超过半数搜索查询来自内部假设而非检索线索; 3. 移除答案支持证据后,其表现甚至不如闭卷基准。 这些结果表明,静态搜索基准可能奖励基于记忆的验证,而非证据驱动的发现,混淆了代理已知与能查到的信息。为此,我们推出LiveBrowseComp,一个旨在评估超越内在知识覆盖范围的深度搜索基准。该基准包含335个人工编写的问题,答案依赖于基准构建前90天内发布的六个更新来源的事实,并排除了全球性显著事件。在LiveBrowseComp上,所有被评估的代理闭卷准确率均低于2%,搜索增强得分相比BrowseComp下降25-40分,且先前的模型排名无法可靠预测表现。LiveBrowseComp发布于 https://huggingface.co/datasets/Forival/LiveBrowseComp。

论文精读

TL;DR LLM 搜索代理高度依赖预训练内在知识而非实时网页证据,现有静态基准难以区分“记忆验证”与“真实搜索”;作者提出动态数据集 LiveBrowseComp,通过时效性题目有效抑制知识捷径,迫使代理真正探索,揭示真实搜索能力。

问题

LLM 驱动的搜索代理正从单一问答走向深度探索,但业界普遍怀疑现有基准能否衡量真正的证据驱动发现能力。

现有方法局限

当前主流基准(如 BrowseComp)依赖相对静态的知识库,模型可通过参数记忆直接作答,而非执行有效的网络检索。论文通过三项诊断揭示了内在知识依赖(Intrinsic Knowledge Dependence, IKD)

  • 无工具问答:44.5% 的 BrowseComp 问题可在不调用搜索的情况下正确回答;
  • 搜索策略:超过一半的查询源自代理内部假设,而非从检索到的线索中提取;
  • 证据移除:当删除答案支撑材料后,搜索增强的性能反而低于闭卷基线。

这表明现有基准奖励的是记忆验证,而非真正的探索性搜索。

技术挑战与重要性

随着预训练语料不断扩大,LLM 的参数知识覆盖度日益增长,设计者难以确保基准题目完全未被记忆。搜索代理的核心价值在于查找未知、实时或长尾信息,若基准无法区隔记忆与搜索,将导致模型评估失真,误导工程迭代。构建一个能有效抑制 IKD、持续反映真实搜索能力的动态基准,成为推动搜索代理走向实用的关键挑战。

行业类比

类似供应链监控系统中,若代理仅凭内部知识判断货物位置而非实时查询物流接口,一旦库存变动,决策链将全线失效。搜索代理同样必须依赖外部证据而非内在记忆。

核心洞察

  • 搜索代理存在**内在知识依赖(IKD)**——即便工具可访问,模型仍倾向于依赖预训练编码的知识而非外部证据。在 BrowseComp 上,代理在无工具时可回答高达 44.5% 的问题,且超半数搜索查询源于内部假设而非检索线索;移除答案支撑证据后,性能甚至低于闭卷基线。这表明静态基准容易奖励“基于记忆的验证”,将代理已有的知识与能发现的新知混为一谈,误导搜索能力的评估。与以往仅关注最终准确率的工作不同,该诊断从工具使用必要性、查询生成源头和证据敏感性三方面解耦了搜索与知识回溯,揭示了当前搜索代理普遍存在的根本性缺陷。
  • **LiveBrowseComp** 是一个深度搜索基准,专门设计为抑制 IKD:问题答案均依赖于基准构建前 90 天内发布的事实,并过滤掉全球显著事件,使得闭卷准确率在全部代理中低于 2%,搜索增强分数较 BrowseComp 直降 25–40 个百分点,且原先的模型排名完全失效。这打破了静态基准中因知识时间覆盖导致的虚假高分,首次以动态更新的方式强制代理进行证据驱动的发现,而非依赖过时知识。其方法学——基于时间、长尾和答案稳定性的三阶段过滤——为评估真实搜索能力提供了可复用的构建范式,并清晰暴露出现有模型在实时信息获取与探索式搜索上的不足,推动搜索代理从“验证已知”转向“探索未知”。

方法

输入:动态信息源筛选

方法以六类持续更新的结构化数据源为核心输入:GDELT(全球事件)、TMDB(影视)、RAWG(游戏)、CVE(网络安全漏洞)、专业体育赛事记录及USGS地震数据。这些源覆盖不同领域,且更新频率足够高,能提供大量近90天内的新事实,作为构建考题的种子库。

关键模块:种子过滤与题目构造

整个流程分为五个阶段,从原始数据到高质量题目:

  1. 时间过滤:仅保留数据源中最近90天内发布或更新的条目,确保它们超出主流LLM的训练截止期,从源头上抑制内在知识依赖。
  2. 长尾过滤:排除经全球主流媒体广泛报道的事件(通过网页抓取流行度评分筛选),优先选取未被大规模索引的“长尾事实”,进一步降低模型通过预训练记忆直接回答的可能。
  3. 答案稳定性过滤:移除非唯一答案或答案会随时间变化的条目(如持续更新的排行榜),保证每道题有确定、恒定的答案。
  4. 问题构建:基于过滤后的种子,由人类作者手工编写需要深度搜索才能回答的问题,问题设计要求跨多个网页进行信息聚合、对比或推理,而非简单的单步检索。
  5. 同行评审:通过多轮人工核查验证问题的正确性、答案唯一性、对搜索工具的难度依赖以及事实的时效性,确保每个问题都符合“必须依赖外部搜索证据”的标准。

输出:LiveBrowseComp基准

最终产出包含335道高难度、答案确定且时效性强的搜索任务数据集。所有题目答案均无法被当前先进模型(如GPT-4、Gemini等)在关闭搜索工具的情况下正确回答(闭合书准确率<2%),从而构成一个衡量搜索智能体证据驱动发现能力的严格测试集。

与BrowseComp等静态基准的差异在于:LiveBrowseComp通过长尾事实与时效约束,强制将模型从“记忆验证”推向“搜索探索”,使排名不再受模型内在知识量混淆。

实验

实验设计

实验包含两个阶段:首先在 BrowseComp 静态基准上通过三种诊断分析搜索 agent 的 内在知识依赖 (IKD):(1) 无工具问答评估模型已知知识的覆盖;(2) 移除答案支持证据后观察搜索增强性能变化;(3) 分析搜索查询的来源(内部假设 vs 检索线索)。随后引入 LiveBrowseComp,通过时间过滤、长尾过滤和答案稳定性过滤构建335道问题,确保答案依赖近90天内发布的、非全球热点的事实,以抑制 IKD。最后在 LiveBrowseComp 上评估多个 agent 的封闭式和搜索增强表现,并与 BrowseComp 对比。

关键发现

  • 在 BrowseComp 上,agent 最高可 无工具回答 44.5% 的问题;移除支持证据后,搜索增强性能甚至低于封闭式基线。
  • 超过 50% 的搜索查询来自内部假设,而非检索获取的线索,表明 agent 偏向记忆验证。
  • 在 LiveBrowseComp 上,所有 agent 的封闭式准确率 骤降至 2% 以下,搜索增强得分较 BrowseComp 下降 25-40 个百分点
  • 先前的模型排名无法可靠预测 LiveBrowseComp 表现,搜索行为转向更探索性的多轮查询。

与基线对比解读

静态基准 BrowseComp 容易奖励模型的预训练记忆,混淆“已知”与“可搜寻”,而 LiveBrowseComp 通过动态新鲜事实的设计,迫使 agent 依赖实时搜索,从而更真实地反映其证据驱动发现能力。对于工程实践,这意味着评估搜索 agent 时决不能仅凭静态基准得分,必须引入时间敏感的、抑制 IKD 的测试,以避免高估模型的真实信息获取能力。这一发现提醒我们,当前 LLM 的 tool use 评测可能存在严重的知识泄漏,构建动态基准是提升鲁棒性评估的关键方向。

行业影响

对搜索代理产品的重新审视

落地场景 基于 LLM 的搜索代理(如 Deep Research、Bing Chat、Perplexity 等)正被集成进知识管理、市场情报、研发调研等场景。本论文揭示的内在知识依赖 (IKD) 问题,表明现有产品可能高估了代理的实时搜索能力。对于依赖动态信息的业务——例如金融事件驱动交易、漏洞情报监测、体育赔率分析——使用静态基准(如 BrowseComp)评估的代理,实际可能仅复现训练数据,而非真正探索。因此,产品经理需重新设计评测流水线,避免在动态场景下过度信任代理。

商业价值

  • 降低决策风险:金融、安全等领域的错误检索可能导致交易损失或响应延迟。识别 IKD 可帮助供应商明确模型能力边界,制定更可靠的 SLA。
  • 优化推理成本:代理在无工具情况下仍能回答大量问题,意味着可对静态知识型查询关闭搜索模块,节省 API 调用费用。对于高频问答场景(如电商客服),可设计分层架构:先判断是否为训练时已知事实,仅对未知事实启动搜索。
  • 提升用户信任:当用户发现代理在信息已更新时仍给出旧答案,信任度下降。通过 LiveBrowseComp 这类动态基准筛选代理,可提升产品在时效敏感领域(如体育比分、CVE 漏洞库)的用户留存。

与现有产品/工作流的接口 现有代理流水线通常包括查询改写、检索、阅读、推理、答案生成等模块。为抑制 IKD,可在以下环节集成改进:

  1. 查询生成阶段:监控是否为检索驱动(而非基于模型内部生成假设),引入“探索性查询”奖励信号。
  2. 证据段校验:增加后处理步骤,对比封闭书答案与检索增强答案,若一致则标记为“高 IKD 风险”,交由人工审核或降级显示置信度。
  3. 评测体系升级:将 LiveBrowseComp 纳入持续集成流水线,定期测试代理对近期事实的覆盖,确保模型升级或 RAG 组件变更后仍能有效检索。

具体落地 use case

  • 电商竞品监控:某电商平台需每日追踪竞品的新品发布、价格变动。若搜索代理依赖 IKD,可能遗漏前天刚上架的商品。通过集成 LiveBrowseComp 风格的动态事实源(如爬虫抓取的动态页面),代理可强制进行外部检索,确保情报时效性。
  • 安全运营中心 (SOC):威胁情报分析师使用代理查询最新 CVE 漏洞细节。IKD 可能导致代理输出训练截止日期前的旧描述,而攻击者已在利用新变种。通过过滤已知漏洞库、仅评估最近 90 天新增的 CVE,可确保代理真正从 NVD 等源获取最新信息,降低误判率。

局限

  • **时间依赖性与可重复性**:LiveBrowseComp 的问题基于构建前 90 天内发布的事实,随着时间推移,答案可能变化或失效,导致基准的可重复性下降。虽然作者通过快照等方式缓解,但仍需要持续维护和更新,增加了基准的维护成本。此外,过滤掉全球显著事件可能导致某些领域的代表性不足,且动态更新的频率未明确。
  • **覆盖范围与泛化性**:数据集仅包含 335 个问题,来源限于六种特定类型(全球事件、影视、游戏、安全漏洞、体育、地震数据),可能无法全面反映真实世界中搜索智能体的各种使用场景。某些领域(如科学文献、商业数据)未被覆盖,智能体在这些领域的 IKD 行为可能不同。此外,人类评估成本高,限制了规模扩展,且问题难度可能随时间变化而漂移。
  • **IKD 抑制的彻底性**:尽管设计上通过时间过滤和长尾筛选来抑制内在知识依赖,模型仍可能从训练数据中间接获知某些事实(例如,通过相关讨论或预印本),导致闭卷准确率并非严格为零。论文的实验表明闭卷准确率低于 2%,但这个微小比例在更大规模测试中可能被放大,且对于具备极强检索能力的智能体,仍可能通过推理补全部分信息,从而不完全排除内在知识的影响。
论文HuiMing Fan2026-05-27原文

相关内容