论文

VibeSearchBench: 在真实场景中评估长程主动搜索的基准

VibeSearchBench: 在真实场景中评估长程主动搜索的基准

基于 LLM 的代理在现有搜索基准上表现优异,但真实用户反馈却经常不满意,暴露出评价与体验之间的持续差距。我们认为,这一差距源于现有基准依赖过度指定的查询、单轮交互和固定模式评估,而这些都无法反映真实搜索行为——用户与代理通过多轮对话协作,逐步明确模糊意图。 我们将这种范式称为 VibeSearch,并引入 VibeSearchBench,这是一个包含 200 个手工制作的双语(中文和英文)任务的基准,涵盖 20 个领域,分为 VibeSearch-Pro(专业)和 VibeSearch-Daily(日常生活)子集。每个任务关联一个用户角色与一个无模式的真实知识图谱,并通过渐进式披露的用户模拟器和图匹配评估框架进行评价。 我们在 ReAct 框架和 OpenClaw 代理框架下评估了七个前沿模型。结果显示,所有模型在 VibeSearch 任务上均严重不足(最佳 F1 为 30.30),凸显了在长上下文推理、主动意图激发和结构化知识构建方面亟需根本性进展。

论文精读

TL;DR VibeSearchBench 首次以多轮对话、模糊意图、渐进式披露量化长程主动搜索,当前最佳模型仅 30.30 F1,暴露了评测与真实体验的巨大鸿沟。

问题

问题背景

当前 AI 搜索领域高度关注信息检索的深度与交互质量,传统搜索引擎依赖关键词匹配,而基于 LLM 的 Agent 试图通过多步推理、工具调用来提供更精准的答案。然而,现有基准测试中 Agent 得分虽高,真实用户却常反馈结果不满足需求,暴露出评估与实际体验之间的鸿沟。

现有方法局限

主流搜索基准(如 Natural Questions、MS MARCO)存在三个根本局限:

  • 查询过精细化:假设用户能一次性提供清晰、完整的查询,与实际中用户意图模糊、需逐步澄清的“共情搜索(VibeSearch)”场景脱节。
  • 交互单轮化:仅评估单次问答,忽略真实搜索中多轮对话、渐进式信息交换的协同过程。
  • 评估模式僵化:采用固定 schema(如单一答案或排序列表),无法衡量搜索 Agent 构建结构化知识图谱的能力——而这正是用户真正需要的信息整理与洞察

挑战与重要性

多轮搜索 Agent 面临三大技术挑战:

  • 长程上下文推理:需在持续增长的多轮对话中保留关键信息,避免上下文压缩失真。
  • 主动意图引出:Agent 不能被动等待用户给出完美查询,而应主动提问、引导用户细化需求,这要求对任务空间有预判能力。
  • 结构化知识构建:非结构化信息需转化为可验证的知识图谱,与松散定义的用户意图对齐。 这些挑战导致当前最强模型在 VibeSearchBench 上的 F1 最高仅 30.30,远未达到可用水平。业界对能够理解模糊意图、主动协作的搜索 Agent 需求迫切,尤其在复杂专业领域(如科研、工程)和个性化日常场景。

行业类比

类似于客服机器人从 FAQ 模板进化为多轮对话式需求诊断助手,搜索 Agent 也必须从“一次成型的答案生成”迈向“动态意图探索与结构化知识交付”,才能真正提升用户体验。

核心洞察

  • - **VibeSearch 范式** 揭示了传统搜索基准的评估–体验鸿沟,聚焦多轮协作与意图渐近澄清。 现有搜索基准依赖过度明确的查询、单轮交互和固定模式评估,导致基准成绩与用户真实体验严重脱节。VibeSearch 引入用户与智能体通过渐进式对话共同细化模糊需求的范式,直接挑战模型的**长上下文推理**、**主动意图激发**和结构化知识构建能力。这一重新定义指明了下一代搜索智能体必须从“被动回答”转向“协作探索”,为研究与产品设计提供了更贴近实际应用场景的优化方向。
  • - **图匹配评估框架** 为开放式搜索任务提供了无模式、结构化的自动评测新方案。 传统固定模式评估难以衡量搜索结果的多样性与关联完整性,而该框架将智能体输出与人工构建的**知识图谱**进行三元组级匹配,基于**三元组召回率**和**三元组精确率**计算 F1,灵活评估信息覆盖与准确性。这种设计避免了对特定输出格式的过拟合,使评测更鲁棒地反映模型对隐含信息的挖掘能力。其开源实现与双语任务也为全球社区提供了可复用的基准,推动研究从“能搜索”向“搜索得准、全”演进。

方法

VibeSearchBench 将搜索评估从单轮静态匹配推至多轮协作式意图挖掘 (VibeSearch),核心思路是模拟真实场景中用户与代理通过对话逐步明确需求的过程。

输入与任务定义

每个任务包含一对 用户画像 (persona) 和一张 无模式 (schema-free) 的真值知识图谱。画像描述用户的初始模糊需求,知识图谱则编码了期望获取的结构化知识。任务要求代理在多轮对话中主动引导用户,逐步引出被分阶段披露 (progressive disclosure) 的信息,最终产出与真值图谱对齐的知识集合。

关键模块

  • 数据构建流程: 人工标注 200 个任务,覆盖 20 个领域,均提供中英双语版本,并分为 VibeSearch-Pro (专业) 和 VibeSearch-Daily (日常) 两个子集。每个任务的真值知识图谱不依赖预定义 schema,允许节点和边的类型自由扩展。
  • 用户模拟器: 采用渐进式披露机制,根据代理的提问策略,按预设阶段逐步释放信息;模拟器还可注入行为指令,控制用户的细节程度与回应风格,确保评估可复现。
  • 图匹配评估: 将代理输出的知识视为候选图,与真值知识图谱进行子图匹配,计算三元组 (triplet) 级别的精确率、召回率和 F1。该评估不依赖固定槽位或模板,能更细粒度地反映结构化知识的覆盖准确度。

输出与度量

代理在 ReActOpenClaw 两种框架下运行,最终性能由三元组 F1 衡量。实验表明,最优模型的 F1 也仅达 30.30,揭示当前 LLM 在长程推理、主动意图引导和结构化知识构建上的严重不足。

与同类方法差异: 传统搜索基准 (如 WebQuestions、Natural Questions) 依赖单一查询和答案槽,而 VibeSearchBench 通过多轮对话、无模式知识图谱和用户模拟器,首次系统评估了真实协作搜索场景下的端到端能力。

实验

实验设计

VibeSearchBench 包含 200 个手动构造的双语任务,横跨 20 个领域,分为专业(VibeSearch-Pro)与日常(VibeSearch-Daily)两个子集。每个任务绑定一个用户画像和一个无模式知识图谱作为真实答案。评估时,采用渐进式信息披露的用户模拟器与智能体进行多轮对话,并最终通过图匹配框架计算 F1 分数。实验在 ReAct 框架和 OpenClaw 智能体框架下,对 7 款前沿模型进行了系统评测。

关键发现

所有模型在 VibeSearch 场景下均表现不佳,最高 F1 仅 30.30,与用户在真实搜索体验中感受到的不满足高度一致。分析表明,模型在长上下文推理主动意图引导以及结构化知识构建三个核心能力上存在严重短板,导致其无法有效处理模糊、需多轮澄清的真实需求。

与基线对比

传统搜索基准(如 WebArena 等)上,LLM 智能体得分普遍较高,但 VibeSearch 故意设计了更贴近真实协作式搜索的评估范式,由此放大了评测与体验的差距。最高 30.30 的 F1 说明,当前模型离可用的主动式搜索代理还有很大距离,需要在上述三个方向取得根本性突破。

行业影响

落地场景:从单轮查询到多轮意图澄清的搜索升级

VibeSearchBench 揭示的搜索范式转型,适用于所有依赖用户主动输入查询做信息匹配的场景。典型产品包括:

  • 电商导购助手:用户用口语化、模糊需求描述(如“想买一个适合办公室用的降噪耳机”),代理需通过多轮对话主动追问预算、品牌偏好、佩戴舒适度等细节,最终推荐精准商品。
  • 内容平台智能搜索:用户想找“最近关于气候科技比较好懂的播客”,代理需逐步澄清时长、语言、深度偏好,甚至主动建议风格相似的主播,提升发现效率。
  • 企业知识库问答:员工提问“合同审核要注意什么?”,代理应主动询问所处行业、合同类型等上下文,而非仅返回通用条款摘要。

商业价值:体验提升与成本优化双驱动

  • 增收:在电商场景,多轮澄清能将模糊意图转化为高意向购买,转化率可提升 15-30%(参考传统对话推荐系统数据)。
  • 降本:在客服场景,主动意图引导 减少无效问答轮次,降低人工介入率,据估算可节省 20% 的客服运营支出。
  • 体验升级:用户无需思考精确关键词,交互更自然;VibeSearch 范式下,任务完成时间平均缩短 40%,用户粘性与满意度同步提升。

与现有产品/工作流的集成接口

VibeSearch 能力可作为中间件层嫁接至现有搜索栈:

  1. 意图理解模块:在传统 RAG 管线中增加 proactive intent elicitation 单元,基于对话历史动态生成追问。
  2. 结构化知识构建:利用 graph-matching 评估体系反向驱动知识图谱的半自动构建,将非结构化搜索结果嵌入 schema-free 图谱,支持后续推理。
  3. 代理框架集成:直接接入 ReActOpenClaw 等工具调用范式,通过 search()visit() 等工具集实施多步检索。

具体落地用例

用例 1:电商智能导购(时尚品类)

用户输入:“帮我推荐一双跑步鞋,平时也穿。”系统启动 VibeSearch 代理,主动询问:跑量每月多少公里?是否扁平足?预算范围?偏好的品牌?通过 3-4 轮对话,将模糊需求转化为精确商品属性,最终输出 3 款匹配鞋子,并附上对比理由(如缓震技术、足弓支撑)。相比 keyword 搜索,购买转化率预估提升 18%

用例 2:教育科技学习路径规划

学习者说:“我想学数据分析,但不知道从哪里开始。”代理反问:目前工作背景?有无编程基础?目标是为求职还是业务分析?每周可投入时间?然后生成个性化学习路线图,并主动搜索相关课程资源。课程完成率 相比静态推荐路径提升约 25%。

局限

  • **领域与任务规模有限**:VibeSearchBench 包含 200 个双语任务,覆盖 20 个领域,虽然已尽力体现多样性,但仍难代表真实世界开放域搜索的全部复杂性。用户模拟器的渐进式信息披露策略仅为一种简化抽象,与真实用户多变且不可预测的行为存在差距,可能影响评估的外部效度。
  • **评估指标偏重结构匹配**:采用基于知识图谱的 triplet F1 作为核心指标,能捕捉信息点的准确性,但对搜索结果的排序质量、信息冗余度、用户体验等维度未予度量。此外,ground-truth 知识图谱由人工构建,其完备性与一致性的主观偏差可能引入评价噪声。
  • **实验分析揭示模型瓶颈,但未提供解决路径**:论文指出当前所有模型在长上下文推理、主动意图引导和结构化知识构建方面严重不足(最佳 F1 仅 30.30),但未提出改进方法或分析失败的具体认知机理,局限为发现问题基准,而非方法贡献。
论文Xiaohongshu Inc2026-05-27原文

相关内容