美团开源LoHoSearch搜索智能体基准,知识图谱自动出题难倒GPT-5.5
美团推出LoHoSearch基准,用知识图谱自动构造难题,GPT-5.5准确率仅34%,暴露现有搜索智能体的长程推理短板。
美团开源LoHoSearch,一个基于知识图谱自动生成高难度搜索题目的评测基准,替代人工出题。544道题覆盖11领域,GPT-5.5准确率仅34.74%,远低于在饱和基准BrowseComp上的表现,为下一代搜索智能体提供了真正的挑战。
正文摘录
 下一代搜索智能体评测基准!美团开源LoHoSearch,用知识图谱校准AI能力认知 美团 LongCat 2026-07-24 LongCat 开源 大模型 过去一年,我们见证了 Search Agent 能力的显著演进。在 BrowseComp 等评测上,顶尖模型准确率从最初的30%区间迅速攀升至90%以上。然而,当基准迅速饱和,其区分模型能力的价值也随之递减。  BrowseComp 的题目由人工设计,局限在于只能基于标注者已知的实体和关系构思,无法站在全局知识网络视角判断:哪些条件真的难检索?哪些约束的候选空间足够大?正是这种局限,让我们开始思考另一种可能性: 能不能让机器自己来出题? 美团 LongCat 团队在最新论文中提出的 LoHoSearch 基准,就是把这种可能性变成了现实。 LoHoSearch 的核心"硬核"看点 - 知识图谱自动化构造。 以覆盖762万维基百科实体的知识图谱为基础自动生成题目,替代人工出题。基准含544道经人工核验的题目,覆盖11个领域。 - 双维度难度控制。 在生成中系统控制搜索空间与结构复杂度。构建出难度显著高于现有基准的挑战性问题。 - 当前模型性能表现。 已评测模型中,GPT-5.5 准确率为34.74%;