论文

HyperBrowseComp:面向网页浏览智能体的多语言多模态压力测试

HyperBrowseComp:面向网页浏览智能体的多语言多模态压力测试

HyperBrowseComp 是一个多语言、多模态的网页浏览基准,包含 423 道人工撰写并经人工校验的问题,覆盖 13 种语言,全部由母语者或高度熟练的使用者编写。 题目被刻意设计得极具挑战性。每道题都指向一个简洁且可公开验证的答案,而要找到答案,需要定位冷门证据、循着多步线索链推理,或检查视频、扫描文档、图像、地图等异构来源。为剔除较容易的题目,作者用无法联网的模型对其进行评估,以降低仅凭参数化知识即可作答的可能性。 实验方面,作者在统一的 agent protocol 下,使用各提供商原生搜索与共享的外部检索框架评测了多个模型;同时抽取部分问题进行人工评测,以对照模型的表现与投入。 HyperBrowseComp 为跨语言、跨证据模态的持续性信息检索提供了颇具挑战性的测试平台,其难度来自在开放网络上发现并连接证据。

论文精读

TL;DR HyperBrowseComp 是多语言多模态网页浏览智能体压力测试基准,涵盖13种语言、423道人工验证难题,要求跨视频/扫描件/地图等异构证据链定位答案,且过滤了可凭参数知识作答的题。

问题

问题背景

Web-browsing agent 正在成为 AI 应用的重要形态,评测其跨语言、跨模态证据检索能力已成为行业关注焦点。

现有方法局限

  • 目前多数 browsing 基准(如 WebArena、Mind2Web)集中于 英文 网页任务,且证据多为 文本或 HTML,很少覆盖视频、扫描文档、地图等非结构化模态。
  • 题目难度过滤不足:部分问题仅靠模型 参数化知识 即可回答,无需实际浏览,导致评测分数无法反映真实检索能力。
  • 多语言覆盖零散,缺少由母语者撰写并人工验证的高难度题目。

为什么这个问题难/重要

  • 真实 web 信息检索要求 agent 能 定位模糊证据、跟随多步线索链、跨模态整合信息,而现有评测无法有效测量这种 持久信息搜寻 能力。
  • 多语言与多模态同时出现显著增加搜索空间和推理复杂度,模型需在数十种语言网站与异构证据中快速切换。
  • 业界对可靠、可复现的 agent 评测需求强烈,一个能区分 检索能力 与 静态知识 的 stress test 对模型选型与迭代具有直接价值。

行业类比

类似 跨语言智能客服 需要同时理解英文产品手册中的截图、德文 FAQ 中的视频片段,并连接多步线索才能给出准确答案,这正是 HyperBrowseComp 所考察的复合能力。

核心洞察

  • 无网络筛选机制确保题目必须依赖浏览而非参数知识。HyperBrowseComp 在构建时用无网络模型评估问题,剔除仅靠模型内部知识即可回答的题目,从而保证每个问题都要求 agent 真正执行网络检索与信息整合。这与以往许多基准(如 NaturalQuestions 或 WebQuestions)不同,那些基准常存在模型靠记忆即可答对的漏洞,导致评估无法真实反映浏览能力。该机制提高了基准的效度,使分数更贴近实际的信息搜寻能力。
  • 多语言多模态的真实压力测试。该基准覆盖 13 种语言,题目涉及视频、扫描文档、图像、地图等异构证据,要求 agent 具备跨语言理解、跨模态信息抽取以及跨页面线索串联的能力。题目的编写由母语者完成,避免了机器翻译导致的语言不自然或歧义,使得语言难度更真实。与现有仅覆盖英文或单一模态的浏览基准(如 Mind2Web、WebArena)相比,HyperBrowseComp 更接近真实世界中全球用户的信息需求,也更能暴露 agent 在低资源语言或视觉内容处理上的短板。
  • 统一 agent 协议与人类评估校准。论文采用共享外部检索 harness(Exa)和提供商原生搜索两种配置,在统一 agent 协议下评估多个模型,同时开展人类评估来量化人类完成题目所需的步骤与时间。这种设计不仅提供了模型间的公平对比,还通过 human baseline 将模型性能映射到人类努力水平,帮助从业者理解当前 agent 与人类在复杂信息搜寻上的差距,并为后续优化方向(如更高效的检索策略、多模态解析)提供依据。相较于其他基准仅报告准确率,该基准的多维度度量更具工程参考价值。

方法

输入:多语言、多模态候选问题

问题由母语者或高熟练度作者撰写,覆盖 13 种语言,答案要求为简洁的公开可验证内容。每个问题设计为需要定位晦涩证据、追踪多步线索链,或检查视频、扫描文档、图像、地图等异构来源。

关键模块:筛选与审计流程

  1. 无互联网预筛选:用不具备联网能力的模型评估候选问题,过滤掉仅靠参数化知识即可回答的简单项,确保题目难度来自开放网络搜索。
  2. 人工验证:持续审核问题的可回答性、答案唯一性与证据可达性。
  3. 难度审计:进一步剔除容易题,保留需要跨语言、跨模态信息整合的 stress-test 题目。
  4. 统一评估协议:在相同 agent 协议下,用 provider-native search 和共享外部检索 harness(Exa)评测多个模型,并记录资源消耗。

输出:HyperBrowseComp 基准与模型性能

最终发布 423 道人工验证问题,附有答案和证据元数据。基准输出包括各模型的 pass@1 分数、搜索步数、token 消耗等,用于衡量持续信息搜寻能力。

与同类浏览基准相比,HyperBrowseComp 的差异在于:同时强调多语言覆盖、多模态证据源和极端难度,并通过无互联网筛选显式排除参数化知识捷径,使评测更聚焦于真实的开放网络导航与证据连接能力。

实验

实验设计

HyperBrowseComp 包含 423 道人工编写并验证的问题,覆盖 13 种语言,问题要求定位罕见证据、串联多步线索或检查视频、扫描文档、图像、地图等异构来源。为排除参数化知识干扰,先让不带互联网访问的模型作答,过滤掉仅靠预训练知识即可回答的题目。最终评估采用两种检索方式:provider-native search 与统一的 外部检索 harness(Exa),并在共同 agent 协议下运行多个模型。同时开展小样本人工评估以建立人类基线。

关键发现

  • 模型在复杂、多语言、多模态的开放式信息检索任务中普遍表现挣扎,需要多轮浏览才能定位线索。
  • 无网筛选显著提升了题目难度,确保评测聚焦于真正的网络探索能力而非静态知识记忆。
  • 不同检索后端对模型性能有影响,且多语言场景下性能分化明显,说明语言覆盖与证据模态多样性是核心难题。

与基线对比解读

与以往只关注英语、单一模态或依赖搜索引擎简单查询的基准(如 WebArena、GAIA)不同,HyperBrowseComp 将难度推向“压力测试”级别:证据隐藏更深、需要跨模态关联,且严格过滤知识泄漏。该设计更接近真实世界信息工作者的任务,同时暴露当前 agent 在长期规划、多步推理和跨语言线索整合上的瓶颈,为后续优化提供了明确靶点。

行业影响

落地场景

HyperBrowseComp 针对的多语言多模态网页浏览能力,可落地到需要跨语言、跨媒介证据定位的产品中。典型场景:

  • 电商商品信息核验:全球商品详情可能分散在视频评测、多语言说明书、扫描版认证证书中,agent 需综合这些信息回答用户关于型号、成分、合规性的提问。
  • 企业合规与尽调:自动检索多国法规、财报扫描件、新闻视频,定位关键条款或事件,替代人工逐页查阅。
  • 内容平台事实核查:对图像、视频、地图等多源信息进行交叉验证,快速确认陈述真伪。

商业价值

核心价值在于降低复杂信息检索的人力成本与提升决策效率。通过基准筛选出在困难检索任务上表现稳定的 agent,企业可将其部署到客服、研究、合规等环节,将原本数小时的人工调研压缩到分钟级。同时,跨语言能力覆盖更多用户群体,多模态理解减少因格式差异导致的遗漏,直接改善用户体验与数据完整性,带来增收与降本双重回报。

与现有产品/工作流的接口

该基准可作为agent 能力评估层集成到现有开发栈:

  • 接入 CI/CD 流水线:在 agent 迭代中运行 HyperBrowseComp,回归检测检索与推理能力变化。
  • 模型选型依据:对比不同模型在统一协议下的表现,辅助技术选型。
  • 复用其 共享外部检索 harness 与 agent 协议,可减少自建评测框架的重复工作,与 LangChain、LlamaIndex 等工具链兼容。
  • 提供标准化问答与评分接口,便于企业内构建定制化评测集。

局限

  • **数据规模与语言覆盖局限**:HyperBrowseComp 包含 423 个手动编写并人工验证的问题,相比现有大规模基准(如 MMLU 涵盖数万题)规模偏小,可能限制对模型在开放网络检索场景下泛化能力的稳健估计。13 种语言的覆盖虽广,但各语言问题数量分布未明确,高资源语言可能占多数,低资源语言样本不足,导致多语言评估的代表性受限。此外,所有问题均由人工编写,成本高昂且扩展缓慢,难以快速适应新领域、新语言或新兴证据类型。
  • **评估协议与工具依赖**:基准评估依赖外部搜索工具和代理框架,不同模型使用提供商原生搜索或共享的 Exa 检索接口,工具的质量、延迟、配额限制和文档结构可能成为混淆变量,影响对模型自身搜索与推理能力的判断,削弱不同模型间的可比性。模型在无网络条件下进行参数知识过滤虽降低了利用内部记忆直接作答的可能,但也可能无意中排除了合理利用参数知识辅助搜索的混合策略,不完全反映真实用户场景中“先验知识+实时检索”的协同方式。
  • **动态性与长期维护挑战**:由于问题答案基于公开网络证据,网页更新、删除、改版或内容失效会导致答案变化或不可验证,基准需要持续监控和定期更新,否则准确性随时间下降。论文未明确说明答案稳定性检测机制或更新周期。同时,人类评估仅覆盖部分问题样本,可能不足以全面标定模型性能与人类努力的差距,特别是对于极难的暗线推理问题。此外,基准的高难度设计可能导致中低水平模型得分过低,区分度不足,难以用于细粒度能力分层评估。
论文Alham Fikri Aji2026-10-02原文

相关内容