Ko-WideSearch:面向Web代理穷举集合枚举的韩语广度搜索基准
现有Web代理基准 overwhelmingly 评估搜索深度——在约束链后挖掘单一隐蔽答案——而广度(穷举封闭集合并填充每个项目的属性)很少被评估,尤其非英语环境。构建广度基准困难:验证金集合的完整性及每个单元格正确性远比检查单个答案昂贵。 本文提出Ko-WideSearch,一个韩语广度搜索基准,通过自动化合成-验证管道构建。每个任务指定一个集合父实体(如电视剧季、王朝、联赛、行政区、选举),要求完整成员列表及每个项目的属性表。评分采用Item-F1、Column-F1和Row-F1。基准包含190个实体上的228个表格,十六个类别,设置三个难度层级,通过两个结构旋钮独立调节——表格宽度和2-D复合键——使得跨层级的叉积成员从0%升至100%。一个归一化感知比较器同时用于金集构建和评分,避免因格式差异误判日期、计数等稳定列。 测试20个Web代理,发现一致失败模式:代理能恢复集合但无法恢复行(如Item-F1 92.8 vs Row-F1 53.7);随着旋钮增强准确率稳定下降;增加搜索或预算无法弥补差距。逐单元格分析,难点在于找到正确值而非格式化:开放式自由文本单元格失败最多,而日期、名称等标准答案单元格表现良好。 结论:当前Web代理在广度搜索任务中,行级恢复仍是主要瓶颈,需设计新策略来提升属性填充的完整性。
论文精读
TL;DR Ko-WideSearch 用自动化流水线构建韩语广度搜索基准,揭示 Web Agent 普遍能找全集但填不好属性表,且难度可通过表宽和复合键独立调控。
问题
问题背景
Web Agent 评测长期聚焦于深度搜索(depth),即绕过层层约束锁定单一答案;而广度搜索(breadth)——穷举封闭集合的全部成员并填入每项属性表格——几乎未被系统性评估,尤其在非英语场景。这导致当前基准无法反映 Web Agent 在处理信息汇总类真实任务时的能力全貌。
现有方法局限
- 深度基准构造简单,但广度基准构造代价极高:验证一个黄金集合的完整性和每个单元格的准确性,远比检查单一答案困难,人工构建几乎不可行。
- 缺乏非英语广度评测:现有 Web Agent 基准(如 GAIA、WebArena)几乎全为英语,且任务设计侧重单点答案,无法衡量韩语等语言下对结构化集合的穷举能力。
- 评测粒度粗糙:传统指标只看最终答案正确与否,无法区分“找对成员但属性错漏”的典型失败模式。
为什么这个问题难且重要
从工程角度看,广度搜索要求 Agent 具备三重能力:集合发现(找到所有子实体)、属性填充(提取每项的正确值)、表格一致性维护。任何一环断裂都会导致整体失败。论文揭示,即便最先进的 Frontier 模型,也能以 92.8% 的 Item-F1 找回成员,但 Row-F1 骤降至 53.7%,说明属性填充是真正的瓶颈。技术上,通过引入两个独立的结构 knob——表格宽度和二维复合主键——可控制 cross-product 成员比例从 0% 到 100%,系统性地调节难度,暴露了模型在组合爆炸和自由文本单元格上的脆弱性。自动化合成-验证流水线解决了标注成本问题,但归一化感知比较器的设计仍是挑战,需避免因格式差异误判稳定列(如日期、计数)。该基准为评估信息检索 Agent 的完整性与鲁棒性提供了量化工具,对需要批量信息采集的企业应用有直接参考价值。
行业类比:就像要求 AI 助手为项目的所有子任务自动填充状态、负责人和截止日期,而非只回答“最晚的任务是什么”——广度搜索基准模拟的正是这类常见但高要求的业务汇总场景。
核心洞察
- 当前 Web agent 基准几乎只测深度搜索(在约束链后定位单个答案),而广度搜索(穷举封闭集所有成员并填充属性表)极少被评估,尤其在非英语环境下。Ko-WideSearch 填补了这一空白,通过要求 agent 完全枚举集合的成员表,揭示出 agent 普遍能恢复集合(Item-F1 92.8)却无法完整恢复行(Row-F1 53.7)的失败模式,表明现有 agent 在结构化信息穷举上存在根本性缺陷,而非简单的检索不足。
- 该基准通过两个独立的结构旋钮——表格宽度和二维复合键——精确控制难度,使交叉产品成员资格从 0% 到 100% 变化,系统性暴露了 agent 在行恢复上的能力梯度。实验发现,随着难度提升,性能持续下降,且更多搜索次数或更高推理预算均无法缩小差距。进一步的分析指出,开放文本单元格是主要瓶颈,而标准格式的单元格(日期、名称)通常正确,这为优化 agent 的细粒度信息提取能力提供了明确方向。
方法
输入
每个任务提供一个集合父实体(如“电视剧《黑暗荣耀》的主要角色”)和一组待填充的属性名(如“演员姓名”、“角色名”),要求智能体在开放网络中搜索,并生成一张完整的属性表。
关键模块
自动合成-验证流水线: 构建真值表分两步——先由合成器(synthesizer)根据父实体和属性提示,利用搜索工具草拟表格;再由验证器(verifier)通过多源交叉比对、众包逻辑检查等,确保集合的完备性和单元格正确性。该流水线可批量产出任务,大幅降低人工成本。
难度层级控制: 通过两个独立调节的“旋钮”结构化地提升难度:
- 表格宽度(列数): 属性越多,智能体需要定位并填充的单元格呈线性增加;
- 二维复合键(2-D composite key): 当集合成员需要由两个维度交叉定义(如“年份×国家”的奥运奖牌榜),智能体必须从不同页面提取并对齐片段,导致交叉产物占比从0%升至100%。
标准化感知单元比较器: 统一用于真值构建和自动评分,对日期、计数等稳定列做格式规范化(如“2023-01”与“January 2023”视为相等),避免因表面形式差异误判为错误。
网络基源分级: 标注每个任务答案的网页来源层级(如官方页面、权威数据库、可编辑的Wiki),确保任务可复现且难度合理。
输出
基准最终包含228张真值表,覆盖190个实体、16个类别,三个难度层。评估指标为Item‑F1(集合成员召回)、Column‑F1(列完整性)和Row‑F1(整行完全匹配),其中Row‑F1是衡量广度枚举的核心瓶颈。
差异点
与现有只测单点答案深度的基准不同,Ko‑WideSearch强制智能体完成穷举式集合枚举,并通过自动化流水线加二维复合键,系统性地探测广度搜索能力的边界。
实验
实验设计
Ko-WideSearch 是一款针对 广度搜索(breadth-search)而设计的 Web 代理基准,包含 228 个表格、覆盖 190 个集合父实体(如电视剧季、王朝、联赛、行政区划、选举)和 16 个类别,并划分为三个难度等级。难度通过两个独立的结构旋钮控制——表格宽度(即每行需填充的属性列数)和 二维复合键(行需同时满足两个独立维度的约束),从而使跨类别成员的交叉乘积比例从 0% 升至 100%。评估了 20 个 Web 代理,涵盖多种语言和规模模型,使用 Item-F1(集合成员召回)、Column-F1(特定列填充完整性)和 Row-F1(整行完全正确)三个指标,并与人类构建的真实表做严格比对。评分采用 归一化感知的比较器,避免日期、计数等稳定列因格式差异被误判。
关键发现
所有被评估代理表现出高度一致的失败模式:能够较好地恢复实体集合的成员(如 Item-F1 高达 92.8),但难以完整填对整行(Row-F1 仅 53.7)。随着难度旋钮变硬(宽表、复合键),准确率持续下降,且增加搜索步数或 API 花费(dollars)都无法弥合这一差距。细粒度分析显示,开放式自由文本单元格是最主要的瓶颈,而日期、名称等有标准格式答案的单元格错误率较低;这说明问题的核心在于信息检索与值获取,而非输出格式化。
与基线对比的深度解读
该基准并无传统意义上的单一 baseline,而是通过多代理横向比较揭示出当前 Web 代理在 广度枚举任务上的普遍短板。相较于常见的深度搜索基准(仅需寻找一个隐蔽答案),Ko-WideSearch 暴露出代理在组合式信息收集、属性完整性验证方面的系统性缺陷。这一差距可能源自训练数据和指令微调中过度关注单次检索,而忽略了大型表格的构建。对于工程实践而言,这提示需要开发支持多重依赖查询、表格状态跟踪的代理架构,并通过合成数据引入更多结构化表格生成任务来弥补现有评估的盲区。
行业影响
落地场景
Ko-WideSearch 所衡量的广度搜索能力——即穷举封闭集合、填充属性表格——直接映射到工业界对信息完整性有严格要求的场景:
- 商业情报与竞品分析:自动枚举某一赛道(如“投影仪品类”)的全部品牌与型号,并提取关键参数(亮度、分辨率、价格),生成对比矩阵。
- 合规与尽职调查:列举某集团的完整子公司列表、高管任职、关联交易,填入标准化表格,避免人工遗漏带来的法律风险。
- 知识图谱构建:从公开资料中抽取某行政区域的全部下辖市、人口、GDP,形成结构化数据库。
- 内容聚合:为影视季数枚举全部剧集及其导演、播出日期,或为体育赛季列出所有参赛队伍与战绩。
现有多数 AI 代理擅长“深挖一个答案”,但在上述场景中常出现集合成员发现不全、行属性填写错误的问题,这正是本基准暴露的核心短板。
商业价值
- 降本:将人工数小时的结构化信息采集压缩至分钟级,且减少审查返工。实验显示 Agent 的 Item-F1 可达 92.8%,但 Row-F1 仅 53.7%,意味着仍须人工校核,但已能过滤大量机械劳动。
- 增收:更完整的市场地图可辅助发现蓝海产品、定价机会;完整的供应链清单可降低断供风险。
- 体验提升:企业搜索助手若仅返回“最相关”的几条结果,用户需反复查询才能获取全貌;广度感知后可一次性给出完整集合,提升产品专业度。
与现有产品 / 工作流的接口
Ko-WideSearch 本身是评估基准,可直接嵌入 Agent 开发管线:
- 作为回归测试套件,在模型选型、提示工程或工具链变更时,自动衡量广度性能是否下降。
- 与 RAG 管线结合:将该基准的测例转化为“全量检索”模板,要求检索系统返回集合所有元素而非 Top-k 片段,推动向量数据库/搜索引擎优化全覆盖率。
- 输出格式标准化:基准中使用的
Item-F1、Column-F1、Row-F1三指标可集成到 AI 工作流的质量门禁中,对 Agent 的表格输出自动打分。
具体落地用例
电商智能选品工具
某平台需生成“全球主流智能手表”规格对比页。Agent 接管任务:先确定集合父实体“智能手表品牌”,再穷举所有型号,逐个抓取芯片、续航、价格等属性,输出表格。Ko-WideSearch 的 Row-F1 能立即检测出是否遗漏了某个子型号或填错了续航值,帮助产品经理判断该 Agent 是否可投入生产。金融合规自动化
为反洗钱审计,合规人员需整理某跨国企业的完整股权结构。Agent 搜索子公司、孙公司名单及其注册地、持股比例。若仅返回 80% 实体,或把“100%”误填为“10%”,都可能触发监管风险。该基准的 normalization-aware comparator 能区分格式差异与事实错误,避免因日期/数字格式不匹配而误报,更精准评估 Agent 是否达到合规级可用性。
局限
- **仅限韩语且领域覆盖偏窄**:基准完全围绕韩语实体构建(电视季、王朝、行政区划等),虽填补了非英语广度搜索的空白,但语言单一导致结果难以直接迁移至其他语言。此外,190个实体集中于16个类别,可能遗漏现实世界中更复杂的集合类型(如动态更新的实时数据源),限制了评估的生态效度。对多语言 web agent 的扩展性尚待验证,且自动化流水线依赖韩语特性(如日期格式、命名习惯)可能在其他语言中失效。
- **自动化合成管线本身引入偏差**:合成—验证管线虽降低了人工构建成本,但验证器(基于归一化比较器)可能残留未发现的标注错误,尤其在自由文本属性上。论文虽进行了人工抽检,但224张表的全量人工校验未完成,金标质量依赖流水线的鲁棒性。此外,归一化比较器在评测时可能过度宽容格式化差异,导致分数不能完全反映真实语义理解差距,尤其对需要深层推理的长文本字段。
- **评估范式的单一性**:基准仅以表格式 F1 衡量枚举完整度与属性准确性,未考虑更复杂的现实需求(如时效性、置信度排序、交互式查询)。且实验受限于固定20个 web agent(多为GPT-4/Claude等前沿模型),未覆盖开源代理或人机协作场景,限制了结论的普适性。难度梯度虽由表宽与复合键控制,但仍为静态合成,无法反映开放 Web 上真实广度搜索的动态约束(如反爬、权限、多模态信息)