明略科技WebRetriever全球挑战赛开放报名,奖池1.5万美元
WebRetriever是首个大规模真实网站Web Agent评测基准,揭示现有模型端到端任务完成率仅约20%,挑战赛激励性能突破。
明略科技联合北大、中科院等机构推出WebRetriever基准测试,覆盖800个真实网站、1550项任务,论文被ECCV 2026接收。同期举办全球挑战赛,总奖池1.5万美元,旨在推动Web Agent在真实互联网环境中的任务完成能力评测。
正文摘录
.jpg) 今日,WebRetriever 全球挑战赛报名正式开启! 本次大赛由明略科技主办,北京大学(软件工程国家工程研究中心) 、中国科学院自动化研究所、中国科学院香港创新研究院人工智能与机器人创新中心、机器之心联合协办。 赛事总奖池共计 15000 美元,个人或团队均可报名,不限国籍、不限机构背景。欢迎学术界、产业界以及独立开发者们阅读文章下方报名方式,与全球顶尖高手同台竞技! 赛事背景 当 AI 智能体走进真实浏览器,它能否像人一样,在充满动态变化的互联网环境中,真正独立完成一项任务? 这是 Web Agent 从实验室走向真实部署的核心瓶颈。长期以来,业界缺一把足够真实的"尺子"——主流 benchmark 多基于少量模拟或自建站点,与真实开放互联网的复杂度存在显著差距;评测维度上,现有方法多关注操作执行的正确性,而对 Agent 能否真正交付最终任务结果缺乏系统性度量。 针对上述不足,明略科技构建了大规模 Web Agent 综合评测基准 WebRetriever,相关论文已被国际顶级学术会议 ECCV 2026 正式接收: - 规模领先——覆盖 800 个真实在线网站、1,550 项跨行业任务,横跨科技、金融、医疗、教育、政务等八大领域,全程真实互联网环境。 - 评测更准——自研 NavEval 框架,与人类专家判断一致率达 91.2%(现有最优方法约 81%),首次让大规模自动评测达到可信精度。 - 直指鸿沟——评测数据揭示:即便是表现最优的单一模型,基础导航成功率也不足一半,而端到端完整任务完成率仅约 20%。"到达"远不等于"完成"。