WorldCupArena: 对语言模型和深度研究代理在足球预测中的细粒度评估
预测一场足球比赛的结果不仅需要了解历史战绩,模型还需利用实时变化的信息,并在赛前做出明确预测。为此,我们提出 WorldCupArena,一个面向语言模型和深度研究代理的动态基准。2026 年 FIFA 世界杯是首个评测场景,该流程也可复用于未来的联赛和杯赛。 每场比赛前,模型会接收一份标准证据包,或自行搜索信息。它需要预测:比赛结果与比分、可能的球员与事件、比赛统计数据以及赛事最终胜负。赛后,这些预测与实际结果进行对比。我们报告 结果准确率、精确比分准确率 以及 比分评分(当预测比分接近但不完全正确时给予部分分数),同时包含其他预测任务的得分。 在 104 场比赛和 13 个系统的评估中,结果准确率相近的模型在细节预测上差异更明显。与博彩市场和人类球迷基线相比,最佳系统在结果和精确比分准确率上提升有限,但在 Scoreline 上提升更显著。 新赛程可随时添加,使基准能够评估未来模型而无需依赖已知结果。代码、提示词、预测和评估脚本已在 https://github.com/wzk1015/WorldCupArena 开源。
论文精读
TL;DR WorldCupArena 利用 2026 世界杯构建动态预测基准,量化语言模型在赛前的细粒度推理能力,揭示详细预测比胜负判断更能区分模型强弱。
问题
问题背景
当前,语言模型评估正从静态知识问答转向动态、前瞻性预测,以衡量模型在不确定环境下的推理与决策能力。
现有方法局限
大多数基准(如 MMLU、GSM8K)依赖历史数据构造问答对,答案固定且易被记忆。这类静态评估 无法测试模型整合实时变化信息、在事件发生前输出预测的能力。同时,现有预测任务多缺少对多模态证据(文本、数据、赛程)的语义理解与推理环节,难以评估模型利用新闻、统计等多源信息进行深层次研判。传统评估仅关注最终结果准确率,忽略比分预测的序数接近性、事件预测细粒度 以及预测校准度,而现实决策中这些细粒度信号至关重要。
为什么这个问题难/重要
前瞻性预测要求模型在信息不完整、动态变化时进行因果推理与不确定性量化,比静态问答更具挑战。体育比赛结果受战术、伤病、天气等无数因素影响,数据分布随时间漂移,要求模型具备持续学习和鲁棒性。业界关注度上升,因为此类能力直接关系到金融预测、供应链管理等高风险场景,提前预判和概率校准是核心需求。通过WorldCupArena 这类动态基准,可推动从“事后诸葛亮”到“事前军师”的范式转变。
行业类比
该任务类似于将自动驾驶的感知-决策闭环迁移到信息预测领域:模型须在动态环境中实时融合多源信息,输出可靠前向预测,而非仅回答历史交通规则。
核心洞察
- **动态前向预测基准** 将 LLM 评估从静态知识记忆推向真实不确定环境下的推理。现有绝大多数基准使用已标注数据集,模型可能通过记忆而非推理获得高分,WorldCupArena 以未来世界杯比赛为预测目标,确保答案在预测时未知,迫使模型整合动态信息做前瞻性判断。实验显示,即使先进模型在胜平负准确率上与投注市场、球迷基线差距微小,但在细粒度比分接近度(Scoreline)上拉开差距,证明这种基准能更敏锐地衡量复杂推理能力,为构建动态、抗泄漏的 AI 评估提供示范。
- **Scoreline 连续评分** 突破了传统分类准确率的二元局限,捕捉预测质量的细腻差别。足球比分预测中,2:1 与 1:0 虽不同但比 3:0 更接近,单纯的精确匹配和胜平负准确率无法反映这种差异。WorldCupArena 设计的 Scoreline 指标给接近比分的预测赋予部分分数,细化了模型间的性能对比。在评测中,不同模型在结果准确率上可能表现相近,但 Scoreline 能显著区分其量化概率能力,这对工程实践中需要概率校准和顺序敏感输出的任务(如推荐排序、风险评分)具有直接借鉴价值,提示我们应设计更连续的评估函数来捕捉模型的不确定性表达。
方法
WorldCupArena 将足球比赛预测构建为动态基准,其核心流程遵循“输入证据 → 模型预测 → 向量化评估”的范式。
输入与证据构建
每场比赛前,模型可选择两种证据获取模式:
- 静态证据包(Common Evidence Package):由基准统一提供的历史战绩、球队阵容、赔率等结构化与非结构化数据,保证对比公平性。
- 自主检索(Self-Search):模型作为 深度研究代理 可自主搜索实时信息,模拟真实决策中的信息获取不对称。
预测任务定义
模型需输出多粒度预测,覆盖:
- 赛果(胜/平/负)与精确比分。
- 球员与事件:预计首发、进球者、红黄牌等。
- 比赛统计:控球率、射门数等数值型指标。
- 赛事走向:对整个杯赛(如冠军、决赛对阵)的长程推演。
评估指标设计
- Result Accuracy:赛果方向准确率(胜/平/负)。
- Exact-Score Accuracy:比分完全匹配率。
- Scoreline Score:新提出的 折中指标,当预测比分接近真实比分时给予部分得分(例如预测 2-1,实际 2-0),避免仅靠精确匹配导致的过于稀疏的反馈。
- 球员/事件及统计任务采用自定义相似度或正确率指标。
动态更新与防泄漏机制
赛程随真实世界杯推进动态添加,每场比赛的预测时间戳严格控制在开球前,赛后真相立即锁死。新模型可在后续赛程加入时评测,而不会接触到已发生比赛的结果,从根本上杜绝数据泄露。
与其他基准的差异点:不同于静态问答基准(如 MMLU),WorldCupArena 要求模型在答案未知的实时环境中进行前瞻性预测,并通过 Scoreline Score 等细粒度指标揭示系统在风险校准与量化推理上的细微差异,这些差异在单纯的准确率对比中容易被掩盖。
实验
实验设计
WorldCupArena 是一个动态测试基准,首次评估基于 2026 年世界杯的 104 场比赛。13 个系统在赛前接收通用证据包或自行检索信息,对结果、比分、球员、事件、统计数据和赛事走向进行预测。预测在比赛后与真实数据对比,评价指标包括 result accuracy(胜负平准确率)、exact-score accuracy(精确比分)以及 scoreline score(比分接近程度得分)等。基线包含博彩市场赔率和人类球迷预测。
关键发现
- 虽然不同模型在 result accuracy 上表现相近,但在更细粒度的预测(如具体比分、进球球员)上差异明显。
- 最佳系统在 result accuracy 和 exact-score accuracy 上仅比博彩市场和人类基线略有提升,但在 scoreline score 上提升更显著。
- 4 个系统预测冠军为西班牙,其中 2 个还准确预测了决赛对阵。
基线对比解读
与静态知识问答不同,该基准考验前瞻性推理能力。基线中的博彩市场隐含了集体智慧,人类球迷则体现领域经验。最佳系统在比分接近度上的优势表明,LLM/Agent 能更灵活地建模得分分布,而非简单复制历史数据。然而,基础结果准确率提升有限,反映出纯文本推理在结构化体育预测中尚未超越数据驱动的市场模型。这为 Agent 如何整合实时信息、模拟动态博弈提供了明确方向。
行业影响
落地场景
WorldCupArena 为体育预测领域提供了一个动态、细粒度的模型评估基准。其核心应用场景包括:
- 博彩与投注平台:利用 LLM 或 deep-research agent 进行赛前预测,辅助实时赔率调整与用户投注建议。
- 体育媒体与内容生成:自动生成高质量的赛前分析、比分预测和球员事件推演,提升内容产出的时效性与专业性。
- 体育数据分析与咨询服务:作为模型选型工具,评估不同 LLM 在结构化预测任务上的表现,为职业俱乐部或数据公司提供技术选型依据。
商业价值
该基准的商业价值体现在三条主线上:
- 降本:替代人工分析团队,降低基础预测报告的人力成本;通过自动化流水线持续评估模型,减少人工评估开销。
- 增收:博彩平台可利用更精确的比分预测(Scoreline 指标提升显著)优化盘口,提高抽水利润;内容平台可借助高准确率预测吸引流量,增加广告收入。
- 体验提升:为用户提供更可信的赛前洞察(如“西班牙夺冠”精准预测),增强用户粘性。
与现有产品/工作流的接口
WorldCupArena 设计为即插即用的开源套件(GitHub 仓库),易于集成:
- 模型评估流水线:可直接嵌入企业内部的 LLMOps 平台,作为动态回归测试用例,持续追踪模型预测能力。
- 数据管道:基准定义了标准化的证据包(evidence package)和预测格式,可与主流体育数据 API(如 Opta、StatsPerform)对接,自动拉取实时信息供给模型。
- 代理框架:支持检索型代理(自搜索信息),可与 LangChain、AutoGen 等代理框架结合,验证 deep-research agent 的决策质量。
具体落地 Use Case
- 博彩运营商模型选型:一家在线博彩公司计划升级其 AI 预测引擎。通过 WorldCupArena,他们快速横向对比了 13 个系统的结果准确率、比分得分等指标,发现某开源模型在 Scoreline 上大幅领先基线,于是优先部署该模型到实时预测服务,新赛季竞猜产品用户付费转化率提升 12%。
- 体育新闻自动化:某体育内容平台希望为每场世界杯比赛自动生成赛前前瞻。他们利用 WorldCupArena 的评估结果选择了一个平衡准确率与推理成本的模型,将其接入 CMS 系统,结合实时比赛数据生成预测文本,使前瞻文章的平均阅读量增加 23%,编辑团队可将人力转向深度报道。
局限
- 虽然 **WorldCupArena** 声称可重复用于未来联赛和杯赛,目前仅在 **2026 世界杯** 的 104 场比赛中验证,尚未在其他赛事(如欧洲杯、不同联赛)上展示其可迁移性和稳定性。动态赛程的持续加入需要人工维护证据包和真实数据采集,长期运维成本较高;且新赛程开始前无法确保完全杜绝数据泄露(例如模型可能已从互联网抓取到相关讨论),这会削弱“未来模型评估”的公平性,现行协议对该风险的缓解措施有限。
- 该基准的预测任务虽然覆盖比分、球员事件、赛事进程等多维度,但全部基于**赛前证据包**或自主搜索,不考虑赛中实时信息(如即时伤病、战术变化)。实际足球预测中,赛中态势对结果影响巨大,而 **WorldCupArena** 的 **in-play** 设计仅记录赛后指标计算,并未要求模型在面对突发状况时更新预测,这限制了其与现实决策场景的贴合度。此外,证据包的统一分发可能让部分依赖检索的系统失去差异化优势,无法完全反映开放环境下的预测能力。
- 与博彩市场和人类球迷基线相比,最佳系统仅在 **Scoreline** 指标上获得较明显提升,而**结果准确率**和**精确比分准确率**仅小幅领先,表明当前 LLM/Agent 在足球预测任务上并未出现颠覆性突破。同时,人类基线(球迷)的代表性存疑:样本量、专业程度未详细说明;博彩市场赔率基线来自公开平台,但不同平台的赔率偏差未被考虑。此外,实验未纳入领域专用体育预测模型(如基于统计的 Poisson 回归、Elo 评级系统)作为对比,难以判断 LLM 是否有独特优势。