论文

Game Arena: 竞争环境中的策略性 LLM 评测

Game Arena: 竞争环境中的策略性 LLM 评测

我们提出 Kaggle Game Arena,一个开放且持续扩展的平台,通过竞技游戏来评测大语言模型(LLMs)。与静态基准不同,Game Arena 让模型在结构化环境中进行一对一对决,其博弈强度随模型进化自然提升,从而避免性能饱和。 本技术报告详述了 Game Arena 背后的基础设施,并介绍了三个试点游戏环境:Chess、Poker 与 Werewolf。这三个环境分别覆盖完美信息、非完美信息以及多人博弈设定,可系统性地研究模型在不确定性下的策略规划、适应与鲁棒性。 针对每个游戏,我们给出环境的详细描述、评测指标,以及跨模型开展完整竞赛的结果。依托稳健的基础设施与大规模基于真值(ground-truth) 的评测,Game Arena 保证了可复现性、透明性,以及随时间迁移到新游戏与变体的泛化能力。

论文精读

TL;DR Kaggle Game Arena 以 Chess、Poker、Werewolf 三类竞争游戏构建 LLM 动态评测平台,覆盖完美/不完美/多人博弈,解决静态基准饱和问题,并提供可复现、可扩展的对抗评估基础设施。

问题

问题背景

随着 LLM 能力不断增强,评估范式正从静态基准测试(如 MMLU、GSM8K)转向动态、交互式环境,以考察模型在复杂任务中的策略推理与实时决策。

现有方法局限

传统静态 benchmark 存在明显短板:

  • 饱和问题:模型在多数公开数据集上得分已接近上限,无法有效区分能力差异。
  • 缺乏对抗性:基准通常是单轮、非竞争的,无法反映模型在博弈场景下的规划、欺骗、合作与适应性。
  • 数据污染与过拟合:训练数据可能包含测试集内容,导致得分虚高且不可复现。
  • 评估粒度粗糙:只给出总体准确率,难以定位模型在特定游戏阶段或策略类型上的失误。

为什么这个问题难/重要

构建竞争性游戏评估平台面临多重技术挑战:

  1. 环境多样性:需要覆盖完美信息(如 Chess)、非完美信息(如 Poker)与多智能体博弈(如 Werewolf),以系统测量模型在不同信息结构下的表现。
  2. 可扩展基础设施:支持大量模型进行 head-to-head 对局,并高效分配计算资源。
  3. 评分机制:跨游戏、跨对局生成稳定且可比较的 rating(如 Elo 或 TrueSkill),同时解决模型版本更迭带来的持续基准漂移。
  4. 鲁棒性与公平性:防止模型利用游戏规则漏洞或非策略性行为刷分,确保评估结果能反映真实战略能力。

业界之所以高度关注,是因为战略推理与不确定性下的决策是通往 AGI 的核心能力之一,且与真实应用场景(如多智能体协商、自动交易、复杂系统控制)密切相关。

行业类比

这项工作的思路类似于自动驾驶仿真测试平台:从固定场景数据集过渡到动态、可扩展的模拟对抗环境,从而持续衡量系统在开放世界中的泛化与安全能力。

核心洞察

  • 动态竞争评估取代静态基准,用游戏强度自然增长解决性能饱和问题。传统 benchmark 固定题目集,模型进步后很快饱和,无法区分能力差异;Game Arena 让模型在对抗环境中持续博弈,对手强度随模型池整体提升而提升,类似 Elo 等级分,能动态反映模型间细微差距,并支持长期跟踪模型演进。这是评估范式从一次性考试到持续竞技排名的转变。
  • 通过 Chess、Poker、Werewolf 三类信息结构,系统解耦战略规划、不确定性推理与多人协作能力。多数 LLM 评估聚焦单轮问答或简单文本游戏,信息结构单一;Game Arena 覆盖完全信息(Chess)、不完全信息(Poker)、多人隐藏角色(Werewolf),能从不同维度暴露模型缺陷。例如 Poker 需要处理对手未知手牌与诈唬,Werewolf 涉及多智能体沟通与欺骗,这些无法被现有基准刻画。这种多环境设计使评估结果更具生态效度,也为构建通用智能体提供诊断信号。
  • 开源、可扩展的评估基础设施和 ground-truth 机制,为大规模、可复现的 LLM 竞技评估提供工程范本。评估类项目常因环境不一致、评分不透明或难以复现而受质疑。Game Arena 构建在 Kaggle 上,提供开放的比赛环境、标准化评估指标,并强调基于胜负结果的 ground-truth,避免人为主观评分。模块化架构支持不断加入新游戏与变体,降低后续评估的边际成本。这对需要长期维护模型排行榜、持续监控模型能力的团队有直接借鉴意义。

方法

输入

参赛 LLM 通过统一 API 接入,接收游戏状态的结构化描述(如棋局 FEN、扑克手牌与公共牌、狼人杀对话历史与角色信息),并输出符合规则的动作。

关键模块

  • 游戏环境:平台基于 OpenSpiel 实现 Chess、Poker、Werewolf 三种环境,分别对应完美信息、不完美信息与多人博弈。环境负责状态更新、合法动作校验及胜负判定。
  • 比赛引擎:编排模型间 head-to-head 或多人对局,保证对称性与可复现性;支持自适应调度与算力分配。
  • 评估框架:从对局结果计算动态评分(如 Elo / Glicko),并可跨游戏整合,输出统一能力画像。

输出

各模型在不同游戏上的胜率、评分、以及诊断指标(如扑克 VPIP、狼人杀合作率),辅以可视化界面。

与静态 benchmark 不同,Game Arena 通过模型间对抗使难度随能力提升自然增长,避免性能饱和,同时覆盖多类博弈形态,实现更全面的战略能力评估。

实验

实验设计

平台通过 Chess (完全信息)、Poker (不完全信息) 和 Werewolf (多人博弈) 三个游戏环境评估 LLM。采用 head-to-head 对局,所有模型在相同规则下进行多轮比赛,利用 ground-truth 胜负和得分作为评估信号。基础设施基于 OpenSpiel 和 Kaggle 平台,支持自动化对战、评分和可视化。

关键发现

论文报告了三个环境下多模型的完整竞赛结果。游戏覆盖不同的信息结构和交互模式,可系统评估模型的战略规划、对手适应和不确定性处理能力。关键设计在于游戏强度随模型能力提升而自然增长,避免了静态基准的性能饱和问题,体现出 continual benchmarking 的长期价值。

与基线对比

相比静态基准(如 MMLU、Big-Bench),Game Arena 提供 对抗性 和 演化性 的评估:模型需在动态对手环境中持续决策,而非回答固定问题集。其开源、模块化架构支持轻松扩展新游戏和变体,增强了评估的可复现性与生态开放性。

行业影响

落地场景

Game Arena 提供了动态对抗评估框架,适用于需要复杂战略决策的 LLM 产品。具体 use case:

  • 电商议价机器人:在 Poker 类不完全信息博弈中评估价格谈判策略,优化成交与利润。
  • 金融交易智能体:利用 Chess 的完美信息规划能力检验长期策略,或通过 Werewolf 多人环境测试社交推理。
  • 内容平台推荐系统:模拟多智能体交互,评估推荐策略的适应性与鲁棒性。

商业价值

  • 降本:自动化对抗评估替代人工标注,大幅缩短模型迭代周期,降低评估成本。
  • 增收:提升模型在动态环境中的决策质量,可直接改善电商转化率、游戏玩家留存和金融收益。
  • 体验提升:模型经过竞争性环境训练,其策略鲁棒性和适应性增强,用户体验更稳定。

与现有工作流接口

  • 可通过 Kaggle 平台 API 将 Game Arena 集成到 MLOps 流水线中,作为持续评估关卡。
  • 基于 OpenSpiel 的实现可对接现有强化学习训练栈,实现边训练边评测。
  • 导出的对抗结果和指标可接入 Weights & Biases 或 TensorBoard,形成闭环。

该平台的核心差异在于用竞争性游戏 替代静态基准,避免性能饱和,对实际工程中模型选型和迭代有长期参考价值。

局限

  • **环境覆盖有限**:当前仅覆盖 Chess、Poker 与 Werewolf 三个环境,分别对应完美信息、不完美信息与多人不完全信息。但战略能力维度远不止这些,例如实时决策、连续状态空间、长期规划与动态合作/背叛混合等。论文也承认需要扩大游戏套件,未来可加入更多变体。这使得 Game Arena 目前不能作为全面战略智能的通用基准,仍需与其他评估方法互补。同时,固定规则的游戏可能让模型通过记忆特定 pattern 而非真正推理来提升排名。
  • **评估的动态性与计算成本**:平台设计支持持续评测与模型 churn,但组织全量 head-to-head 比赛开销大,尤其随着模型数量增多。论文提出 adaptive scheduling,但实际运行中,调度算法和资源分配策略尚未充分验证。这可能导致部分模型样本不足或延迟反馈,影响 rating 稳定性。另外,评分跨异构游戏需要 consolidated rating,但不同游戏的输赢幅度、随机性差异大,难有统一尺度,可能掩盖模型在具体维度上的优劣。
  • **依赖 prompt 模板与地面真值**:很多游戏(尤其 Werewolf)涉及自然语言交互,模型表现高度敏感于 prompt 设计。论文虽提供模板库,但未做消融证明模板达到最优,可能导致不同模板下排名变化。此外,Werewolf 中地面真值(如各方发言真实性)难以自动标注,只能基于胜负,缺乏过程评估。这使得模型可能通过无意义但格式合规的发言来操纵游戏,评估结果偏向博弈技巧而非真实推理。
论文Bovard Doerschuk-Tiberi2026-09-25原文

相关内容