The Endless Exam: Mathematical Constructions from Today's Models toward Superintelligence
We introduce the Endless Exam, a benchmark spanning fourteen parameterised families of mathematical construction problems, with verifiable scores that distinguish progress before and beyond published mathematical frontiers. Each submitted object is checked automatically for validity and assigned a relative quality score against a published frontier or construction baseline, without capping improvements at 1. The benchmark draws long-term challenges from open mathematical problems and generates larger instances by varying their parameters. Compact certificates allow large constructions to be verified without listing every element. Across nine models evaluated on 69 distinct instances, continuous quality scores distinguish performance even though none of the 30 published-frontier references is surpassed. Size-quality curves show how construction quality changes as problem size increases. We release the generators, verifiers, references, model responses and analysis to support continued measurement before and beyond human frontiers.
论文精读
TL;DR Endless Exam 是一个包含 14 个参数化数学构造问题族的基准,用可验证的相对质量分数区分模型在已发表前沿内外的进展,为迈向超智能提供持续测量。
问题
问题背景
当前 AI 数学推理评估的焦点正从固定答案解题转向开放式构造任务,即要求模型生成满足复杂约束的数学对象(如码、图、着色方案),以测试其搜索、优化与创造性。
现有方法局限
- 主流基准(MATH、GSM8K、AIME)多为有限答案或封闭解,模型可通过模式匹配或检索部分解决,且难度已开始饱和。
- 现有构造类基准(如 CAP、TSP 实例)通常规模固定、验证成本高,或目标仅为接近已知最优,缺乏超越已发布前沿的量化手段。
- 验证环节常依赖人工或启发式,无法自动处理大规模证书,且对“改进”没有统一的相对质量分数,难以区分逐步进步。
为什么这个问题难/重要
数学构造问题本质上是一个无限开放空间中的组合搜索与证明问题。模型需要生成对象并同时给出可验证的正确性证据,而前沿结果往往由人类数学家多年攻关得到。难点在于:1) 搜索空间随参数指数增长;2) 需要平衡构造质量与验证成本;3) 必须支持跨规模泛化,即从小实例学到的策略迁移到大参数。业界关注这一点,是因为若能稳定提升模型在开放构造任务上的表现,意味着模型具备某种可扩展的数学探索能力,是通向超智能的关键信号。
行业类比
类似代码生成场景中,从“通过固定单元测试”升级为“在持续集成中不断优化代码质量与性能”,数学构造基准要求模型在无上限的验证指标下持续改进。
核心洞察
- Endless Exam 的核心创新在于用参数化数学构造问题族配合无上限的连续相对质量分,替代传统固定题目与二值正确率,使基准在模型超越已发布人类前沿后仍能继续区分能力。与 MATH、GSM8K 等饱和型基准不同,它通过改变参数可生成任意规模实例,并将每个提交对象的质量与已发布前沿或基线比较,分数不受 1.0 封顶限制,因此既能测量当前模型接近前沿的程度,也为未来超人类水平的进展预留了可量化空间。
- 紧凑证书验证机制让大规模构造的自动校验成为可能,这是 Endless Exam 区别于其他数学推理评测的关键工程特点。提交者只需提供多项式大小的证书而非枚举所有元素,验证器即可确认构造的有效性并计算质量分。例如代表性任务中仅十行描述便可验证 59,049 个码字。这一设计显著降低了评测成本,支撑了 14 个参数化家族、69 个实例的规模化运行,并为持续纳入新实例和更大尺度问题提供了可扩展的验证基础设施。
- 对 9 个模型在 69 个实例上的结果揭示:尽管没有一个模型超越 30 个已发布前沿参考构造,但连续质量分数仍能稳定区分不同模型的表现,且大小-质量曲线展示了模型随问题规模增大时构造质量的变化趋势。这验证了 Endless Exam 在“仍低于人类前沿”阶段即可提供细粒度信号,而非仅当模型超越人类后才开始工作。该特性对 AI 研发中的能力追踪、模型选型以及开放数学问题的自动求解进展监测都具有直接工程价值。
方法
输入与问题族生成
Endless Exam 的输入是模型生成的数学构造对象(如集合、码、着色方案等),对应 14 个参数化问题族。每个问题族源自公开数学难题,通过调整参数(如维度、规模、约束强度)生成不同难度的实例,从而形成连续的难度谱系。
关键模块:验证与评分
- 自动验证器:对每个提交的构造检查数学有效性,不依赖人工判断;支持紧凑证书表示,允许在验证大型构造时无需枚举全部元素。
- 相对质量评分:计算提交构造与已发表前沿或构造基线之间的相对质量分数,分数不封顶(超过 1 表示超越参考),避免传统基准的饱和问题。
- Gap closed 指标:衡量模型构造相对于参考前沿的差距闭合程度,用于评估渐进进展。
输出与评估协议
输出包括连续质量分数、大小-质量曲线、模型排名,以及各问题族上的详细分析。评估覆盖 9 个模型在 69 个实例上的表现,并检查计算搜索预算对质量的影响。
差异点
与固定答案或二元判定的传统数学基准不同,Endless Exam 通过参数化生成和相对评分,提供不封顶、可扩展的评估信号,能区分当前模型在人类前沿以内的渐进进步,并为未来超越前沿预留度量空间。
实验
实验设计
Endless Exam 基准包含 14 个参数化数学构造问题族,每个提交对象自动验证有效性,并相对公开前沿或构造基线给出无上限的连续质量分数。实验评估了 9 个模型在 69 个不同实例上的表现,并绘制大小—质量曲线观察性能随问题规模的变化。紧凑证书允许在不列举全部元素的情况下验证大型构造。
关键发现
所有模型均未超越 30 个公开前沿参考构造,但连续质量分数仍能清晰区分不同模型的能力层级。大小—质量曲线显示,随着问题规模增大,构造质量普遍下降,反映出模型在更大规模上的泛化瓶颈。部分模型在工具辅助下(如代码生成)能获得更优构造,但计算搜索预算的敏感性分析表明性能提升依赖于额外推理时间。
与基线对比
相比传统数学推理基准(如 MATH、GSM8K 的固定答案评测),Endless Exam 采用可验证构造和开放评分,消除了分数上限,更适合衡量超越人类前沿的进展。当前模型虽未突破前沿,但分数曲线为后续改进提供了可量化的信号,验证了该基准在超人类能力评估中的可行性。
行业影响
落地场景
Endless Exam 可作为 AI 模型在开放数学构造 领域的标准化评测,适用于需要长期自主研究的场景,如 AI 研究助手、自动定理证明、密码学工具、芯片设计等。其参数化问题族与可验证质量分数,能衡量模型在超出已发表前沿时的探索能力,为模型选型提供可靠依据。
商业价值
该基准通过自动验证 与连续质量评分,显著降低复杂构造任务的人工评测成本,加速模型迭代与发布。对提供 AI 数学能力或科学计算服务的公司,可作为差异化竞争指标,证明模型在困难构造问题上的领先性。无上限评分机制支持持续追踪模型进步,为订阅制或按效果付费模式提供量化支撑。
与现有产品/工作流的接口
可集成至现有ML 评估流水线(如 HELM、lm-evaluation-harness)作为额外测试集;也可作为强化学习环境,为模型提供可验证的奖励信号,用于训练构造能力。其生成器、验证器及参考实现均可通过 API 调用,便于嵌入企业内部模型监控与自动化测试框架。
具体落地 use case
- 电商物流优化:平台可用该基准评估模型在车辆路径规划、装箱问题 等组合构造任务上的表现,选择更优模型以降低配送成本。
- 药物分子设计:制药公司可借鉴其参数化问题族 与紧凑证书 思路,自动验证模型生成的分子结构是否满足约束,加速候选化合物筛选。
局限
- 当前所有模型均未超越 30 个已发布前沿参考构造,因此该基准在现阶段主要用于区分模型之间的相对进步,尚无法直接评估“超越人类前沿”这一关键跃迁。对于最顶尖模型,分数可能仍然低于 1 或 gap closed 为负,区分度依赖于相对质量分数,但绝对意义上的 superintelligence 信号仍缺失。此外,已发布前沿参考本身可能并非全局最优,若未来出现更好的构造,现有评分基准需要持续更新,可能引入参考漂移问题,影响历史评分的可比性。
- 14 个参数化问题族集中在离散/组合构造(如 cap sets、codes、colourings、graphs 等),覆盖面有限,无法代表数学构造的全貌,例如连续优化、动力系统、代数几何等方向未被触及。紧凑证书机制虽然允许大规模构造验证,但要求构造能由简洁描述表示,这限制了可评测的问题类型——许多重要数学对象可能没有紧凑表示。另外,生成更大实例受计算预算与验证复杂性约束,随着参数增大,验证器本身可能成为评测瓶颈。
- 与现有数学推理基准(如 MATH、GSM8K 等)相比,Endless Exam 只测量构造能力,不评估证明、推导或符号推理,因此无法全面反映模型数学能力。它需要针对每个问题族专门实现生成器和验证器,扩展新问题族的成本较高,且难以像通用语言评测那样快速迭代。此外,模型可能通过检索或记忆已知构造(尤其是在训练数据中包含类似问题)来作弊,尽管论文提到生成更大实例可缓解,但并未完全消除这一风险。