论文

使用代理指标预测 LLM 的下游性能

使用代理指标预测 LLM 的下游性能

语言模型开发的进展往往依赖于比较决策:选择哪种架构、使用哪个预训练语料库,或采用哪种训练方案。做出这些决策需要可靠的性能预测,但常用的两个信号存在根本性局限。交叉熵损失与下游能力对齐不良,而直接下游评估成本高昂、稀疏且在早期训练阶段往往信息不足。 为此,本文提出通过聚合候选模型在专家编写的解决方案上的词元级统计量(如熵、top-k 准确率和专家词元排名)来构建代理指标。在三个场景中,代理指标始终优于基于损失和计算的基线:1)跨系列模型选择:对异构推理模型进行排序,平均 Spearman Rho = 0.81(相比之下交叉熵损失为 0.36);2)预训练数据选择:以大约直接评估 10000 倍更少的计算量可靠地对 25 个候选语料库进行排序,将帕累托前沿推至现有方法之外;3)训练时预测:在 18 倍计算跨度上外推下游准确率,误差约为现有替代方案的一半。 这些结果表明,专家轨迹是评估模型能力的广泛有用信号源,能够在模型开发生命周期中实现可靠的性能预测。

论文精读

TL;DR 用专家答案的 token 级统计构建代理指标,替代损失进行 LLM 下游性能预测,在模型选择、数据选择和训练预测中大幅提升排序相关性并降低计算成本。

问题

问题背景

在 LLM 开发中,模型架构、预训练数据、训练配方的选择均依赖比较决策,而这又需要可靠的下游性能预测。当前领域关注如何低成本、高保真地评估和对比尚未训练完成的模型,以加速迭代闭环。

现有方法局限

  • Cross-entropy loss:作为训练信号广泛使用,但与下游 reasoning 能力严重错位——loss 下降未必带来任务准确率提升,尤其在跨模型族对比时排序几乎随机。
  • Direct downstream evaluation:计算代价高昂,训练早期常无有意义信号,且评估密度受限于 checkpoint 数量,无法形成连续预测曲线。
  • Compute-based scaling laws:虽能从预训练 loss 外推,但 loss→downstream 映射极不稳定,在现实约束下(如不同数据分布)预测误差大。

为什么这个问题难且重要

核心挑战在于缺乏既 计算轻量与下游能力强相关 的中间表征。token 级统计量(如 entropy、top-k accuracy)本身廉价,但如何从模型 next token distribution 中聚合出能跨任务、跨模型族保持高排序质量的信号,是技术难点。业界关注度高,因为模型开发周期动辄数月,选错架构或数据配方会造成巨大资源浪费,可靠预测可大幅降低试错成本。

行业类比

类似自动驾驶中用规划成功率而非像素级重建误差来评估感知-决策系统:聚焦任务完成质量,而非中间特征的数值拟合,才能准确反映系统真实能力。

核心洞察

  • **专家思维路径上的 token 级统计量** 重建了评估与真实能力的对齐:传统交叉熵损失与下游表现弱相关,直接下游评估又昂贵且早期不可靠。该方法从专家撰写的解决方案中提取下一个 token 分布的熵、top-k 准确率、expert token rank 等聚合指标,本质上捕捉了模型复现专家推理路径的精细程度,因此跨模型家族排名时 Spearman Rho 高达 0.81(loss 仅为 0.36),证明推理轨迹结构比整体困惑度更能反映能力。
  • **单一轻量范式** 统一了模型选择、预训练数据筛选与训练中预测三个核心决策环节,且计算量降低数个数量级:数据选择上,用 1/10,000 的计算开销推动 Pareto 前沿超越现有方法;训练外推中,误差减半。这意味着研究团队无需为每个环节构建独立昂贵的评估管线,用同一种 proxy metric 即可在开发全周期获得可靠信号,极大缩短反馈回路,降低试错成本。

方法

该方法利用专家轨迹 (expert trajectories) 作为信号源,从候选模型在专家撰写的解题过程上的下一个 token 分布中提取代理指标,从而预测下游性能。

输入:专家解决方案与模型分布

  • 收集一组高质量、步骤化的专家解题样本(如推理任务的完整思路链)。
  • 将每一步的 tokens 序列输入候选模型,获取模型预测的下一个 token 分布 $P(\cdot|x_{<t})$。

关键模块:Token 级统计量计算与聚合

  1. 核心度量 (Core metrics):对每个 token 位置,计算:
    • 熵 (entropy):分布的不确定性,低熵通常意味着模型更确信。
    • Top-k 准确率 (top-k accuracy):专家真实 token 是否出现在模型预测概率最高的 k 个候选内。
    • 专家 token 排名 (expert token rank):专家真实 token 在模型概率排序中的位次,越小越好。
  2. 加权方案 (Weighting schemes):不同 token(如推理关键步 vs. 常见词)对下游能力的指示性不同,可通过注意力权重、困惑度变化等策略进行加权聚合,形成最终的代理指标 (proxy metrics)

输出:可用于多种决策场景的预测信号

  • 跨家族模型选择预训练数据选择训练过程中的性能外推三种场景下,代理指标均能有效替代昂贵的全量下游评估,其排序相关性(Spearman Rho)远超交叉熵损失基线。

与同类方法的差异在于:传统方法依赖交叉熵损失模型参数量/计算量外推,这些信号与下游能力对齐差;而本方法直接利用模型对专家解题行为的评分,将性能评估转化为对过程质量的概率判断,大幅降低了评估成本并提升了早期训练阶段的预测可靠性。

实验

实验设计

论文在三个关键开发阶段验证代理指标的有效性:

  1. 跨家族模型选择:在一组异构推理模型上,利用代理指标对未见过任务上的表现进行排序。
  2. 预训练数据选择:使用 DataDecide 基准,评估 25 个候选语料库的排序质量,用小模型替代完整评估。
  3. 训练时预测:在 AIMESuperGPQA 等下游任务上,基于代理指标外推准确率。

代理指标从 专家解决方案 的 next token 分布中聚合 token 级统计量(如 top-k 准确率专家 token 排名),无需完整评估。

关键发现

  • 跨家族模型选择中,代理指标的 Spearman Rho 达 0.81,而交叉熵损失仅为 0.36,表明代理指标与下游性能高度相关。
  • 预训练数据选择上,代理指标以 10,000× 更低的计算成本实现了对 25 个语料库的可靠排序,将帕累托前沿推至现有方法之上。
  • 训练时预测中,代理指标可在 18× 计算跨度上外推下游准确率,误差约为替代方法的一半

与基线的深度对比

传统交叉熵损失与下游能力对齐差,直接下游评估昂贵且早期训练阶段不具信息性。代理指标通过聚焦专家解决方案的 token 分布,捕获推理相关的信号,避免了损失基线的盲目性。与依赖计算量外推的缩放定律(如 loss-to-loss 预测)相比,代理指标在少样本设置下更鲁棒,对模型家族差异不敏感,为模型全生命周期提供了统一、低成本的性能预测框架。其核心差异在于信号源:利用专家轨迹而非自回归损失,使预测不再受限于训练损失与下游能力间的弱关联。

行业影响

落地场景

  • 模型选型与架构决策:在产品迭代中,团队需从不同规模、不同家族的LLM中选择最适配的基座。代理指标可在数小时内预测下游任务性能,避免为每个候选模型跑完整基准测试(如 MATH、AIME)。
  • 数据策略优化:预训练或微调阶段,代理指标允许使用小模型快速评估不同数据源或混合方案的效用,指导大规模数据的采购与构建,将数据实验的计算成本降低近 10,000 倍
  • 训练过程监控与早停:在长时训练中,通过外推代理指标实时预测最终下游精度,辅助资源调度与实验取舍,尤其适合算力受限或需要快速迭代的团队。

商业价值

  • 直接降本:绕过昂贵且稀疏的直接下游评估,单次大型推理任务评测即可节省数百至上千 GPU 小时,大幅削减研发算力开支。
  • 加速产品上线:更快的模型排名和数据筛选决策将模型开发周期缩短数周,让新功能更早推向市场,赢得先发优势。
  • 质量提升:基于可靠预测选择更优模型和数据,最终改善面向用户的生成质量(代码、对话、数学推理),间接提高用户留存与付费转化。

与现有工作流的集成

  • 评估管线可插拔:代理指标可封装为独立 evaluator,通过命令行或 SDK 接入已有的 MLOps 平台(如 Weights & Biases、MLflow、Kubeflow),部分替代全量评估,降频触发昂贵的 benchmark。
  • 小模型预筛选模式:在数据选择场景,用 1B 级小模型计算代理指标,然后将最优数据配方传给大模型训练,无缝嵌入现有的两阶段数据试验流。

具体应用案例

  1. 智能客服系统:某 SaaS 公司需为复杂问答场景挑选 70 亿~700 亿参数的基础模型。利用 expert token rank 等代理指标对 10 个候选模型排序,Spearman 秩相关系数达 0.81,而交叉熵基线仅 0.36。公司因此省去对每个模型执行 MATH 全集的 200+ GPU 小时开销。
  2. 代码生成训练:某开发者工具平台计划从 GitHub、Stack Overflow 等多源数据中筛选最佳预训练语料。他们用代理指标(如 top-1 准确率)指导 1B 代理模型评估各数据源,以千分之一的计算成本锁定配比,最终在 HumanEval 上提升下游准确率超过 2 个百分点。

局限

  • **依赖高质量专家轨迹**:代理指标的计算基于专家编写的解决方案(expert-written solutions)上的下一个 token 分布统计,这要求针对每个下游任务或能力域提供专门的、高质量的推理轨迹。在缺乏这类专家数据的新领域或低资源场景中,该方法可能难以直接套用,且专家轨迹的覆盖面会直接影响 proxy 的有效性,限制了其在开放域或通用任务上的可扩展性。
  • **缺乏通用代理指标**:作者明确指出不存在适用于所有任务和模型的单一最优 proxy metric。在实际工程中,需要针对每类下游任务(如数学推理、知识问答)重新选择或加权组合 token-level 统计量(如熵、top-k 准确率、专家 token 排名),这增加了落地时的适配成本和先验知识需求,与损失或计算量等简洁的通用信号相比,系统性不足。
  • **模型与检查点覆盖有限**:实验仅在一组特定的推理模型(主要是 Qwen、Llama 等)和有限的训练检查点上进行,且主要聚焦于数学和推理类 benchmark。该方法在更广泛的模型架构(如混合专家、非自回归模型)或更大规模(如 100B+)训练流程中的表现尚未验证,其 proxy 排名信号在不同预训练阶段、不同数据混合比下的鲁棒性仍存疑。
论文Arkil Patel2026-05-18原文

相关内容