论文

DataPrep-Bench: 将 LLMs 作为训练数据准备者的基准测试

DataPrep-Bench: 将 LLMs 作为训练数据准备者的基准测试

训练数据的质量从根本上决定了大型语言模型(LLMs)的能力,然而目前缺乏统一的基准来衡量 LLMs、智能体及数据驱动工作流在端到端数据准备中的表现。我们将 LLM 驱动的数据准备工作分解为两个互补的能力:数据构造(将原始数据转换为监督训练数据)和数据质量评价(在下游训练前预测候选数据集的训练价值)。这里的“质量”特指下游训练效用,而非表面文本属性。 我们提出 DataPrep-Bench,这是第一个在六个领域和多个基座模型上,基于共享下游协议联合评估这两种能力的统一基准。对于数据构造任务,方法消耗相同的原始数据源,并通过在其输出与 Dolly-15k 上联合微调基座模型来评分;我们同时发布了 Data-Construction-Skill,一个技能引导的智能体,在 Llama-3.1-8B Finance 上将仅使用 Dolly 的基线提升了近 20 个绝对百分点,在知识密集型领域与最强的智能体和 DataFlow 方法竞争。对于数据质量评价任务,评分函数通过与共享候选池上的下游性能的 Pearson 相关系数 来评分;我们发布了 分布对齐分数(DAS),一种基于分布的评价器,利用候选数据集与领域代理之间的最大均值差异(MMD)。DAS 在六个领域中的四个取得了最强的跨模型相关性,并且是唯一同时在数学、科学和医学上达到 r 0.70 的指标,优于现有的基于质量、多样性和启发式的评价器。 DataPrep-Bench 提供了一个统一、下游依据的框架,用于衡量 LLM 驱动数据准备中的两种能力作为同等目标的进展。

论文精读

TL;DR DataPrep-Bench 首次统一评估 LLM 驱动的数据构建与质量评估,并公开技能引导智能体和分布对齐指标 DAS,后者在多个领域跨模型相关性最优。

问题

问题背景

大语言模型 (LLM) 的性能上限由训练数据质量决定,业界正快速转向利用 LLM 自身或智能体 (agent) 自动化数据准备流程,但缺乏统一的、以下游任务性能为基准的评估体系来衡量这些方法是否真的能产出“好数据”。

现有方法局限

当前数据准备的评估存在显著断层:

  • 数据构建(如直接 LLM 生成、DataFlow 流水线)的评价通常只看表面文本质量或孤立的小规模实验,无法反映数据在下游微调中的真实增益,甚至出现合成数据“帮倒忙”的案例。
  • 数据质量评估(如基于多样性、困惑度、启发式规则的打分器)往往只与文本特征相关,与最终训练效用之间的 Pearson 相关系数低且跨领域符号不一致(即某些领域正相关、另一些领域负相关)。
  • 两类能力被视为独立问题,缺乏联合评估框架,导致方法设计容易顾此失彼。

为什么这个问题难且重要

  • 难度:数据准备的价值需要经过完整的“训练—评测”闭环才能验证,成本极高且不可微分;质量评估更要求在不进行实际训练的前提下预测某一数据集对未见模型的增益,本质上是一个分布外预测问题。
  • 重要性:数据工程消耗 AI 项目 80% 以上的时间与算力,自动化和可量化的数据准备工具直接影响大模型迭代效率。业界关注点正从模型架构转向数据质量,需要一个能作为“金标准”的评价基准来统一术语与度量。

行业类比

这类似于特征存储与自动特征工程在传统 ML 中的角色——没有可靠的评估器,就无法在巨大的搜索空间中高效地选择最优数据配方。

核心洞察

  • 将数据构建与质量评估首次放在统一的下游微调性能协议下联合评价,打破了此前两个环节各自为战的局面。以往基准或只关注生成数据的表面文本质量,或单独衡量数据选择策略,而 DataPrep-Bench 直接以微调后的下游任务得分为唯一标准,使构建和评估能力在同一目标下对齐,更真实地反映数据准备管线对最终模型能力的影响。
  • 提出的 Distributional Alignment Score (DAS) 通过最大均值差异 (MMD) 度量候选数据集与领域代理数据集的特征分布距离,无需昂贵训练即可跨模型稳定预测训练价值。该方法不依赖数据量或表面多样性,是唯一在数学、科学、医学三个领域同时达到 Pearson r > 0.70 的指标,显著优于现有基于质量、多样性或启发式的评估器,为高效数据筛选提供了新的实用基线。
  • 技能引导的代理 Data-Construction-Skill 在金融等知识提取密集型领域提升近 20 个绝对点,但在科学和开放式推理中暴露失败模式。这说明数据构建代理需要按领域定制技能组合,且该基准通过技能消融揭示了方法效能的领域异质性,为工程中按任务特性选择或组合数据构建策略提供了可解释的决策依据。

方法

DataPrep-Bench 针对 数据构建 与 数据质量评估 两个协作能力,分别提出 Data-Construction-Skill 和 Distributional Alignment Score (DAS)。

数据构建:技能引导的智能体流程

  • 输入:原始语料(如维基百科、教科书、代码库等)与领域提示,统一为 (query, response) 种子格式。
  • 关键模块:智能体首先技能规划——将目标任务分解为“抽取知识”“生成指令”“校验事实”等子技能;随后多轮迭代生成,每轮调用 LLM 按技能链生成候选数据,并通过自检模块过滤低质量样本;最终在领域种子数据上知识增强,保证合成数据与下游任务对齐。
  • 输出:可直接用于微调的结构化指令-答案对(如金融分析、医疗问答)。
  • 差异点:与普通 LLM 直接生成或固定 DataFlow 流水线相比,该方法动态编排技能,在知识抽取密集领域(如金融)提升约 20 个点,但在开放推理领域可能因过度结构化而失败。

数据质量评估:分布对齐分数

  • 输入:候选数据集和领域代理数据集(通常为高质量基准子集)。
  • 关键模块:先将文本嵌入预训练模型的特征空间,得到数据集的经验分布;然后计算候选与代理分布的 最大均值差异(MMD),使用 RBF 核捕捉高阶矩差异。DAS 即该 MMD 值的负指数变换,使高分代表更好的下游训练效用。
  • 输出:标量分数,预测候选数据用于训练后模型的性能提升,通过 Pearson 相关性校准。
  • 差异点:与基于多样性或启发式质量的指标不同,DAS 直接以分布对齐度量下游价值,在数学、科学、医学领域均达到 r>0.70 的强相关性,且跨模型稳定性优于现有评估器。

实验

实验设计

DataPrep-Bench 包含两个平等的轨道:数据构建与数据质量评估。在数据构建轨道,每种方法处理相同的领域原始语料生成训练样本,随后与 Dolly-15k 混合微调基础模型,最终在六个领域(通用文本、数学、科学、医学、金融、法律)的下游基准上评测。数据质量评估轨道则提供候选数据集与代理数据集,以评估器预测下游性能的 Pearson 相关系数作为评分标准。

关键发现

  • 数据构建:Agent 类方法在推理密集型领域整体最强,特别是 Data-Construction-Skill 在金融等知识抽取密集领域将 Llama-3.1-8B 的分数提升近 20 个百分点(相比仅使用 Dolly 的基线)。但直接 LLM 生成或合成领域数据有时反而降低性能,DataFlow 在结构化领域有优势,技能引导构建在科学和开放推理中暴露失败模式。
  • 数据质量评估:提出的 DAS(Distributional Alignment Score)基于候选集与领域代理数据的 MMD 分布对齐,在 6 个领域中的 4 个取得最强跨模型相关性,并在数学、科学、医学三个领域同时突破 r > 0.70,成为唯一达到此高度的指标。

与基线的对比解读

Data-Construction-Skill 引入技能驱动,在金融等专业领域超越了当时最强的 Agent 与 DataFlow 方法,表明知识抽取可被结构化指令增强;但在科学与开放推理中,过度约束反而抑制泛化。DAS 显著优于基于表面质量、多样性或启发式的评估器,不仅相关性更强,且在所有领域保持符号一致(正相关),而许多现有指标在不同领域可能出现符号翻转。金融与法律领域依然是所有评估器的难点。整体上,DataPrep-Bench 首次以统一下游驱动协议同时衡量数据准备的两个能力,揭示了合成数据的不确定性以及分布感知评估的巨大潜力。

行业影响

落地场景

DataPrep-Bench 所定义的数据构建与质量评估范式,可直接嵌入任何需要高质量训练数据的 AI 产品管线。典型场景包括:

  • 垂直领域 LLM 微调:金融、医疗、法律等专用模型的训练数据生产,通过 Data-Construction-Skill 或 Agent 类方法从原始语料中自动提取任务数据,降低人工标注依赖。
  • 数据飞轮与持续训练:内容平台(如新闻推荐、教育题库)可用 DAS 动态评估候选数据池的训练价值,筛选高增益样本加入下一轮训练,提升模型迭代效率。
  • 数据市场与质量管控:数据服务商可集成该 benchmark 的评估协议,对产出数据进行下游任务效用打分,作为数据定价或交付标准。

商业价值

传统上,数据质量评估多依赖表层特征(如困惑度、多样性),与下游性能的相关性弱。DataPrep-Bench 提供了端到端的下游校准评估框架,其价值体现在:

  • 降低试错成本:通过 DAS 等预测指标,在训练前即可量化候选数据对目标模型的潜在提升,避免盲目收集和浪费算力。
  • 提升模型性能上限:Skill-guided 数据构建方法在 Llama-3.1-8B 金融任务上较基线提升近20 个绝对点,直接转化为产品竞争力。
  • 标准化数据 pipeline:统一基准使数据预处理流程可度量、可优化,减少因数据质量波动导致的线上事故。

与现有产品 / 工作流的接口

  • 数据工程栈:可直接对接 Apache Spark、Ray 等分布式处理框架,将数据构建与评估模块作为 pipeline 中的可配置算子。
  • MLOps 工具:集成入 Kuberflow、MLflow 或 Weights & Biases,将数据阶段的质量指标(如 DAS 分数)作为训练前的检查阀门,与模型训练任务联动。
  • LLM 应用平台:通过 API 方式接入 Dify、LangChain 等框架,作为数据准备工具链的一部分,服务非技术用户。

具体用例:

  • 某金融 SaaS 厂商利用 Data-Construction-Skill 从年报、研报中自动生成 Q&A 对,用于训练智能投研助手,将人工整理时间缩短80%。
  • 某在线教育平台使用 DAS 筛选高质量题目用于自适应学习模型微调,使学生的薄弱点识别准确率提升12%。

局限

  • **特定领域的局限性突出**:论文明确指出 Data-Construction-Skill 在科学和开放推理领域存在明显失效模式,表明基于技能的构建方法在处理复杂推理链和开放式生成任务时仍面临挑战。此外,数据质量评估指标 DAS 在金融和法律领域的预测相关性普遍较低,暗示当前评估框架对高专业化、知识密集型文本的适用性不足,未来需要针对这些领域设计更适配的代理分布或评估协议。
  • **代理数据集敏感性与线性假设限制**:DAS 的性能高度依赖代理数据集的选择,论文未系统探讨代理分布失配或代理规模变化对打分稳定性的影响,实际部署时可能需要针对不同下游任务仔细挑选代理,增加了应用复杂性。同时,数据质量评估基于下游性能线性可预测的假设,但在数据规模极不平衡或存在严重分布偏移时,该假设可能不成立,限制了 DAS 在极端场景下的可靠性。
  • **基准设计的覆盖度与公平性考量**:DataPrep-Bench 目前仅涵盖六个领域,源语料库构建过程依赖特定网页抓取和筛选策略,可能引入未知的选择偏差,使结果难以泛化到更广泛的数据类型(如代码、多模态数据)。另外,数据构建轨道的评分强制与 Dolly-15k 混合训练,这使评估更倾向与 Dolly 分布一致的合成方法,可能低估以其他风格(如对话、长文本)为目标的数据构建策略的真实价值,影响基准的公平性和生态包容性。
论文Hao Liang2026-05-19原文

相关内容