论文

通用型智能体能否自动化数据策展?

通用型智能体能否自动化数据策展?

数据策展是现代 AI 开发中最关键但也最劳动密集的环节之一:实践者需要根据嘈杂的基准反馈,迭代地提出、实现、评估和修订数据策略。我们研究通用编码智能体是否能自动化这一数据策展循环。 我们引入 Curation-Bench,一个以智能体为中心的基准,固定模型、训练配方和评估套件,同时赋予智能体命令行权限来检查数据、实现策略、提交到固定的训练/评估流水线并修订。在视觉语言指令微调实例中,现成的智能体在十次迭代内达到强大的已发布数据选择基线。然而,轨迹分析揭示了持续的 “执行-研究差距”:智能体主要调整局部策略变体,而不是探索新的策略家族,即使提供了策略指南和论文参考。要求每次迭代引用、实例化和改编先前方法的脚手架,引导智能体进行方法导向的探索。脚手架智能体自主组合出一种数据选择策略——无需人工设计输入——在十分之一的数据预算下超越了强大的已发布基线。 总体而言,当前智能体可以运行策展循环,但可靠的数据研究需要结构化的方法适应,而非仅依赖开放式提示。代码和基准已开源。

论文精读

TL;DR 通用编程 agent 能自动执行数据策展循环,但仅靠开放式提示会陷入局部调优;通过脚手架强制引用与适配已有方法,agent 可自主组合出超越强基线且数据预算仅十分之一的策略。

问题

问题背景

现代 AI 开发中,训练数据的策展(data curation)是影响模型性能的关键环节,但也是最劳动密集的重复性工作:从业者需根据噪声基准反馈,反复设计、实施、评估并修订数据策略。

现有方法局限

主流的自动化尝试大多停留在固定启发式规则或离线评分筛选(如 CLIP score 过滤、去重),这类静态方法无法适应任务特异的动态需求。手动迭代调优不仅耗时,且探索空间巨大——数据组合、采样比例、去重粒度、增强策略等维度相互耦合。近年虽涌现出一些自动数据选择基线(如利用模型不确定性或主动学习),但它们通常只提供单次建议,缺乏闭环的持续改进能力。更关键的是,现有工具往往只执行预设策略,不具备像人类研究者那样自主提出新策略族的能力,导致优化始终局限于局部变体。

为什么这个问题难且重要

数据策展的自动化面临三大挑战:

  1. 搜索空间复杂:数据组合与处理步骤的组合呈指数级,且评估代价高昂(需完整训练验证流程)。
  2. 反馈稀疏且噪声强:基准分数波动大,很难将性能变化归因到具体策略调整。
  3. 探索-利用困境:智能体既要高效利用已知有效策略,又需冒险探索未知方法族,现有代理容易陷入“安全”的局部微调。

业界对此关注度极高——高质量数据是模型能力的直接上限,自动化策展可大幅缩短研发周期,尤其在视觉-语言指令微调等数据饥渴场景中,用更少数据达到更强性能意味着显著的成本与效率优势。

类比场景

类似 AutoML 将特征工程与超参数搜索自动化,数据策展有望成为下一个被智能体驱动的研发飞轮,但需要克服其特有的长周期反馈与探索惰性。

核心洞察

  • 执行-研究差距 (execution-research gap) 是代理自动化数据策展的主要瓶颈。尽管代理能高效运行迭代实验,但轨迹分析显示其倾向于局部调优已有策略变体,而非探索全新策略家族,即使提供了策略指南和论文参考。这与许多自动化研究工作的隐含假设形成对比——它们假定开放式提示足以激发代理的研究能力。该差距表明,简单的迭代反馈循环无法取代人类研究者的归纳式探索,揭示了当前通用代理在开放研究任务中的根本局限。
  • 方法引导的脚手架 (method-guided scaffolding) 通过强制引用与实例化,引导代理从调参走向策略组合。在 Curation-Bench 中,要求每轮迭代引用、实例化并调整一种先前方法,使代理的探索行为从局部搜索转向方法驱动的全局探索。这种结构化介入让代理自主组合出超越强基线的数据选择策略,且仅使用十分之一的数据预算。这提示,未来自动化研究工作流应设计中间表示和约束,而非完全依赖开放式提示,为构建能进行真正数据研究的 AI 系统提供了框架性参考。

方法

Curation-Bench 将数据策展抽象为代理驱动的闭环优化,固定模型、训练配方与评估套件,仅允许代理通过命令行接口(CLI)与训练管线交互。代理在每个迭代中执行四个步骤:1) 数据审查 — 读取样本统计、错误模态等元数据;2) 策略实现 — 用代码描述数据筛选规则(如基于 CLIP score、文本长度的过滤逻辑);3) 提交训练 — 触发预设的 vision-language 指令微调管线;4) 结果分析 — 获取基准分数并决定下一轮改进方向。

初始实验表明,开箱即用的通用编码代理(如 GPT-4)在 10 次迭代内即可达到已有的强基线。然而轨迹分析暴露出执行-研究鸿沟:代理倾向于在局部调整超参数或微小策略变体,很少探索新的策略家族,即使提供了策略指南与参考文献。

为引导代理进行方法导向的探索,研究者引入了结构化脚手架:强制每次迭代必须引用、实例化并适配一种已有方法。脚手架将代理的搜索空间从随意试错转向系统性的方法组合。在此约束下,代理自主组合出了一种数据选择策略,仅使用基线十分之一的数据预算便超越了所有已发布的强基线,且过程无需人工设计介入。

与传统的自动化数据策展工作不同,Curation-Bench 不依赖固定的启发式规则或离线分析,而是让代理在真实的执行反馈中动态研究;而又区别于纯粹开放式 Agent 自由探索,方法导向脚手架充当了“研究规范”,为代理提供可解释、可复用的研究路径,是弥合自动化与可靠研究之间差距的关键设计。

实验

实验设计

作者提出 Curation-Bench,一个以 agent 为核心的基准测试。该基准固定了模型架构、训练配方与评估套件,仅通过命令行接口向 agent 暴露数据检查与策略实现能力。agent 需要在迭代循环中:分析现有数据,编写数据筛选策略,提交训练任务,观察评估反馈,再根据反馈调整策略。整个循环模拟了人类数据工程师的策展工作流。实验实例选用 视觉语言指令微调 场景,以检验通用型编程 agent 在真实数据工程任务中的自主性。

关键发现

  1. 开箱即用的 agent 能达到强基线:在 10 次迭代内,未加特殊引导的 agent 可逼近已发表的强数据筛选方法。
  2. 执行-研究差距:轨迹分析显示,agent 倾向于反复微调同一策略族的局部变体,即使提供了策略指南与论文参考,也极少主动探索全新的策略类别。这暴露了单纯依赖开放式提示的局限。
  3. 方法引导探索:引入一种脚手架机制,要求 agent 在每个迭代周期显式引用、实例化并适配一篇已发表的方法,可使 agent 从局部调优转向系统性方法探索。

在该脚手架支持下,agent 自主组合出一种数据选择策略,在十分之一的数据预算下超越了此前的强基线,整个过程无需人工设计输入。

与基线的深度对比

基线包括已有的数据筛选方法,如基于多样性的采样、难度感知过滤等,这些方法通常需要大量数据预算和专家设计。单纯靠开放式提示的 agent 虽然能够复现基线效果,但本质上仍在已知策略空间内微调,无法产生实质性创新。而方法引导的脚手架则迫使 agent 建立方法间的关联,借鉴不同策略的思想进行重构,最终在极低数据配额下实现性能超越。这揭示了自动化数据策展的新路径:不是要替代人类研究,而是通过结构化的方法适配框架,让 agent 有能力进行受控探索。对工程实践而言,这意味着简单的 prompt 调优远不如引入引用-适配-迭代的闭环流程有效,未来自动化数据 pipeline 的架构应内置类似的知识引导机制。

行业影响

落地场景

Curation-Bench 所代表的自动化数据策展能力可直接嵌入各类需要定制训练数据管线的产品中。典型场景包括:电商平台 对商品图像与文本描述的视觉-语言模型进行周期性重训,用智能体自动发现新数据策略替代人工编辑规则;内容平台 在推荐与审核模型的迭代中,通过 agent 自主探查不同数据子集组合,缩短实验周期;企业 AI 平台(如数据标注、MLOps 工具)可将该 agent 作为“数据策略助手”内置,辅助用户生成并验证数据选择策略。

商业价值

价值主线是降本加速。现代 AI 开发中,数据策展(制定过滤规则、平衡分布、主动选择样本)耗费大量工程师与研究员时间;本工作展示的 agent 能在 10 轮迭代内逼近甚至超越人工设计的强 baseline,且支架式 agent 在 1/10 数据预算 下性能反超,直接降低算力与标注成本。对业务而言,这意味着同样的研发资源可支撑更多并行实验,更快将模型投入生产,间接带来营收机会的提前捕获用户体验的快速提升

跟现有产品/工作流的接口

Agent 通过命令行与数据存储、训练 pipeline 交互,这一范式极易集成到现有 ML stack。具体接口包括:

  • 数据湖 / 版本化数据仓库:agent 读取数据统计信息、采样查看样本;
  • 实验追踪系统(如 MLflow / Weights & Biases):提交训练任务并获取评估指标作为反馈信号;
  • CI/CD 流水线:将 agent 的迭代过程视为一个自动化的“数据研究”步骤,触发后续的完整训练与部署。

支架型 agent 的引入,本质上是在现有 MLOps 流程中加入一个带约束的创造性探索模块——它不只是超参搜索,而是通过引用、实例化并改编已知方法,自主组合出新策略,输出可复现的数据配置。

具体落地 Use Case

  1. 电商视觉搜索模型迭代:某电商平台需要定期改进其视觉-语言模型以适配新款商品和季节性潮流。现有流程由数据科学家手工制定筛选规则(如选取高点击率商品、平衡长尾类目)。部署 Curation-Bench 型 agent 后,agent 直接访问商品数据库,引用如 CLIP score filteringhard negative mining 等方法,自动生成并验证新的数据策略,将原本需要数周的迭代周期压缩到数天,且策略可解释、可追溯。

  2. 金融文档理解模型维护:金融机构部署的文档信息抽取模型需定期适配新监管法规和报告格式。数据策展 agent 可接入标注池与模型评估 API,依据最新评估结果引用 uncertainty samplingdiverse subset selection 等经典策略,调整训练数据构成,使模型在关键实体上 F1 提升的同时降低人工复查成本。

局限

  • 开箱即用的通用 agent 倾向于调整局部策略变体而非探索新策略家族,即使提供策略指南和论文参考。这种“执行-研究差距”表明当前 agent 在数据管理中缺乏真正的创新探索能力,可能过度依赖已有模式,导致策略次优。该局限可能源于 prompt 设计或推理能力不足,需要 scaffold 引导方法级搜索,但 scaffold 本身引入了人工先验,可能限制发现全新方法。
  • Curation-Bench 仅在视觉-语言指令微调任务上实例化,其结论(如 scaffold 的重要性)可能无法直接迁移到其他数据管理场景。数据管理循环的复杂性因模态和任务而异,agent 的表现可能差别很大。此外,固定模型和训练 recipe 虽控制变量,但也限制了对真实系统动态演变组件的泛化能力,影响 agent 决策的鲁棒性。
  • agent 驱动的数据管理循环需多次迭代训练与评估,计算成本高昂。论文未详细讨论开销,但每次迭代涉及完整训练流水线,对大规模数据和模型可能不切实际。agent 推理成本及 scaffold 中方法引用所需的外部知识库访问也增加了实际部署的复杂性,限制了该方法的可扩展性。
论文Feiyang Kang2026-06-02原文

相关内容