论文

无监督技能发现用于代理数据分析

无监督技能发现用于代理数据分析

推理时技能增强为数据分析代理提供了一种轻量级改进方式,通过注入可复用程序知识而不更新模型参数。然而,无监督地发现有效技能仍具挑战,因为可靠监督成本高且成功标准因分析格式而异。核心问题是如何仅从无标签探索中发现可复用的数据分析技能。 本文提出 DataCOPE,一种无监督验证器引导的技能发现框架。它从探索轨迹中推导验证信号,用于表征轨迹间的相对质量或一致性。框架迭代协调三个组件:数据分析代理 负责生成轨迹,无监督验证器 负责提取信号,技能管理器 负责对比性技能蒸馏。针对报告型分析,实例化为 自适应检查表验证器,推导任务特定标准,通过可验证覆盖率评分并迭代精炼检查表。针对推理型分析,实例化为 答案一致性验证器,按答案一致性分组轨迹,并利用自一致性作为辅助信号。 在 Deep Data Research(报告型)和 DABStep(推理型)上评估。两种设置下,DataCOPE 一致提升留出性能。平均四种模型配置,报告型和推理型任务分别提升均值分数 9.71% 和 32.30%。

论文精读

TL;DR DataCOPE 通过无监督验证信号从探索轨迹中发现可重用数据分析技能,无需人工标注即在报告与推理任务上分别提升 9.71% 和 32.30% 平均得分。

问题

问题背景

在数据驱动分析代理领域,通过推理时注入可复用的过程性技能(inference-time skill augmentation)来提升分析质量,已成为一种轻量且不更改模型参数的有效范式。这类技能作为显式知识载体,能引导代理在报告生成或推理求解等格式迥异的分析任务中遵循最佳实践。

现有方法局限

当前技能发现方法主要依赖人工标注或高质量监督信号(如金标准报告、专家对答案)。然而,数据标注成本高昂且难以覆盖多样化的分析格式与评判标准:报告式分析强调要点覆盖度与逻辑结构,推理式分析则侧重答案准确性与一致性。这使得依赖单一监督源的方法在跨格式迁移时表现脆弱。此外,即使存在自动化评估,也往往局限于特定指标(如执行准确率),无法捕捉报告质量等开放式维度的细粒度反馈。从有限的无标注探索轨迹中无监督地提炼出可靠技能,现有方案仍缺乏有效机制。

为什么这个问题难且重要

从无标注探索中自动发现技能,面临两大技术挑战:

  1. 信号萃取:代理探索产生的轨迹庞杂,需从中自动提取相对质量或一致性信号,作为技能选择与优化的依据。
  2. 跨格式泛化:报告式分析与推理式分析的评判逻辑完全不同(前者重清单覆盖,后者重答案自洽),同一套 verifier 无法直接复用。 在业界,数据分析日益依赖大模型代理,但模型微调与强监督依赖的边际成本极高。无监督技能发现可大幅降低数据准备门槛,使代理能持续从与环境的交互中自我进化,具有显著的工程落地价值。

行业类比

类似于强化学习中用自身奖励信号替代人工设计奖励函数,DataCOPE 通过无监督 verifier 从分析轨迹中提取对比信号,让数据分析代理像“自学成才”的分析师,无需每次任务都依赖专家打分的昂贵监督。

核心洞察

  • **无监督验证器驱动的技能发现**:DataCOPE 通过自适应清单验证器和答案一致性验证器,从探索轨迹中提取无监督的信号来评估轨迹质量,从而指导技能学习。这与依赖人工反馈或强监督的方法不同,它能在没有标注的情况下发现有效技能,显著降低成本,并适应不同的成功标准(如报告覆盖度或答案一致性),为自主代理的持续学习提供了一种可扩展的范式。
  • **对比蒸馏与迭代精炼的闭环技能优化**:DataCOPE 的技能管理器通过对比高质量和低质量轨迹来蒸馏可重用技能,并且验证器会随着技能的改进而不断更新其评估标准,形成技能与验证器的协同进化。这种迭代求精机制使得技能库能够动态适应任务的变化,而非静态的一次性提取,实验证明它能带来显著的性能提升,并展示了无监督学习在复杂分析任务中的潜力。

方法

整体框架

DataCOPE 是一个无监督验证器引导的技能发现框架,通过迭代协调三个核心组件,从无标注的探索轨迹中自动提炼可复用的数据分析技能。

  • 输入:未标注的数据分析任务,由 Data-Analytic Agent 自主生成多条推理/操作轨迹。
  • 关键模块
    1. Unsupervised Verifier:从轨迹中提取相对质量或一致性信号,分为两种实例化:
      • Adaptive Checklist Verifier(面向报告式分析):动态生成任务特定的检查清单,以可验证覆盖度对报告进行量化评分,并通过对比学习迭代精炼清单,使评估标准逐步收敛。
      • Answer Agreement Verifier(面向推理式分析):按答案一致性对轨迹聚类,以自洽性为辅助信号,划分高/低质量样本。
    2. Skill Manager:根据 Verifier 信号执行对比技能蒸馏——从高质量轨迹中抽取过程性知识(技能),同时抑制低质量轨迹的噪声,生成紧凑的技能表示。
  • 输出:一组可复用的技能,能在推理时直接注入 Agent,提升分析表现,无需修改模型参数。

迭代优化

框架以多轮方式运行:每轮生成的轨迹经 Verifier 重新评估,技能库随之更新。Skill Manager 通过对比损失强化有效行为模式,逐步淘汰不可靠技能。整个过程无需任何外部监督,完全依赖探索轨迹内部的结构化信号。

与原方法的差异

与依赖人工标注或固定规则的技能发现方法不同,DataCOPE 完全基于无监督验证信号对比蒸馏机制,在报告式(+9.71%)和推理式(+32.30%)两种截然不同的分析范式下均能稳定提升 Agent 性能,且训练成本远低于监督方法。

实验

实验设计

评估 DataCOPE 在两种典型数据分析格式上:报告式分析 (report-style) 使用 Deep Data Research 基准,推理式分析 (reasoning-style) 使用 DABStep 基准。方法迭代进行:Data-Analytic Agent 生成多条探索轨迹,Unsupervised Verifier 提取相对质量或一致性信号(报告式采用 Adaptive Checklist Verifier 自适应生成检查表打分,推理式采用 Answer Agreement Verifier 按答案一致性分组并估算自洽性),Skill Manager 通过对比蒸馏提取可复用技能。测试在未见过的新任务上评估技能注入后的性能提升,对比基线包括无技能注入、随机技能选择及有监督技能发现。

关键发现

  • 跨任务格式一致提升:在四种模型设置下平均,报告式任务得分提升 9.71%,推理式任务提升 32.30%
  • 无监督验证器信号有效:自适应检查表和答案一致性信号能可靠区分轨迹质量,为技能蒸馏提供有效指导。
  • 技能可迁移:发现的技能在不同基础模型间可迁移,增强 agent 泛化能力。
  • 迭代细化非单调:分析表明迭代轮数对性能提升有边际递减,但总体有效。

与基线对比的深度解读

相较于监督式技能发现依赖昂贵人工标注,DataCOPE 仅从未标注的探索中学习,显著降低了获取技能的成本。其 对比技能蒸馏 机制使技能更聚焦于成功轨迹的关键决策模式。在推理式任务中,自洽性辅助信号 大幅提升性能,说明对开放式推理,一致性强于单一正确性判断。而报告式任务中,任务特定检查表 的迭代细化能动态适应评估标准,优于固定指标的评估。整体而言,该方法为构建自进化的数据分析智能体提供了无监督路径,减少了人工介入和模型参数更新,具备工程实用性。

行业影响

落地场景

DataCOPE 的无监督技能发现可直接嵌入各类自动化数据分析与报告生成产品。典型用例:

  • 电商运营分析:自动抽取促销活动效果、用户分群、库存周转等分析模式,生成多维度运营报告,无需人工标注。
  • 金融投研助手:从历史行情与财报数据中自主发现分析技能,输出结构化研究报告,适配不同券商的模板要求。
  • 科研数据分析 SaaS:为生物信息学、社会科学等场景提供可复用的分析流水线,通过自洽性验证保证推理一致性。

商业价值

  • 降本:消除为不同分析格式定制标注监督的昂贵成本,技能库可跨任务复用,显著减少持续的人力投入。
  • 增收:加速从数据到洞察的闭环,使业务团队更快做出决策,在电商促销、量化策略等场景中直接转化为收益增量。
  • 体验提升:通过 Adaptive Checklist VerifierAnswer Agreement Verifier 保证输出质量,用户获得更可靠、更一致的分析结果,降低二次校验负担。

与现有产品/工作流集成

DataCOPE 设计为轻量级框架,可无缝接入 LangChain / AutoGen 等多智能体编排平台。具体接口:

  1. 技能库注入:将发现的技能作为可插拔的 Skill 对象挂载到现有 agent 的工具列表,不必修改模型权重。
  2. 验证器即服务:无监督验证器可作为独立微服务,消费 agent 轨迹并返回评分与检查清单,供编排层调度。
  3. 迭代自进化:通过持续采集生产环境中的探索轨迹,技能库可增量更新,逐步提升报告覆盖度与推理准确率。

对于已有数据分析管道(如 dbt + BI 工具)的团队,DataCOPE 生成的技能可自动转换为可执行的查询模板或报告段落,降低开发定制报表的工作量。在医疗领域,它可辅助影像数据初步解读,通过答案一致性检验减少诊断遗漏;在企业服务场景,能驱动合同条款分析自动化,生成合规审查报告。

局限

  • 无监督验证器的信号可靠性:DataCOPE 依赖从探索轨迹中提取的相对质量或一致性信号(如检查清单覆盖或答案一致性),但这些信号可能与真实分析质量不完全对齐,尤其在复杂或模棱两可的任务中,可能导致技能蒸馏引入偏差。此外,检查清单的迭代优化也可能过拟合到探索数据的噪声,影响技能泛化性。
  • 任务格式泛化性:框架为报告式和推理式分析分别设计了特定的验证器(Adaptive Checklist Verifier 和 Answer Agreement Verifier),对于混合或非标准分析格式,需要额外设计新的验证器,不具备即插即用的通用性。目前仅在两种格式的数据集上验证,扩展到其他类型的数据分析任务(如交互式探索、可视化设计等)的有效性未知。
  • 计算开销与效率:迭代式的技能蒸馏过程需要多轮轨迹生成和验证,计算成本显著高于单次推理,且技能管理中的对比选择策略可能对大模型调用次数要求较高。论文中成本分析部分未完全展示,实际部署时可能面临资源约束。
论文Zhisong Qiu2026-06-04原文

相关内容