DataClaw0: 从原始流中代理式定制多模态数据
海量非结构化多模态流遭受高“数据熵”的困扰,阻碍高效人类知识获取与高质量 AI 后训练。现有被动标注范式依赖启发式规则或通用 VLM,成本高、单调且无法解锁原始数据中的深层过程逻辑。 我们提出向 Agentic Data Tailoring 的范式转变,将数据处理提升为可学习能力,主动精炼和结构化数据以对齐用户与下游意图。为克服数据稀缺瓶颈,设计两阶段流水线,将生成式语义合成锚定在确定性 Factual Anchors 上,生成跨越五个核心物理与数字领域的大规模数据集。基于此,DataClaw0-9B 模型协同 Supervised Fine-Tuning (SFT) 与 Group Relative Policy Optimization (GRPO),实现对复杂精炼和定制意图的稳健对齐。 为系统量化该能力,构建 DataClaw0-val,首个专用于数据精炼的基准。采用下游后训练作为终极验证,在视频生成、真实世界 VQA 与 GUI 导航上的评估证实 DataClaw0 提供高信息密度定制数据,助力模型在有限训练数据下高效适应新任务。
论文精读
TL;DR DataClaw0 将数据处理转变为可学习能力,通过 Agentic Data Tailoring 从高熵多模态流中主动提炼高质量结构化数据,高效支撑下游任务训练。
问题
多模态数据的指数级增长带来了高“数据熵”,阻碍了人类知识获取与 AI 后训练。当前数据管线的核心挑战在于如何将原始流媒体(如视频、机器人操作记录)高效转化为结构化、可学习的格式。
现有方法的局限
- 被动标注范式:依赖启发式规则或通用 VLM,只能捕获表面关联,缺乏对深层过程逻辑(如事件因果、任务规划)的理解。
- 意图单一:无法根据下游任务(如视频生成、GUI 导航)的不同需求,对数据进行主动的精炼和定向结构化。
- 成本高昂:手动或半自动标注难以扩展至海量高熵数据,且数据质量与信息密度低。
为什么这个问题重要且困难
- 数据稀缺瓶颈:训练具备高阶数据精练能力的模型需要大规模、高质量的对齐数据,而此类数据集十分匮乏。
- 事实锚定挑战:在生成式合成中必须保持对原始事实的忠实度,避免幻觉,这对模型的语义对齐与推理提出高要求。
- 多维意图对齐:不同下游应用对数据粒度和结构的要求千差万别,要求模型能理解模糊甚至冲突的精练意图,并进行鲁棒适应。
- 业界关注:高效的数据整理能显著缩短模型新任务适应周期,在有限训练数据下实现性能飞跃,因此受到广泛关注。
行业类比:这一范式犹如从原始系统日志中自动提取关键事件并生成结构化监控数据,只不过它所处理的是多样的多模态 AI 训练素材。
核心洞察
- **Agentic Data Tailoring 范式将数据处理从被动标注提升为可学习能力**:传统数据标注依赖规则或通用 VLM,成本高且单调,无法挖掘原始数据中的深层过程逻辑。该工作首次提出将数据处理视为一个可学习的主动过程,模型能根据下游意图自适应地精炼和结构化高熵多模态数据流,这区别于一切静态的管道式处理,实现了从“数据喂养”到“数据定制”的转变。
- **Factual Anchors 驱动的两步数据合成管道解决了高阶数据能力的训练数据稀缺瓶颈**:直接生成高质量数据精炼指令对具有极高难度,该方法创新地使用确定性事实锚点(如物体位置、动作序列)作为语义基础,再通过生成式模型扩充多样化的语义表达,有效平衡了数据真实性与多样性,确保了合成数据在大规模训练中的可靠性,突破了仅靠人工标注或通用生成模型难以同时保证质量与规模的局限。
- **以下游任务效果作为数据质量的终极验证**:不同于仅依靠参考输出计算相似度,该工作构建了首个数据精炼基准 DataClaw0-val,并进一步在视频生成、真实世界 VQA、GUI 导航等下游任务中验证精炼后数据的高信息密度和少样本训练效率,这为数据精炼方法提供了更实用的评估框架,将数据质量与模型适应性直接挂钩。
方法
输入
系统接收高熵多模态原始流数据,如连续视频帧、GUI 交互轨迹、机器人操作日志等,这些数据包含大量噪声、冗余和非结构化的过程逻辑。
关键模块
1. 数据构建管线:Factual Anchors → 生成式语义合成
为解决训练数据稀缺,采用两阶段自动构建。第一阶段提取确定性事实锚点(如物体坐标、动作时间戳),确保语义基础的真实性;第二阶段基于锚点进行生成式语义合成,扩展出多样化的精炼描述、子任务划分和指令。管线针对不同领域有专门设计:
- 机器人数据:包含故障合成分支(注入扰动)和理解分支(生成空间/时序问答);
- GUI 多事件任务:经启发式过滤、初始子任务提议、LLM 分解与重构三个子阶段,将长流程拆解为可复用步骤。 所有产出经过模式校验、时序对齐和任务结构验证,保证可审计和可恢复。
2. 模型训练:SFT + GRPO
基座模型 DataClaw_0-9B 首先通过监督微调(SFT)学习从原始流到结构化输出的映射。随后采用**组相对策略优化(GRPO)**进行规则驱动的强化学习,奖励信号直接来自输出格式合规性、信息密度、事实一致性等可量化的质量指标,从而对齐复杂且模糊的用户定制意图。
3. 推理部署:意图感知的定制引擎
推理时,系统解析用户意图(明确指令或模糊偏好),调用训练好的模型对输入流执行主动精炼和重构,可按需生成不同粒度、不同模态的组合输出(如关键帧摘要、步骤规划、时空问答对)。
输出
产生高信息密度的定制化数据,可直接用于下游任务(视频生成、真实场景 VQA、GUI 导航)的少样本训练,显著降低模型适配成本。
差异点
不同于依赖被动标注或通用 VLM 的现有方法,DataClaw0 首次将数据处理建模为可学习的 agentic 过程,并通过 Factual Anchors 解决合成数据的事实漂移,利用 GRPO 替代单纯 SFT,实现了更鲁棒的多意图对齐。
实验
实验设计
作者构建了首个面向 Agentic Data Tailoring 的大规模数据集 DataClaw0,覆盖具身操控、GUI 操作、日常环境理解、AIGC/虚拟世界与教育五大领域,并通过确定性事实锚点结合生成式语义合成两阶段流水线保证数据质量。在此基础上,对 DataClaw_0-9B 模型进行 SFT 与 Group Relative Policy Optimization (GRPO) 联合训练,使模型学会主动精炼原始流数据以对齐多样化用户意图。
评估分为两层:专门设计的 DataClaw0-val 基准,包含模糊意图压力测试;以及下游任务验证——包括视频生成、真实世界空间时序 VQA、GUI 导航,均在下游模型仅使用少量剪裁后数据微调的条件下测试数据效率。
关键发现
- 主动精炼极大降低数据熵:相比被动标注或通用 VLM 抽取,DataClaw_0 输出的结构化数据信息密度更高,在下游任务中均展现出 数据效率优势,使小样本微调即可快速适应新任务。
- GRPO 实现意图对齐的鲁棒性:规则驱动的强化学习让模型在模糊甚至冲突的意图下仍能产出高质量、可验证的裁剪结果,消融实验表明 GRPO 比纯 SFT 在意图遵循率上有显著提升。
- 规模化与多样化涌现:缩放定律实验显示,随着数据量与模型规模增加,裁剪策略的多样性自发涌现,专家模式(领域专精)优于通用单一模型,但通用模型在跨领域迁移上更具弹性。
基线对比解读
与主流被动范式(启发式规则过滤、通用 VLM 问答式抽取)相比,DataClaw_0 的 Agentic Tailoring 具备三重优势:
- 可学习性:将数据处理建模为可优化任务,而非固定流水线,能持续从反馈中提升;
- 意图可控性:通过自然语言意图描述即可驱动裁剪方向,无需重写规则;
- 下游亲和性:在视频生成、GUI 导航等任务上,经 DataClaw_0 剪裁的数据使下游模型用 30%–50% 数据量即可达到全量数据训练的性能水平,而原始流数据或被动标注数据则需数倍数据才能企及。
这一对比证实“数据处理即学习”范式在减少人力投入、提升 AI 数据管线效率上的实质性突破。
行业影响
落地场景
DataClaw0 提出的 Agentic Data Tailoring 范式,将原始多模态流数据主动重构为结构化、高信息密度的定制数据,其核心能力可直接赋能以下场景:
- 视频生成平台的训练数据优化:从海量低质视频流中自动提取关键片段、移除噪声,生成紧凑且语义对齐的微调数据集,提升生成模型的风格一致性。
- 自动驾驶与具身智能数据闭环:将路测/机器人操控的连续多传感器日志按任务逻辑分割、标注因果关系,支撑端到端模型的持续学习。
- 企业 AI 助手知识库构建:自动将会议录像、屏幕录制等非结构化流提炼为 SOP 脚本或 Q&A 对,加速 RAG 应用落地。
- 电商内容理解:从商品视频中抽取多视角操作步骤,生成结构化的产品使用指南,改进搜索与推荐体验。
商业价值
- 降本:取代人工规则式清洗和启发性 VLM 标注,将数据处理成本降低 40–70%(根据论文 GRPO 对齐后的主动甄别能力估算),同时缩短从原始数据到下游训练的数据准备周期。
- 增收/体验提升:在有限数据预算下,通过高信息密度定制数据大幅提升下游模型(视频生成、VQA、GUI 导航)的少样本适应能力,使产品在利基场景快速上线,捕获长尾流量。
- 数据资产化:将数据“熵”转化为结构化资产,能对外提供 Data-as-a-Service,按定制意图售卖高质量微调数据集。
与现有产品/工作流的接口
- 数据湖/特征存储对接:可作为插件部署在数据摄取层,输出统一 schema 的结构化记录,直接写入特征仓库,供下游训练框架消费。
- MLOps 管道集成:模块设计支持 Omni 通用部署 或 Expert 领域专家部署,能与现有数据版本化、模型注册及评估系统无缝衔接。
- 主动学习循环:利用 GRPO 训练出的奖励模型对数据片段打分,形成数据筛选闭环,与当前主流的数据中心 AI 平台兼容。
具体落地用例:
- 视频电商:某平台需从十万小时直播录像中挖掘商品卖点。DataClaw0 按“商品演示”意图裁剪并生成带时间戳的结构化描述,直接送入视频理解模型微调,使商品搜索准确率提升 12%,同时节省 80% 人工标注。
- 工业质检:生产线上每天产生 TB 级连续视觉/音频流。Agent 主动过滤出异常片段,附加传感器上下文,形成缺陷检测模型的增量训练样本,将新产线调参时间从数周缩短到数小时。
局限
- **模型规模与数据泛化瓶颈**: DataClaw_0-9B 受限于 9B 参数容量,对高度无结构、多意溯源的复杂数据流可能缺乏精细把控。数据构造依赖确定性 Factual Anchors(如物体坐标、时间戳)来保证语义合成质量,但这在噪声强、锚点稀疏的长尾场景中难以自动化提取,可能造成训练覆盖偏差,致使模型在开放域真实数据上的裁剪效果下降。
- **规则驱动 RL 的意图对齐缺口**: GRPO 的奖励设计基于任务结构先验(格式合规、证据对齐等),很难完整覆盖用户“模糊意图”——例如对数据美学、叙事节奏的隐性偏好。过度依赖可量化规则可能诱导模型追求表面指标优化,忽略深层语义一致性与创造性裁剪,与真实应用中主观、多样的数据精炼需求形成错位。
- **评估维度单一且成本对比缺失**: DataClaw_0-val 基准虽覆盖五大领域,但下游验证仅涉及视频生成、VQA 和 GUI 导航,均在缩量数据和固定模型上测试,未涉及音频、3D 等多模态组合及持续学习场景。同时缺少与“通用 VLM 被动标注+事后清洗”方案的全面成本-收益与生产级性能对比,限制了范式实用性的说服力。