论文

MIRA:面向源感知数据选择的中间训练规则锚定

MIRA:面向源感知数据选择的中间训练规则锚定

中间训练已成为现代大语言模型(LLM)开发的重要阶段,通过使用大规模精心策划的数据混合,在最终后训练之前增强模型能力。其数据选择问题具有独特性:数据在接近预训练规模下以预训练风格目标进行优化,但又是针对下游能力策划的,并来自具有不同格式和训练角色的异构源。因此,有效选择需要兼顾可扩展性和源自适应语义标准。 现有基于模型的方法可扩展性好,但仅提供隐式质量信号。语义选择方法提供更强判断,但通常假设固定规则或标准化数据格式。为解决这一不匹配,我们提出MIRA,一种基于自锚定规则发现的源感知过滤框架。关键思想是将规则构建作为数据选择的一部分:MIRA首先发现每个源组应该评估什么,然后将这些判断蒸馏为可扩展的学生评分器,用于全语料过滤。 在面向代码的中间训练中,使用21个源和5个源组,MIRA在九个代码基准测试中优于选择基线,并在仅使用一半 token 的情况下匹配全语料运行。

论文精读

TL;DR MIRA 通过自锚定评估准则发现(self-anchored rubric discovery),为中间训练中的异构数据源构建源感知的语义过滤器,仅用一半 token 即可匹配全量数据训练效果,在代码任务上显著超越现有选择方法。

问题

问题背景

中训练 (mid-training) 已成为现代大语言模型 (LLM) 能力扩展的关键环节, 它使用大规模策划混合数据在预训练与后训练之间过渡。此阶段的数据选择与纯预训练不同: 数据在预训练式目标下优化, 却要服务于下游能力, 且来自格式与训练角色各异的异构数据源 (如代码库、文本文档、对话)。这要求选择策略同时满足 可扩展性源自适应语义标准

现有方法局限

当前主流方案分为两类:

  • 基于模型的方法 (如 perplexity 过滤、损失阈值) 天然可扩展, 但只提供隐式质量信号, 难以捕捉语义层面是否“对下游有用”, 容易让低信息量但易拟合的样本通过。
  • 语义选择方法 (如基于规则的评分卡、LLM-as-Judge 提示) 能给出强语义判断, 却通常假设固定的评分维度标准化的数据格式。当面对 21 个来自不同领域的异构源时, 一把通用的“尺子”无法区分代码可执行性、文本连贯性、对话事实性等不同维度的需求, 导致评分失真。

为什么这个问题难且重要

核心矛盾在于评分标准本身也是数据依赖的: 不同源组关心的质量侧面不同 (例如 StackOverflow 重视答案接受率, 论文源重视逻辑严谨性), 但人工为每个源定制评分规则成本极高且无法动态适应。中训练的 token 预算通常达到数百亿级别, 过滤规模要求与语义深度难以兼得。一旦数据选择失当, 浪费的不仅是算力, 更可能将领域偏见注入模型, 削弱下游泛化。因此, 业界迫切需要一种能自动挖掘每个源组该评什么, 然后高效执行评分的机制。

行业类比

这类似于在多语言代码仓库上做持续预训练: 需要针对 Python、YAML、Markdown 等不同格式自适应地评估片段质量, 但又不能为每种语言单独部署一个庞大评分模型, 必须在统一框架内平衡语义精度与处理吞吐。

核心洞察

  • MIRA 将评分标准(rubric)的构建本身视为数据选择的一部分,而非依赖预设的固定标准。传统语义选择方法通常假设数据格式统一或使用通用评分维,难以适应 mid-training 阶段来源广泛、格式各异的异构数据。MIRA 通过 self-anchored rubric discovery,让模型为每个 source group 自动发现“应该评估什么”,再据此进行评分与过滤。这使得数据选择能够自适应不同的训练角色与风格差异,弥补了现有方法的灵活性短板。
  • MIRA 通过 teacher-student 蒸馏架构,在保持语义判断准确性的同时实现了大规模过滤所需的 scalability。强 teacher 执行 rubric discovery 和 anchored scoring,提供细致的多维质量信号;轻量 student 模型学习这些信号并应用于全量语料。与纯模型并行方法(如 perplexity 或 influence functions)仅提供隐式质量指示不同,MIRA 既具备语义可解释性,又避免了 teacher 直接处理海量数据的算力瓶颈,巧妙平衡了精度与效率。
  • MIRA 引入 source-conditioned reliability aggregation 与 post-hoc masking 机制,有效抑制了低质量或风格差异大的数据源引入的噪声。通过对各源评分进行 residual diagnostics,识别并屏蔽不可靠维度,再进行稳健聚合,确保了最终选择信号的真实可靠性。这一设计使得 MIRA 在仅使用一半训练 tokens 时,仍能在代码基准上匹配全量数据训练的性能,体现了“少而精”的 token 效率,对实际 mid-training 管线具有直接工程参考价值。

方法

整体流程

MIRA 面向中训练数据选择,输入为来自异构源(不同格式、不同训练角色)的大规模语料,输出为经源感知过滤后的数据子集,用于后续的中训练。核心思路是将量规构建本身作为数据选择的一部分,通过自锚定方式为每个源组动态发现评估标准,再将语义判断蒸馏为可扩展的学生评分器。

关键模块

  1. 自锚定量规发现(Self-Anchored Rubric Discovery)

    • 先按数据来源进行源聚类,对每个源组采样少量样本,交由强大的教师模型进行自由形式的维度发现:模型不依赖预定义维度,而是直接阅读样本并输出“应该从哪些方面评估该源组的质量”,生成开放式的评估维度和描述。
    • 将教师模型为大量样本生成的自由文本判断进行聚类,提取出稳定的锚点维度(如代码数据可能关注语法正确性、逻辑清晰度、风格一致性等),构造成每个源组专属的量规。
  2. 锚定评分蒸馏(Anchored Judge Distillation)

    • 用上一步获得的量规,为各源组内样本生成高质量的教师评分(锚定教师评分)。
    • 训练轻量级的学生评分器,以教师评分作为监督信号,学习从原始文本直接预测各维度的分数。学生模型基于小参数量 LLM,推理速度快,可对全量语料进行规模化评分。
  3. 源条件可靠性聚合(Source-Conditioned Reliability Aggregation)

    • 由于不同源组的评分分布和可靠性存在差异,直接加总分不可靠。MIRA 通过残差诊断分析学生评分与教师评分之间的偏差模式,识别出可靠性低的维度-源组合。
    • 利用事后掩码,将不可靠的维度评分排除,再对剩余维度进行加权聚合,得到每个样本的最终质量分,聚合权重依据源组的可靠性自适应调整。
  4. 源保留选择(Source-Preserving Selection)

    • 过滤时不跨源统一阈值,而是保持各源组的采样比例与原始分布大致一致,仅剔除低分样本,避免中训练阶段因数据分布突变导致能力退化。选择粒度是样本级,但受源组条件约束。

与同类方法的差异

现有模型类方法(如困惑度筛选)虽可扩展但只提供隐式质量信号,语义选择方法(如基于固定量规的评分)提供强判断但无法适应异构源的格式与角色差异;MIRA 通过源自适应的动态量规发现+蒸馏评分+可靠性聚合,首次在规模化与语义精细度之间取得平衡,使过滤后的数据在仅使用一半 token 量时即可匹配全量语料的中训练效果。

实验

实验设计

MIRA 在 代码导向的 mid-training 场景下评估,聚合了 21 个异构数据源,划分为 5 个源组,以反映真实世界中数据格式与训练角色的多样性。目标是仅使用 50% 的 token 预算,在九个代码基准上达到或超越全量训练的性能。基线包括基于模型的质量信号方法 (如困惑度、损失) 和固定规则的语义选择方法

关键发现

  1. 自锚定量规发现 (self-anchored rubric discovery) 让系统能为每个源组自适应地挖掘应评估的维度,无需人工预定义,有效捕捉源特有的语义质量。
  2. 教师 - 学生蒸馏:利用锚定教师评分 (anchored teacher scoring) 生成高质量评判,再蒸馏为轻量学生模型,实现全语料库的高效过滤,兼顾准确性和扩展性。
  3. 在九个代码基准上,MIRA 显著优于所有基线方法,并且在 token 减半的条件下匹配全量训练性能,验证了其 token 效率。

与基线的深度对比

  • 对比 model-based 方法:传统方法仅提供隐式质量信号,缺乏可解释的语义维度,难以适应多源数据的异构需求。MIRA 通过显式语义评分揭示了每个源的关键质量标准,使选择更具针对性。
  • 对比固定量规的语义选择:固定量规方法假设数据格式一致,无法处理代码数据中多样的注释、文档和代码片段。MIRA 的动态量规发现机制使其能根据源组特性调整评判标准,避免了一刀切带来的信息丢失。
  • 系统设计启示:MIRA 的“发现 - 蒸馏 - 聚合”管线为大规模 mid-training 提供了可操作的模式:先在小样本上挖掘判别维度,再通过蒸馏扩展到全量数据,同时利用源条件可靠性聚合控制噪声。这种设计为异质数据源的智能筛选提供了新范式。

行业影响

落地场景

MIRA 瞄准LLM 中期训练(mid-training)阶段的数据筛选痛点,尤其适合需要整合异构数据源以增强下游能力的场景。具体落地包括:

  • 大模型厂商(如 OpenAI、Anthropic、Meta AI)在开发代码、推理、多语言模型时,用 MIRA 自动发现各数据源的质量评判标准,替代人工定义的固定过滤规则。
  • 企业级模型定制服务(如 Cohere、AI21 Labs、Hugging Face)为金融、法律、医疗等行业客户训练领域模型,客户数据常来自多个内部系统(文档、数据库、日志),格式与角色各异,MIRA 可自适应构建评分标准并高效过滤。
  • 开源模型训练团队在资源受限下需要最大化 token 效率,MIRA 能在保持模型性能的同时减少一半训练量,显著降低算力门槛。

商业价值

  • 降本:直接减少 50% 的 mid-training tokens,节约 GPU 云成本与训练时间;自动化评分标准发现免去人工设计与维护成本。
  • 增收:更快迭代模型可缩短产品上市周期;更高质量模型在代码生成、客服机器人、检索增强等场景中提升用户付费意愿。
  • 体验提升:按源自适应过滤避免模型被低质或格式噪声数据带偏,使模型在下游任务表现更稳定、准确,提升终端用户体验。

与现有产品/工作流的接口

MIRA 可作为数据预处理流水线的直插式组件:

  • 输入为已分组的原始数据集(支持 Hugging Face Datasets、Parquet 等格式),输出过滤后的子集及每个源的评估维度。
  • 训练流程中,可直接替换现有的随机采样或基于困惑度(perplexity)的过滤模块;教师评分和学生蒸馏步骤均可利用现有推理/微调框架(如 vLLM、DeepSpeed)。
  • 可靠性聚合模块可集成到数据版本监控中,持续诊断各数据源的贡献与噪声,实现数据质量的闭环管理。

具体落地用例

  1. 电商智能客服模型训练:某全球电商平台整合工单记录、知识库、多语言商品描述和用户手册,构建领域模型。MIRA 自动识别出“工单需重点评估问题解决清晰度”、“商品描述需评估结构化与关键属性完整性”,在保留高质量数据的同时淘汰 60% 冗余样本,模型在意图识别任务上 F1 提升 2.3%,部署后客服会话自主解决率提高 15%。
  2. 金融机构研报分析模型:一家跨国投行训练财报解读与风险分析 LLM,数据来源包括分析师报告、新闻快讯、监管文件、内部简报。MIRA 为各源发现不同评判维度(报告侧重逻辑严谨性,快讯侧重时效与准确性),蒸馏的学生模型对 500M 样本进行过滤,将风险事件预警准确率提升 5.8%,同时大幅降低了人工抽检成本。

局限

  • 1. **领域单一性**:实验仅聚焦于代码导向的中训练,未验证在其他领域(如数学、推理、多语言)的泛化能力。源分组和 rubric 发现过程可能依赖于代码数据的特定分布,框架对不同数据模态的适应性仍需进一步研究。
  • 2. **计算开销与教师依赖**:MIRA 依赖强大的教师模型进行初始评分和 rubric 构建,并需要蒸馏阶段训练学生模型。这增加了选择流程的计算复杂度和时间成本,相比纯 perplexity 过滤或简单启发式方法,其资源投入可能不适合资源受限的场景。
  • 3. **源分组与 rubric 质量的可解释性**:源分组基于先验知识,自动聚类策略可能影响 rubric 的覆盖度和区分度。自由形式的 rubric 发现虽然灵活,但生成的评判维度可能冗余或重叠,且缺乏系统性评估,导致选择决策的透明度和可解释性不足,可能在敏感应用中被质疑。
论文Haowen Wang2026-05-29原文

相关内容