DFM Mimir v1:一个仅使用许可后训练数据、在1B参数下实现前沿性能的开放HRM
当前大语言模型的开发依赖于海量的、往往不合规的数据集,这给致力于开源和合乎伦理数据的研究者设置了高门槛。我们提出 Mimir v1,一个基于 层次推理模型(HRM)架构 的10亿参数语言模型,完全从头训练,仅使用许可后训练数据,就在英语上展现出极具竞争力的性能,并在丹麦语上刷新了最先进水平。 模型在 161个数据集 的混合上训练,Mimir v1 超越了原版 HRM-Text 1B,并能与更大的前沿模型(如 Qwen 3.5 4B 和 Gemma 4 E2B)一较高下。我们测试了 20个基准,涵盖英语、数学与代码、以及丹麦语。 模型已在 Hugging Face Hub 上开源:https://huggingface.co/danish-foundation-models/DFM-Mimir
论文精读
TL;DR DFM Mimir v1 是一个 1B 参数的 HRM 架构语言模型,仅用可许可数据训练,在英语任务上比肩更大模型,并在丹麦语上刷新 SOTA。
问题
问题背景
当前 LLM 领域关注在有限数据许可和计算资源下构建高性能、可复现的开源模型,尤其针对多语言与低资源语言场景。
现有方法局限
主流 LLM 训练沿用“monolithic recipe”,依赖大规模、往往未获明确许可的网络数据,带来三方面局限:1) 合规风险——预训练与后训练数据难以审计,无法满足严格数据政策;2) 可复现性差——数据集不公开,社区无法验证或扩展;3) 低资源语言瓶颈——以丹麦语为例,可用许可数据极少,从零训练常不可行。后训练阶段若引入专有指令数据,进一步削弱开源承诺。HRM-Text 1B 等早期尝试虽采用 HRM 架构,但在严格数据约束下仍难达到前沿水平。
为什么这个问题难/重要
在仅使用 permissible 数据的条件下,让 1B 参数模型在 20 个基准上逼近 4B 级模型,需同时攻克三项技术挑战:有限数据下的泛化能力、跨语言迁移效率、以及小模型专用推理架构设计。难点在于,数据量的减少要求更优的数据配比与训练策略,而多语言任务又加剧了容量分配冲突。该问题对行业至关重要,因为数据合规、开源透明与成本控制正成为 AI 落地的硬性要求,任何能在严格数据限制下提升性能的方法都会直接降低产业应用门槛。
行业类比
类似在医疗影像或金融风控等强合规领域,只能使用明确授权的数据训练模型,必须在数据约束下压缩模型规模并保持精度。
核心洞察
- HRM 架构在 1B 参数下实现了对先前 HRM-Text 1B 的超越,并能在英语基准上与 Qwen 3.5 4B、Gemma 4 E2B 等更大模型竞争。其独特之处在于采用层级推理机制(Hierarchical Reasoning Model),在不增加参数规模的前提下提升推理与生成质量,这与主流依赖参数规模扩张的 Transformer 路线形成对比,为小模型高效部署提供了新的架构选择。
- 完全使用 permissible post-training data 从零训练,Mimir v1 在丹麦语上取得 SOTA,证明高质量许可数据足以支撑中小型前沿模型。与常见的大规模非许可预训练数据路线不同,该工作表明在受限数据条件下,通过精心策划的 161 个数据集混合和 HRM 架构,也能达到可与更大模型竞争的水平,为合规 AI 研究提供了可复现的路径。
方法
输入与数据
Mimir v1 从零开始训练,仅使用 permissible post-training data(可许可的后训练数据),混合了 161 个数据集,覆盖英语、丹麦语、数学、代码等类别。数据处理流程包括清洗、去重和类别平衡,以保证小模型在有限数据下的高效学习。
关键模块
- 架构:基于 Hierarchical Reasoning Model (HRM) 架构,相比原 HRM-Text 1B 改进了分层推理模块,旨在提升小参数模型在复杂推理任务上的表现。
- 训练策略:采用从零开始的训练方式,未依赖大规模预训练权重;通过多任务混合训练,使模型同时具备语言理解、数学推理和代码生成能力。
输出与评估
模型在 20 个基准 上进行评估,涵盖英语、数学与代码、丹麦语三个方向。结果显示 Mimir v1 在英语任务上具备竞争力,在丹麦语任务上达到了新的 state-of-the-art,整体性能优于 HRM-Text 1B,并与 Qwen 3.5 4B、Gemma 4 E2B 等更大参数模型相当。
核心创新点:仅依靠完全可许可的数据和 1B 参数,便实现了与更大模型竞争的性能,降低了合规数据下小模型训练的门槛。
与同类方法的差异
与依赖大规模非许可数据或预训练权重的模型不同,Mimir v1 完全从零开始,严格限定在可许可数据范围内,仍能在多语言和多任务上达到前沿水平,为开放且合规的小模型训练提供了可复现的范式。
实验
实验设计
Mimir v1 是基于 HRM(Hierarchical Reasoning Model)架构的 1B 参数模型,从零开始训练,仅使用 permissible post-training data(许可后训练数据)。训练数据为 161 个数据集的混合,覆盖英语、数学与代码、丹麦语等任务域。在 20 个 benchmark 上评估,包括英语、Math & Code、Danish 三个类别。基线包括原版 HRM-Text 1B,以及更大的 Qwen 3.5 4B 和 Gemma 4 E2B(摘要说法;图注为 Qwen 3.5 2B,存在不一致,需注意)。评估采用聚合结果对比。
关键发现
实验显示,Mimir v1 在 20 个 benchmark 上综合表现优于同规模的 HRM-Text 1B,证明了 HRM 架构配合许可后训练数据可以在 1B 参数级别达到有竞争力的性能。在丹麦语任务上,模型实现了 新的 state of the art(SOTA),表明低资源语言可以从高质量、许可数据中获益。模型甚至能与 Qwen 3.5 4B 和 Gemma 4 E2B 等更大参数量的前沿模型竞争,说明在特定语言或多任务设置下,架构选择和数据质量控制可以弥补参数规模差距。
与基线的深度对比
与 HRM-Text 1B 相比,优势很可能来自训练数据的多样性和后训练策略的改进;但和 Qwen 3.5 4B、Gemma 4 E2B 相比,Mimir v1 的参数量仅为前者的 1/4 或更少,其接近或达到同等性能表明 HRM 架构在知识密度和推理效率上有独到之处。不过需要注意的是,图注中写的是 Qwen 3.5 2B,而摘要写 Qwen 3.5 4B,这可能指示基线的不同版本或论文内部不一致;读者在复现时需要确认具体基线配置。总体而言,这项工作证明:在严格的许可数据约束下,1B 级别的开放模型仍能具备工程实用价值,为数据合规要求严格的组织提供了可行的基座方案。
行业影响
落地场景
Mimir v1 的 1B 参数 + HRM 架构与仅使用 permissible post-training data 的特性,使其适配对数据合规性要求严苛的垂直场景。
- 医疗健康:丹麦语电子病历摘要生成与医患问答预筛,降低法律与伦理风险。
- 企业知识管理:小语种(如丹麦语)内部知识库检索与问答,模型可本地部署,保护敏感数据。
- 教育辅助:低资源语言的学习辅导与自动批改。
英语能力也可支撑边缘设备上的轻量级通用助手。
商业价值
主要杠杆来自降本与市场覆盖。
- 推理成本:1B 规模显著低于主流 7B/4B 模型,可大幅削减云端 API 开销或支持端侧推理,适合高并发客服场景。
- 差异化增收:丹麦语 SOTA 填补小语种高性能开源模型空白,为北欧市场产品提供稀缺能力。
- 合规溢价:全 permissible 数据训练规避版权与伦理争议,降低企业法务风险,适合政府、金融、医疗等强监管行业。
与现有工作流的接口
模型已发布在 Hugging Face Hub,并配备开源实现,集成路径清晰:
- 通过
transformers或vLLM加载权重,接入标准推理栈。 - 采用 LoRA/QLoRA 等参数高效微调适配特定任务,无需大量计算资源。
- 作为 RAG 管道中的生成器,搭配本地向量数据库(如
FAISS),构建低延迟、高隐私的问答系统。 - HRM 架构的推理逻辑与标准 Transformer 略有差异,需参考 GitHub 仓库进行适配,但官方提供完整训练与推理脚本。
具体落地 use case:
- 北欧电商客服:丹麦语在线商店可部署 Mimir v1 作为本地聊天机器人,处理订单查询与售后问题,响应延迟低且无需将客户数据发送至第三方 API,符合 GDPR 要求。
- 金融文档解析:银行或保险机构用其处理丹麦语合同、报表的自动摘要与实体抽取,permissible 训练数据确保合规。
局限
- - **模型容量受限**:仅 1B 参数,虽然在与 **Qwen 3.5 4B / Gemma 4 E2B** 的对比中展现出一定竞争力,但绝对性能仍明显落后于更大规模的前沿模型。论文自评仅在英语、丹麦语上全面评测,未覆盖其他语言;且完全依赖 permissible 后训练数据,可能限制了预训练阶段对大规模现实世界知识的吸收,在低资源语言、复杂多步推理等任务上泛化不足。
- - **数据覆盖与偏差**:训练混合 161 个 permissible 数据集,相比大规模网页抓取数据在领域广度、时效性和噪声多样性上有差距。论文未系统对比使用非 permissible 数据能获得的上限性能,也未详细分析数据去重、质量过滤对最终能力的贡献,因此难以量化“仅 permissible”策略的代价。代码 / 数学 / 多轮对话等依赖广泛事实知识的场景可能受数据偏见影响。
- - **评测与架构可扩展性**:基准集中在 20 个标准 benchmark,缺少长上下文推理、工具调用、安全对齐、真实产品场景等维度的评估。**HRM 架构** 相对标准 Transformer 的额外推理开销、训练稳定性、更大规模下的扩展规律尚未验证;模型在 Hugging Face Hub 上的许可合规性与实际可用性需社区进一步检验。