HRM-Text: 超越规模的高效预训练
当前大型语言模型的预训练范式依赖海量计算和互联网级原始文本,这给基础研究设置了极高门槛。相比之下,生物系统通过多时间尺度处理(如额顶叶回路的功能组织)展现出极高的样本效率。受此启发,我们提出 HRM-Text,用层次循环模型(HRM) 替代标准 Transformer,将计算解耦为慢演化的战略层和快演化的执行层。 为稳定用于语言建模的深度循环结构,我们引入 MagicNorm 和预热深度信用分配。此外,不同于基于原始文本的标准预训练,我们专门在指令-响应对上使用任务完成目标和 PrefixLM 掩码进行训练。作为高效预训练的经验性存在证明,一个从头训练的 1B 参数 HRM-Text 模型仅使用 400 亿独特 token 和 $1,500 预算,即在 MMLU 上达到 60.7%,ARC-C 81.9%,DROP 82.2%,GSM8K 84.5%,MATH 56.2%。 尽管使用的训练 token 数量约为标准基线的 1/100 至 1/900,估计计算量仅为 1/96 至 1/432,HRM-Text 仍与 2-7B 参数的开源模型性能相当。这些结果表明,协同设计架构与目标可以大幅降低计算-性能比率,使预训练从零开始对更广泛的研究社区变得可行。
论文精读
TL;DR HRM-Text 以分层递归替代 Transformer,仅用指令-响应对训练,以 $1,500 让 1B 模型性能媲美 2-7B 模型,实证了架构与目标协同的高效预训练。
问题
问题背景
当前大语言模型(LLM)的预训练范式高度依赖互联网规模的原始文本与巨额计算资源,这形成了显著的基础研究壁垒。业界关注的重心正从盲目追求参数规模转向计算效率,即如何在有限预算下获得有竞争力的性能。
现有方法局限
标准 Transformer 架构的自注意力机制计算复杂度随序列长度平方增长,数据利用效率低下,通常需要数万亿 token 的训练数据。尽管 Scaling Laws 提供了优化指导,但单纯扩展参数与数据量带来的算力需求呈指数级上升,使得从零开始进行架构探索变得不可行。多数高效架构尝试(如线性注意力、状态空间模型)在性能或训练稳定性上仍难匹敌大规模 Transformer。受生物启发的层次循环模型(HRM) 通过多时间尺度解耦计算,具有更高的样本效率潜力,但其深层循环结构面临严重的梯度爆炸/消失问题,导致语言建模训练极不稳定,此前难以实用化。此外,传统无监督下一词预测目标迫使模型从大量噪声文本中隐式提取知识,进一步拉低了数据效率。
问题的重要性和难度
实现极低算力预算下的稳定预训练,对于降低 AI 研究准入门槛、推动基础模型创新民主化至关重要。该问题的核心难点在于:深层循环网络通过时间反向传播(BPTT)时梯度的有效控制,以及如何在不依赖海量无标签数据的前提下,仅利用少量结构化数据习得通用能力。HRM-Text 引入了MagicNorm 归一化与warmup deep credit assignment 策略来稳定深层循环的训练,并改用指令-响应对进行任务完成目标(task-completion objective) 训练,从根本上重新定义了预训练的数据与目标范式。这项工作为资源受限的研究团队提供了从零训练性能可用的模型的存在性证明,有望带动新一轮架构-目标协同设计的研究。
行业类比
这类似于扩散模型从 DDPM 数百步采样到 LCM 几步推理的变革:通过算法与架构的深度协同,大幅降低了单位性能产出的计算开销,使高效生成触手可及。
核心洞察
- **架构与训练目标的联合设计是打破 scaling law 壁垒的实用路径。** 传统 LLM 仅依赖扩大模型与数据规模来提升性能,而 HRM-Text 通过引入层次化循环模型 (HRM) 解耦快慢时间尺度计算,并将预训练数据从海量原始文本替换为指令-响应对,在极低 token 量与算力下达到竞争性表现。这一联合优化思路表明,针对特定计算瓶颈协同设计模型结构与学习目标,比单纯追求更大的模型或更多的数据更能提高计算-性能比,为资源受限环境下的基础研究提供了新的范式。
- **深度循环架构的稳定训练技术 (MagicNorm 与 warmup deep credit assignment) 是释放循环模型语言建模潜力的关键。** 过去循环网络在长序列语言建模中常因梯度不稳定而难以扩展深度,Transformer 因此成为主流。HRM-Text 通过 MagicNorm 归一化策略与深度信用分配预热,使深层 BPTT 训练变得可行,从而让层次循环模型在语言任务上首次展现出与 Transformer 相当甚至更优的计算效率。这证明循环范式并非本质缺陷,而是缺少配套的稳定优化手段,为循环架构在语言等序列任务中的复兴提供了工程验证。
方法
HRM-Text 的方法设计围绕三个核心创新:用层级循环架构(HRM)替代 Transformer,引入MagicNorm 与梯度预热信用分配稳定深层循环训练,以及采用基于指令-响应对的 PrefixLM 任务完成目标。
输入:指令-响应数据与 PrefixLM 掩码
抛弃标准预训练中使用的海量原始网络文本,训练数据仅由 instruction-response pairs 组成。每个样本包含一个指令前缀和一个对应的回答。输入通过 PrefixLM masking 处理:指令部分作为不产生损失的上下文,模型仅在回答部分计算自回归交叉熵损失。这种方式强制模型在给定任务描述的条件下学习生成正确回答,实现任务完成目标(task-completion objective),而非无目的的下文预测。
关键模块:层级循环模型与训练稳定技巧
- HRM 架构:模型将计算解耦为两个时间尺度不同的循环层——慢速演化的战略层(strategic layer) 与 快速演化的执行层(execution layer)。战略层以较低频率更新,负责捕获长程语义与全局规划;执行层以较高频率更新,负责局部信息整合和逐 token 预测。两层级联模仿生物系统(如前顶叶环路)的多时间尺度处理,避免标准 Transformer 的平方级计算开销。
- MagicNorm:针对极深循环网络的梯度不稳定问题设计的新型归一化机制。其细节未在摘要中展开,但根据命名及上下文,很可能结合了层归一化与循环特异性约束,以在长序列反向传播时维持激活和梯度的合理尺度。
- Warmup deep credit assignment:一种训练调度策略,用于应对深层循环中信用分配困难。做法可能是:训练初期从较短的序列或较小的循环展开步数开始,然后逐步增加传播深度(warmup),使优化器能逐步适应深层依赖,避免早期梯度爆炸或消失,从而提高最终训练稳定性。
输出:极低算力下的竞争性模型
经过上述设计,一个仅 1B 参数的 HRM-Text 模型,在 40B unique tokens、约 $1500 的训练预算下,即可达到 MMLU 60.7%、ARC-C 81.9%、GSM8K 84.5% 等指标,与 2~7B 参数量的开放模型竞争。这主要得益于架构与目标的协同优化,将算力-性能比提升数百倍。
与同类方法的差异
与主流 Transformer + 大规模原始文本预训练的路线不同,HRM-Text 在架构层用循环替代自注意力以降低每一 token 的计算,在数据层面用高质量指令对替代无结构语料以提升学习密度,并通过专用稳定技术使深层循环得以高效训练。这种架构与训练目标的联合设计从根本上改变了算力扩展范式,使从零开始的预训练大幅降低门槛。
实验
实验设计
- 模型架构:1B 参数 HRM-Text,用 Hierarchical Recurrent Model 替代标准 Transformer,通过慢更新策略层与快更新执行层解耦计算。
- 训练数据与目标:完全使用 instruction-response pairs,采用 task-completion objective 和 PrefixLM masking,而非传统原始文本预训练。
- 稳定化技术:引入 MagicNorm 与 warmup deep credit assignment 解决深度循环训练的梯度不稳定问题。
- 计算成本:从零训练仅需 40B unique tokens,总花费约 $1,500。
关键发现
- 极低数据与算力需求:相比于标准预训练,训练 token 减少 100-900 倍,估算算力降低 96-432 倍,但 1B 模型在知识密集型任务上仍具竞争力。
- 性能对标更大模型:仅 40B tokens 训练,在 MMLU (60.7%)、GSM8K (84.5%)、MATH (56.2%) 等基准上,其表现已接近或超过部分 2-7B 开源模型。
- 架构-目标协同设计有效性:循环结构配合任务完成式目标,表明 解耦知识与推理 的可行性,深度分析显示模型的有效深度远超物理层数。
基线对比解读
与典型 Transformer 预训练方案相比,HRM-Text 并未追求绝对性能最优,而是以 数量级降低的成本 达到相近效果。这种反差源于:
- 训练范式转变:从海量无结构文本中隐式学习,转为直接对指令-响应的显式任务建模,大幅提升样本效率。
- 架构适配:分层循环模型天然适合处理多步推理,配合 PrefixLM 掩码可高效吸收监督信号。
- 工程启示:当算力不再是预训练准入门槛时,更多团队可基于此路线进行 低成本架构探索与快速实验迭代,推动语言模型研究民主化。
行业影响
落地场景
HRM-Text 将预训练成本压缩到 $1500 量级,使资源受限的团队也能从头构建专用语言模型。
- 垂直领域定制:医疗、法律、金融等行业可用少量专业指令数据训练基座模型,避免依赖通用大模型的二次微调,数据隐私更易控制。
- 边缘与轻量应用:1B 参数规模与低推理成本适合在终端设备、客服机器人等场景部署,实现离线、低延迟交互。
- 敏捷原型验证:初创公司或学术实验室可快速实验新架构或训练目标,降低试错门槛。
商业价值
- 降本:训练计算量比同等性能模型减少 96-432 倍,仅需数块消费级 GPU 即可完成,大幅降低基建与能源支出。
- 增收:差异化模型成为产品护城河,例如企业可针对内部 SOP 快速训练专属指令模型,提供自动化增值服务。
- 体验提升:全程在指令-响应对上训练,模型天然擅长任务执行,减少了 RLHF 等后训练成本,产出更精准、可控的回复。
与现有产品 / 工作流的接口
- 架构兼容:模型使用 PrefixLM 目标,可适配主流推理引擎(如 vLLM、TensorRT-LLM),无需重新开发服务框架。
- 数据流水线:只需指令-响应对,可复用现有数据生成工具(Self-Instruct 等),并与 Hugging Face 生态无缝对接。
- 微调与部署:可作为下游基座,结合 LoRA 等参数高效方法快速适配新领域;轻量级结构便于容器化部署和弹性伸缩。
具体落地 Use Case
- 医疗问诊辅助:医院利用内部脱敏问诊数据(“患者主诉-医生建议”对),用 HRM-Text 在院内 GPU 集群上从零训练医学问答模型。模型可嵌入 EMR 系统,实时生成鉴别诊断或检查建议,降低医生文书负担,同时满足数据本地化合规要求。
- 电商智能客服:电商平台提取历史对话记录,构造“用户问题-客服回复”指令数据,低成本训练 HRM-Text 客服模型。该模型可部署在边缘节点,自动处理退换货咨询、订单查询等高频场景,通过持续微调快速适应促销政策变化,减少 70% 以上人工坐席请求。
局限
- **数据依赖性**:模型完全在 instruction-response pairs 上训练,未使用开放域原始文本,因此可能缺乏广泛的世界知识和常识推理能力。这种数据构建方式虽然提升了指令遵循效率,但弱化了模型的通用性,对于需要背景知识或开放域对话的场景可能表现不佳。此外,高质量 instruction 数据的获取和清洗成本较高,限制了方法的可扩展性和跨领域迁移潜力。
- **架构稳定性与扩展性验证不足**:深层循环的稳定训练依赖于 MagicNorm 和 warmup deep credit assignment 这两个特定技巧,但它们的有效性可能局限于 HRM 架构,尚未在其他循环模型中验证。同时,深层展开在推理时的计算效率和内存占用问题未进行详细分析,且所有实验仅在 1B 参数规模进行,无法判断该方法在更大模型(如 7B+)下是否仍能保持数量级的效率优势,以及是否会出现新的优化难题。
- **评估范围有限**:尽管在 MMLU、ARC-C、DROP、GSM8K、MATH 等基准上取得了与 2-7B 模型可比的结果,但评估维度较窄,缺乏长文本理解、多语言、代码、安全性等关键能力的测试。此外,训练数据和部分实现细节未公开,使得复现和公平比较变得困难,削弱了结果的可信度和对社区的直接借鉴价值。