Daedalus-150M: 为 CPU 推理设计的卷积注意力混合模型
小语言模型通常是照搬大模型的架构,再“压缩”到 CPU 上运行。我们反其道而行之:先锁定目标场景——单用户、单 token 推理、4-bit 权重量化、普通 CPU,再据此设计架构。Daedalus-150M 在 18 个 block 中仅 6 个保留全注意力,其余 12 个采用短卷积(short convolution),其记忆宽度只有 2 个时间步,不随对话长度增长。这意味三分之二的网络永远不会重复读取不断膨胀的 KV cache。 模型从头训练了 59.9B tokens,在五项任务基准上得分 47.31,对比预定的基线 42.20(该基线在训练前固定)。它击败了用 3–6 倍数据训练的 GPT-2 124M、Pythia-160M、OPT-125M 和 GPT-neo-125M,并超过 MobileLLM-125M 的公开成绩(尽管后者训练了 1T tokens)。验证集的 bits-per-byte 为 0.8685。 我们为检验架构而非训练配方,在相同数据上训练了同规模的常规全注意力模型,并在打分前预先写明获胜条件。结果显示混合模型在选定的质量指标上领先 0.81%,在下游任务上持平,4-bit 文件小 6.3%,在 2048 token 上下文下解码速度快 1.76x(同规模外部模型对比为 2.08x)。所有测量中,加速比在空上下文时接近 1.0,随长度增长而上升,符合机制预期,而非简单的“更精简”模型所能解释。带宽估算仅预测 1.17x,说明单纯内存体积不能说明差距。 我们也报告了失败经验:未缓解的 4-bit 质量损失、约一半卷积通道最终无效且难以移除、词表大于该模型规模所需。
论文精读
TL;DR Daedalus-150M 是专为 CPU 推理设计的混合模型:18 层中仅 6 层用注意力,其余用两时间步短卷积,缓存读取不随上下文增长;仅 59.9B token 训练就超过用 3-6 倍数据的同规模模型,长上下文 CPU 解码快 1.76 倍。
问题
问题背景:当前 small language models (SLMs) 在 CPU 推理场景中受到关注,目标是在有限内存与算力条件下提供可用的语言理解能力。
现有方法局限:主流做法是沿用大模型的标准 Transformer 架构,将模型缩小后通过量化等手段部署到 CPU。但全注意力机制导致 KV 缓存随上下文长度线性增长,在长对话或长文档场景中,CPU 内存带宽很快成为瓶颈,解码速度显著下降。此外,4-bit 量化常带来不可忽视的质量损失,且小模型词汇表过大进一步加剧内存压力。这些方法本质上是“先设计大模型再压缩”,没有针对 CPU 特性从头优化。
为什么难/重要:在 CPU 上实现高性能小模型需要同时平衡质量、速度、内存三项指标,且三者相互制约。注意力层的缓存增长无法通过单纯减少参数解决,因为内存访问量决定了解码延迟;而替换注意力会损害模型质量。业界对离线、低功耗、隐私敏感场景中的本地推理需求持续上升,推动了对新型轻量架构的探索。该问题涉及架构设计、训练策略、量化方案等多个维度,需要系统性创新。
行业类比:类似移动端语音助手需要在不联网的情况下快速响应长对话,必须在保持理解能力的同时严格控制内存占用与解码延迟。
核心洞察
- 设计哲学反转:从CPU推理目标出发,逆向选择架构,而非先建大模型再压缩。传统小模型沿用大模型的全注意力Transformer结构,训练后再通过量化、剪枝等方法适配CPU,但Daedalus-150M直接以“单用户、单token、4-bit权重、普通CPU”为约束设计混合架构,仅在18个块中的6个保留全注意力,其余12个使用短卷积。这种“目标先行”的专用化设计避免了通用架构的冗余,与MobileLLM等虽然优化但本质仍全注意力的路线形成本质差异。
- 短卷积的恒定记忆宽度带来超越内存带宽节省的加速。12个卷积块的记忆仅两个时间步宽,不随上下文长度增长,因此三分之二的网络无需读取不断增大的KV cache。实验显示在2048 token上下文解码快1.76倍,而纯带宽计算预测仅1.17倍,说明加速不仅来自内存访问量减少,可能涉及更优的访存模式或计算特性。这种机制与单纯减少参数或使用更小模型不同,证明了架构级改变对CPU推理的独特价值,为长上下文场景提供了新的效率路径。
方法
输入
模型接收 token 序列,经嵌入层转换为向量表示。
关键模块
Daedalus-150M 采用 18 层混合架构:其中 6 层为完整自注意力(full attention),负责建模全局依赖;其余 12 层为短卷积块(short-convolution block),每层仅保留两个时间步的缓存,与序列总长度无关,因此这些层从不重新读取随对话增长的 KV 缓存。这种设计使 2/3 的层在解码时的内存访问量恒定。
训练与量化
模型从头训练 59.9B tokens,使用标准语言建模损失(交叉熵)。训练后权重量化到 4-bit。作者报告量化感知训练未能成功运行,且约一半卷积通道在训练后表现为惰性且无法移除。
输出
模型输出下一个 token 的概率分布,用于自回归生成。
与同类方法的差异
不同于先训练大模型再压缩到 CPU、或单纯减少参数量的做法,Daedalus 从目标硬件约束(普通 CPU、单用户逐 token 解码、4-bit 权重)出发反向定制架构,用短卷积部分替代注意力,使长上下文解码时的速度提升(1.76×)显著超过带宽计算预测的 1.17×,表明内存访问模式而非参数量是主要瓶颈。
实验
实验设计
作者先固定推理场景:单用户单 token 解码、4-bit 权重、普通 CPU,再反推架构。模型共 18 个 block,其中 6 个保留全注意力,其余 12 个使用短卷积(状态宽度恒为 2 个 timestep,不随上下文增长)。从头训练 59.9B tokens;并训练同尺寸全注意力模型作为对照,且预先设定胜出条件。
关键发现
- 5-task benchmark score 达到 47.31,超过预设 bar 42.20;打败 GPT-2 124M、Pythia-160M、OPT-125M 等(这些模型训练数据为 3–6 倍)。
- Validation bits-per-byte 为 0.8685。
- 与同尺寸全注意力模型相比:质量指标胜出 0.81%,下游任务打平,4-bit 文件小 6.3%,2048 上下文解码速度 1.76x(对外部模型 2.08x)。
- 速度优势在空上下文时接近零,随长度增长;带宽计算仅预测 1.17x,说明并非单纯内存体积减少所致。
对比解读与工程启示
混合模型以更少缓存和更快解码达到同等或更好质量,证明架构选择可替代单纯压缩。与 MobileLLM-125M 相比,后者训练数据达万亿 tokens,但本文模型仍超过其已发布分数,凸显卷积-注意力混合在小模型 CPU 推理中的效率优势。负面结果(4-bit 未量化训练时质量代价、半数卷积通道惰性、词汇表过大)为后续优化提供明确方向:需量化感知训练、通道剪枝探索和词表缩减。
行业影响
落地场景
Daedalus-150M 面向纯 CPU 推理环境,适合部署在边缘设备、低成本服务器、私有化环境。典型产品包括:
- 本地智能客服:在普通 CPU 机器上运行对话系统,无需 GPU 集群,适合电商售后、企业 IT 支持等场景。
- 离线教育助手:学生或教师在无网络或性能受限设备上使用语言模型辅助学习、批改作业或生成习题,模型规模小、内存占用低。
- 内容审核与分类:短视频或 UGC 平台在边缘节点快速过滤低质内容,避免全量上传云端,降低带宽与延迟。
- 物联网设备:如智能音箱、车载助手,小模型可直接驻留设备端,响应延迟低且不上传用户语音,满足隐私合规要求。
商业价值
核心收益来自推理成本下降与用户体验提升:
- 降本:4-bit 权重使模型体积缩小约 6.3%,且无需 GPU 即可运行,硬件成本显著低于同尺寸密集模型。在 2048 token 上下文下解码速度提升 1.76 倍,且随上下文加长优势扩大,对长会话场景(客服、文档问答)尤其有效。
- 增收:边缘部署可覆盖原本因延迟或隐私无法使用云大模型的客户,例如医疗问诊摘要的本地处理、金融文档脱敏分析等,扩大可服务市场。
- 体验提升:短卷积层缓存固定为 2 个时间步,内存不随对话长度线性增长,长上下文场景下不会因 KV cache 膨胀拖慢响应,用户感知更流畅。
与现有产品/工作流的接口
Daedalus-150M 可直接接入主流推理框架:
- 模型权重与 tokenizer 已发布在 Hugging Face(daedalus-150m-instruct),可通过
transformers加载,或转换为 ONNX Runtime、llama.cpp 格式运行在纯 CPU 环境。 - 代码开源在 GitHub,包含训练与评测脚本,企业可微调适配垂直领域数据。
- 在现有 RAG 流水线中,可作为本地检索后生成器替换大模型 API,与向量数据库配合;或作为云端大模型的前置过滤/路由层,先本地处理简单请求,复杂请求再转发云端,平衡成本与质量。
局限
- 论文自认的局限包括:训练数据混合物在训练过程中偏离初始目标,最后 8% 的训练使用了略小的语料库,且量化感知训练未执行,导致 4-bit 权重下的质量损失未得到缓解;词汇表大小对于 150M 参数模型过大,浪费 embedding 参数和计算;仅使用单一随机种子,且仅训练英语语料,泛化性存疑。这些因素可能影响结果稳定性和跨语言能力,尤其词汇表过大与 CPU 高效目标存在张力。
- 可推断的局限:卷积通道中约一半惰性且无法移除,说明混合架构存在参数冗余,限制了进一步压缩的潜力;实验规模仅 150M 参数,未验证该方法在更大模型上的可扩展性;此外,仅与全注意力模型对比,缺少与 Mamba、RWKV 等近期高效序列模型的直接比较,无法全面定位其相对优势。
- 与同类工作对比的弱点:该工作主要针对 CPU 推理优化,未提供 GPU 或其他硬件上的性能数据,适用范围受限;4-bit 量化质量损失未有效缓解,可能影响实际部署中的模型精度;解码速度优势依赖上下文长度,短上下文下优势不明显,对于短查询场景收益有限。