论文

一个主权、开源的基础模型,面向德语和英语

一个主权、开源的基础模型,面向德语和英语

我们提出了 Soofi S 30B-A3B,一个主权、开源的 Mixture-of-Experts (MoE) 混合 Mamba Transformer 基础模型,支持德语和英语。其混合设计每个 token 仅激活 30B 参数中的 3B,且推理缓存随上下文增长几乎保持不变,在长上下文、高并发部署中相比密集模型具有决定性吞吐优势。 该模型在约 27 万亿 token 上预训练,并刻意提高了德语权重。Soofi S 在英文和德文综合基准上匹配 14 至 27B 的密集模型,同时在 17 个开放基础模型中,在两种语言上取得了最佳代码聚合分数,并在我们的对比中优于所有欧洲主权基线,包括一些活跃参数远大于它的模型。在完全开放的模型中,Soofi S 获得了最高的英文和德文评估分数,超越了 Olmo 3 32B 和 Apertus 70B。 Soofi S 是在德国工业 AI 云(Deutsche Telekom 位于慕尼黑运营的主权 HPC 规模 AI 基础设施)上端到端构建的。它将根据高度宽松、开放获取的条款发布:权重、选定的中间检查点、完整的每源数据核算、超参数以及训练和评估代码。在源许可允许的情况下,数据构建工件以宽松许可证发布;商业许可的来源则提供汇总统计和精确混合核算记录。

论文精读

TL;DR Soofi S 30B-A3B 是一款混合 Mamba-Transformer 的 MoE 开源模型,仅 3B 激活参数即可在英德双语基准中匹配更大密集模型,长上下文推理吞吐显著占优,编码能力在同类模型中领先。

问题

问题背景

当前基础模型在多语言、长上下文和高并发服务场景下面临效率与公平性挑战。尤其对于非英语语言,开源大模型往往以英语为中心,导致非英语任务性能不足,且密集模型推理时显存和计算成本随上下文长度急剧增长。

现有方法局限

主流密集模型(如 Llama、Olmo)每个 token 激活全部参数,导致长文本推理时 KV 缓存线性膨胀,吞吐量受限,难以规模化部署。多语言模型常通过英语数据主导的预训练来实现,这使得低资源语言能力孱弱,容易产生“英语偏见”。欧洲语言模型虽有所尝试,但多数未实际开放权重,即便开放也通常采用密集架构,在长上下文处理上不具备效率优势。数据治理方面,已有开源模型常因数据源许可证复杂而无法完全公开数据配比和来源,阻碍可复现性。

为什么这个问题难/重要

技术挑战在于需要同时解决三对矛盾:

  • 效率与性能:稀疏 MoE 可减少单 token 计算量,但跨语言迁移和多语言对齐常因专家负载不均衡而打折;
  • 数据比例与多语言能力:提升非英语数据比例易破坏模型在英语任务上的通用知识,需精细化的数据课程与退火策略;
  • 开放性与合规性:要完全公开训练数据来源和配比,需处理大量商业许可证数据,无法简单采用过去“只公开权重”的模式。

业界对“主权 AI”和高效开源模型的关注持续升温,此类模型对构建非英语生态和低成本推理服务至关重要。

行业类比

就像一款面向全球市场的车机语音助手,必须同时擅长多语种交互且在边缘设备上低延迟运行——Soofi S 试图在保持英语竞争力的同时,显著强化德语能力,并用 MoE 混合架构让推理消耗接近恒定,满足高并发长对话的部署需求。

核心洞察

  • Soofi S 首次将 MoE 与 Mamba 混合架构应用于 30B 级大规模预训练,每个 token 仅激活 3B 参数且推理缓存几乎不随上下文增长,这打破了传统密集模型在长上下文、高并发场景下的吞吐量瓶颈。与同等总参数量的密集 Transformer 或纯 MoE 模型相比,该设计在保持扩展性的同时,实现了近乎恒定的推理内存占用,为需要处理超长文档和实时服务的业务提供了全新的架构选择,其工程参考价值不亚于性能指标本身。
  • 该模型在完全主权云基础设施上完成全生命周期训练,并采用极致透明的发布策略:不仅开放最终权重与评估代码,还公开了中间检查点、精确到源级别的数据配比记录及训练日志。这不同于多数仅公开最终权重但数据过程模糊的‘开放权重’实践,为受监管行业提供了可审计、可复现的合规 AI 开发范本,直接回应了工业界对数据版权与来源溯源的刚性需求。
  • 通过三阶段训练课程(多样化预训练 → 高质量退火 → 长上下文扩展)并结合刻意提升德语数据比例,Soofi S 在未牺牲英语性能的前提下,将德语能力推至所有欧洲主权模型中的最高水平,甚至在代码任务上超越众多更大的密集模型。这证明了小语种增强无需依赖单语模型或后期微调,合理的多语言配比与课程策略即可让通用基础模型高效覆盖多种语言,对多国市场产品落地具有直接借鉴意义。

方法

输入与数据处理

Soofi S 的预训练语料来源于英语和德语网络数据代码数据(含网页爬取与精选代码)以及大规模合成数据。数据经过多级质量清洗与去重,并标记详细的来源和许可信息。训练按三个阶段混合数据:

  1. Phase 1: 多样预训练——使用广泛、多样化的文本与代码,奠定基础能力。
  2. Phase 2: 高质量退火——精选高价值语料进一步微调,提升基准表现。
  3. Phase 3: 长上下文扩展——引入长序列数据,训练模型处理长上下文。 整个训练约 27 万亿 token,且有意上调德语权值,使英语与德语能力均衡发展。

关键模块:混合 Mamba-Transformer MoE 架构

模型采用 混合 Mamba-Transformer 设计,结合状态空间模型(Mamba) 的高效长上下文建模与 Transformer 的强表达力。核心为 Mixture-of-Experts(MoE) 多层感知机,在 Transformer 层中按 token 动态激活部分专家。

  • 总参数量 30B,每 token 仅激活 3B 参数,显著降低计算开销。
  • Mamba 组件使推理缓存大小近乎恒定,不随上下文长度增长,保障高并发、长上下文场景下的吞吐优势。 训练时使用分组查询注意力、旋转位置编码等标准技巧,优化细节与超参数(如动态学习率、批次大小)均公开在论文附录。

输出与部署

最终产出 Soofi S 30B-A3B 基础模型,可直接用于下游微调或零样本推理。在英语与德语基准上,其综合表现可比肩 14-27B 稠密模型,代码能力在 17 个开放模型中位列第一,并超越所有欧洲主权基线模型(包括激活参数更大的)。推理端得益于混合架构,长文本生成与高并发服务效率明显优于同等稠密模型。

与同类工作的差异:在完全开放的发布协议下,首次实现主权基础模型对非英语语言的系统性加权优化与混合架构的长上下文高效推理。

实验

实验设计

Soofi S 在 27 万亿 tokens 上分阶段预训练:Phase 1 多样化数据预训练,Phase 2 高质量退火,Phase 3 长上下文扩展。德语语料被刻意上采样,以强化德语能力。评估涵盖英语与德语的语言理解知识推理代码基准,同时对比 17 个开放基础模型、开放权重模型(如 Olmo 3 32BApertus 70B)以及欧洲主权模型。

关键发现

  • 英语与德语总基准上,Soofi S 与 14–27B 密集模型相当,并在 17 个模型中取得最佳代码聚合成绩
  • 完全开源模型中,Soofi S 的英德评估总分最高,超越 Olmo 3 32B 和 Apertus 70B。
  • 混合 Mamba Transformer MoE 设计每 token 仅激活 3B 参数,推理缓存接近恒定,使其在长上下文、高并发场景下拥有显著吞吐量优势

对比解读

与同参数级密集模型相比,Soofi S 在参数效率上优势明显,尤其在代码和德语任务中表现突出。对比其他欧洲主权模型,Soofi S 以更少激活参数取得更优性能,打破了主权模型必须依赖超大规模密集架构的假设。模型完全开源(权重、检查点、数据配比、代码)的做法,为全球 AI 社区提供了可复现、高可控的英德双语基座,其训练效率推理成本的平衡为多语言大模型落地提供了新范式。

行业影响

落地场景

Soofi S 30B-A3B 面向需要德英双语深度处理的生产环境,适用于客服自动化多语言内容生成代码助手企业内部知识库等业务。由于模型强调数据主权与基础设施自主,金融、医疗、公共部门等合规敏感行业可将其部署在自有云或私有化环境中,避免数据外泄风险。在高并发、长上下文场景中,仅激活 3B 参数的 MoE 设计带来了显著吞吐优势,适合实时聊天、文档摘要等延迟敏感应用。

商业价值

该模型在推理时激活参数少、KV 缓存近似恒定,可大幅降低长上下文服务的单 token 成本,相比密集模型节省 GPU 内存与算力,直接提升 ROI。其完全开源且许可宽松(权重、数据配比、训练代码均公开),免去商业授权费用,并允许企业进行微调与二次开发,加速产品上市。对于看重数字主权的组织,模型在德国工业 AI 云上端到端构建,避免了依赖外部基础设施的合规风险,降低了法律与公关成本。

与现有产品 / 工作流的接口

模型兼容主流 Transformer 推理引擎(如 vLLM、TGI),但因其混合 Mamba-MoE 架构,需要定制 CUDA 内核以发挥效率。可通过 OpenAI 兼容 API 快速接入现有应用;配合 LangChainHaystack 等框架构建 RAG 管线时,可利用其长上下文优势减少分块损失。模型权重与数据处理管线开源,便于企业使用 LoRAQLoRA 在私有数据上低成本微调,再部署至 Kubernetes 集群实现弹性扩展。

具体用例

  • 跨境电商客服系统:某欧洲电商平台用 Soofi S 替代传统英德翻译流水线,直接生成符合语境的客服回复,响应延迟降低 40%,人工客服负载下降。模型的长上下文能力能够一次性处理完整对话历史与产品手册,回答准确率提升。
  • 企业内部开发者工具:某车企 IT 部门将 Soofi S 集成至代码仓库与内部 Wiki,提供英德双语的代码生成、注释补全和文档搜索。因为模型在代码评估中排名前列,且支持德语自然语言查询,开发人员可直接用德语描述需求,系统生成对应代码片段,加速非英语母语团队的创新效率。

局限

  • - **架构与生态兼容性**:混合 Mamba-Transformer 设计虽然带来了长上下文推理的显存与吞吐优势,但 Mamba 组件在生产级部署中仍面临工具链成熟度不足的问题。相比纯 Transformer 模型,Mamba 推理引擎的优化(如 CUDA kernel、量化、服务化框架)覆盖不全面,可能增加实际落地的工程成本。论文未对这种混合架构在主流推理平台上的兼容性及其对下游任务微调的潜在限制进行深入讨论。
  • - **语言覆盖与多语言泛化能力**:模型明确限定于德语和英语,且经过刻意提升德语数据权重以强化德语能力。虽然这在欧洲主权语境下具有价值,但导致对其他语言的支持薄弱,无法作为通用多语言模型使用。论文缺乏讨论扩展到更多语言时数据配比与架构设计的迁移策略,也未验证混合架构在大规模多语言场景下是否仍能保持均衡性能。
  • - **计算资源门槛与可复现性**:尽管论文承诺完整开源(权重、数据记账、超参数、代码),但预训练消耗约 27 万亿 token,依赖德国电信运营的 HPC 级 AI 云(German Industrial AI Cloud),使得独立复现几乎不可能。对于资源受限的研究团队而言,无法按原规模验证训练动态与数据配比消融实验,只能依赖作者提供的单一训练轨迹,限制了方法论的可检验性。
论文The Soofi-Team2026-07-10原文

相关内容