论文

NCP-ArchPreview 技术报告:通过下一概念预测迈向潜在空间语言模型

NCP-ArchPreview 技术报告:通过下一概念预测迈向潜在空间语言模型

NCP-ArchPreview 是一种潜在空间语言模型,将自回归预训练从标准的 next-token prediction(NTP)推得更远。除 NTP 外,模型还通过 Next Concept Prediction(NCP)学习预测跨越多个 token 的离散概念,在保留标准 token 级自回归生成的同时,引入了显式且更具挑战性的概念级目标。 方法上,该模型直接从隐藏状态构建 product-quantized concept vocabulary 以形成潜在空间,再经专用的 Concept Module 预测未来概念;预测结果被回传至 token 层级引导后续生成,NTP 与 NCP 端到端联合训练。作者将其扩展到 8.9B 参数,并在 Dolma-3 数据集的 5.73T token 上训练,是迄今规模最大的潜在空间语言模型演示。 实验显示:仅消耗 51.3% 的训练 token,NCP-ArchPreview 即达到 OLMo-3-7B 的最终预训练 loss;完整预训练后,其下游 macro-average 领先 2.45 分,其中 GSM8K 提升 5.99 分。受控实验分离出潜在架构与 NCP 目标各自的增益;仅用 85% 的标准计算量,它便能逼近严格参数对齐的 8.9B 基线。 预训练之后,学到的潜在空间仍有价值:只更新 17M 参数的 VQ 模块即可得到轻量的领域自适应接口;将概念表示注入 DFlash2 drafter,可在几乎无额外开销下把平均接受长度提升 4.17%。

论文精读

TL;DR NCP-ArchPreview 联合训练下一概念预测与标准 token 预测,仅用 51.3% 训练量追平 OLMo-3-7B,下游平均提升 2.45 分,验证了潜在空间语言模型的高效性。

问题

问题背景

当前大语言模型预训练以标准 Next Token Prediction (NTP) 为核心,目标是在海量文本上最小化 token 级交叉熵损失。随着模型规模和数据量持续攀升,预训练成本成为主要瓶颈,业界开始关注如何改进训练目标与架构,以提升样本效率与下游推理能力。

现有方法局限

标准 NTP 存在明显技术缺陷:

  • 缺乏显式概念建模:模型仅学习局部 token 条件概率,对跨多 token 的语义概念(如数学推理步骤、实体关系)没有直接监督,导致抽象能力需要大量数据才能涌现。
  • 长距离依赖弱:自回归生成过程中,高层规划信号无法有效回传,容易在长程生成中出现逻辑漂移。
  • 单一 loss 信号:仅依赖 token 级似然,无法区分“预测下一个 token”与“理解整体概念”,使得训练收益边际递减。

虽然已有 latent variable model、planning module 或 VQ-VAE 风格工作尝试引入潜在表示,但大多停留在中等规模(<1B)或小数据集验证,训练不稳定、额外开销大,且未能同时保持标准 token 级生成流畅度与概念级控制能力。

为什么这个问题难/重要

技术挑战集中在三点:

  1. 离散潜在空间的构建:如何从 hidden state 自动生成有意义的概念词汇(如通过 product quantization),且不丢失 token 级信息。
  2. 联合训练稳定性:NTP 与概念预测 loss 的权重平衡、梯度冲突,以及概念反馈回 token 层的机制设计,均需仔细调优。
  3. 规模化效率:在 8.9B 参数和 5.73T token 量级验证,要求架构本身引入的额外计算量必须可控,否则得不偿失。

业界关注度极高:预训练成本动辄数百万美元,若能以更少 token 达到同等或更优 loss,并提升 GSM8K 等推理 benchmark,将直接改变模型训练 ROI。同时,潜在空间若能在 post-training 阶段复用(如 lightweight domain adaptation 或 speculative decoding 加速),会进一步放大价值。

行业类比

类似视觉领域从像素级重建转向 representation learning(如 MAE、VQ-VAE),语言模型也需要从 token 级预测走向概念级表示学习,以更高效地利用数据并解锁新的 adaptation 与推理加速接口。

核心洞察

  • Next Concept Prediction 在标准 next-token prediction 之上引入离散概念级目标,迫使模型在更高层语义单元上进行序列建模,从而提升样本效率和下游表现。其独特之处在于概念词表直接从模型隐藏状态通过 product quantization 构建,不依赖外部知识或人工标签,且 NTP 与 NCP 端到端联合训练,使 token 级生成与概念级预测共享表示空间。与仅增加模型容量或引入额外 token 级辅助损失的方法相比,这一设计更直接地利用模型内部涌现的语义结构,在仅消耗 51.3% 训练 token 时即可达到 OLMo-3-7B 的最终 pretraining loss。
  • NCP-ArchPreview 的隐空间架构让概念模块成为轻量、可插拔的模型接口:仅 17M 参数的 VQ 模块即可实现领域适应,且将概念表示注入 DFlash2 drafter 可提升平均接受长度 4.17%。这表明隐空间不仅能提升预训练效率,还能在推理加速和低成本微调中复用。与典型依赖 token 级适配或独立投机解码模块的方法不同,该工作展示了同一隐空间表征可同时服务于训练目标、下游适配和推理优化,为工程实践提供了更统一、更低开销的路径。

方法

输入与总体流程

NCP-ArchPreview 接收标准 token 序列作为输入,采用 autoregressive 架构同时进行两类预测:next-token prediction (NTP) 与 next-concept prediction (NCP)。模型先由主 Transformer 编码 hidden states,再通过产品量化(product quantization)直接从这些 hidden states 构建离散概念词汇表,每个概念覆盖多个 token,形成 latent-space 表示。

关键模块

  1. Concept Vocabulary Construction: 使用 product quantization 对 hidden states 聚类,得到离散 concept ID。
  2. Concept Module: 一个独立模块,以前文概念序列为输入,预测未来概念。
  3. Concept-to-Token Feedback: 预测出的概念表示被反馈回 token 层,作为额外条件信号指导 token 生成。
  4. Joint Training: NTP 与 NCP 两个损失函数联合端到端优化,两者共享底层表示。

输出

最终输出仍为标准 token 级自回归文本,但生成过程受概念级规划约束。此外,latent space 可直接用于轻量级领域适配(仅更新 17M 参数的 VQ 模块)或提升 drafter 接受长度。

与同类 latent-space LM 的差异在于:NCP-ArchPreview 引入显式、跨 token 的离散概念预测目标,并在 8.9B 参数、5.73T tokens 规模上验证了其效果,为目前最大规模的 latent-space 语言模型演示。

实验

实验设计

NCP-ArchPreview 在 Dolma-3 数据集上以 5.73T tokens 进行预训练,模型规模为 8.9B 参数。采用 NTP + NCP 联合训练,并在训练过程中引入 product-quantized concept vocabulary 与 Concept Module。主要对比基线为 OLMo-3-7B 和参数对齐的 8.9B 基线。

关键发现

  • 预训练效率:仅消耗 51.3% 的训练 tokens,NCP-ArchPreview 即达到 OLMo-3-7B 的最终预训练损失。
  • 下游性能:完整预训练后,宏平均提升 2.45 点,其中 GSM8K 提升 5.99 点。
  • 计算效率:使用 85% 的标准计算,即可接近参数对齐 8.9B 基线的训练损失。
  • 轻量适配:仅更新 17M 参数 VQ 模块 即可实现域适应。
  • 推理加速:将概念表示注入 DFlash2 drafter,平均接受长度提升 4.17%。

基线对比解读

NCP-ArchPreview 相对 OLMo-3-7B 实现了显著的损失收敛加速,说明 NCP 目标 能有效利用跨 token 的概念结构,引导更高效的表示学习。与参数对齐的 8.9B 纯 NTP 基线 相比,在 85% 计算量 下接近其损失,验证了架构本身(而非单纯参数规模)带来的增益。此外,VQ 模块 的轻量更新与 drafter 注入 展示出潜在空间的迁移价值,为后续高效微调与推测解码提供了新接口。

行业影响

落地场景

NCP-ArchPreview 的 Next Concept Prediction 机制和轻量 VQ 模块 适合需要频繁域适配的 LLM 服务,如电商搜索、内容推荐、企业知识库问答。其 17M-parameter VQ module 可作为热插拔接口,在新品类或垂直领域上线时,仅更新概念码本即可吸收新知识,无需重训 8.9B 主干。

商业价值

  • 训练降本:仅用 51.3% 训练 tokens 达到 OLMo-3-7B 最终 loss,单次预训练可节省近一半数据成本;或相同数据下损失更低。
  • 推理加速:结合 DFlash2 drafter(mean accepted length 提升 4.17%),在投机解码链路中直接降低推理延迟与单位 token 成本。
  • 效果增益:下游平均 +2.45 点,GSM8K +5.99 点,对数学推理、代码生成等付费场景有明确体验提升。

接口集成

现有 transformer 栈可平滑扩展:在隐藏层后增加 Concept Module 与 product-quantized concept vocabulary,NTP 与 NCP 联合训练。推理时可保留标准 token 级生成,无需修改上层应用 API。域适应阶段只需替换/微调 VQ 码本,支持在线更新,可结合 vLLM 或 TensorRT-LLM 的热加载权重机制。例如:

  • 电商搜索:新品上架时,仅更新 VQ 模块,让 LLM 快速理解新类目语义,降低全量 fine-tune 成本。
  • 企业知识库助手:不同客户垂直领域通过独立 VQ 码本切换,实现一套主干多租户部署,减少 GPU 占用。

局限

  • 论文未提供详细的推理延迟分析,仅声称注入 drafter 有 negligible overhead。实际上,Concept Module 和 VQ 模块在自回归生成中引入额外前向计算,尤其长序列生成时,概念预测与 token 生成的交替可能增加分支开销。与标准稠密 LLM 相比,潜在空间模型往往需要更复杂的采样逻辑(如概念层与 token 层的协调),这可能影响实际部署效率。未来工作应提供与同规模稠密模型在相同硬件上的推理延迟与吞吐量对比。
  • 摘要仅报告了与 OLMo-3-7B 的对比,以及下游 macro-average 与 GSM8K 的增益,未涉及更广泛的基准(如 MMLU、HellaSwag、代码生成、多语言任务)。训练数据仅使用 Dolma-3,缺少对指令跟随、对话或特定领域迁移的系统评估。因此,该方法在通用性与鲁棒性上的优势尚未完全验证,特别是在概念预测带来的潜在偏差或对长尾概念覆盖不足的情况下。
  • product-quantized concept vocabulary 直接从隐藏状态构建,可能对初始隐藏分布和训练早期的稳定性敏感。论文未报告不同 codebook 大小、量化粒度或训练超参数对最终性能的影响,这可能导致复现困难。此外,实验固定在 8.9B 参数规模,未验证该架构在更小(如 1B)或更大(如 30B+)模型上的扩展规律,因此其对算力受限环境的适用性仍待考察。后续需要更系统的消融和 scaling law 分析。
论文NCP Team2026-09-09原文

相关内容