行业新闻

上海 AI Lab 与上交大提出 Next Concept Prediction 预训练任务,Token 消耗减半追平 OLMo-3-7B

这篇论文把语言模型的预测单位从“下一个 Token”上移到“下一个概念”,在万亿级语料上实测省一半 Token 达到同样损失,并开源了全部权重和 checkpoint,值得关注预训练效率的人细看。

上海人工智能实验室与上海交大团队提出 NCP(Next Concept Prediction,下一个概念预测),把预测目标从单个 Token 移到隐空间的离散概念上。在 5.73T 语料的 8.9B 模型预训练中,只用了 51.3% 的 Token 预算就追平 OLMo-3-7B 的最终 Loss,等效收敛快 1.95 倍。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/350d0397-425e-4b47-9528-e961ccbbec38/070(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 自现代大模型诞生以来,“下一个 Token 预测(Next-Token Prediction, NTP)”就被奉为不可撼动的黄金律条。然而,逼着模型逐字死记硬背,真能学会宏观语义规划吗? 近日,arXiv 上悄然挂出了一篇 来自上海人工智能实验室与上海交通大学人工智能学院 LUMIA Lab 团队联 合撰写的技术报告——《NCP-ArchPreview Tech Report》。没有什么铺天盖地的宣发,这篇论文却在短短几天内自发引爆了开源与极客社区: 一举登顶 HuggingFace Daily Papers 榜首 ,HuggingPapers 官方及海外多位知名科技博主纷纷转发剖析;海外科技评论人 VISION IA 更是在 X 上给出了极高评价:“这篇论文很可能构成了未来 AI 的第一块基石(might constitute the first brick of the future of AI...)”。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-21原文

相关内容