南京大学提出连续扩散语言模型 AURORA-LM,基于昇腾算力
这篇报道介绍了南京大学等机构提出的 AURORA-LM,一种在连续空间生成语言的扩散模型,并在昇腾 NPU 上完成规模化训练。
语言生成通常按 token 逐个预测,而 AURORA-LM 尝试在连续语义空间里直接建模语言。它先用自编码器把文本变成连续向量,再用分块因果扩散模型生成这些向量,最终映射回文字。实验在昇腾 NPU 上完成,并扩展到约 10 亿参数,验证了国产算力训练这类模型的可行性。
正文摘录
.jpg)  最近,何恺明老师团队提出 ELF(Embedded Language Flows),在连续语义空间中建模语言模型,在文本生成类任务上取得了相当优秀的结果。这使得连续扩散语言模型成为了讨论焦点: 语言能否像其他连续模态一样,在连续空间里完成生成? 近日来自 南京大学模式识别实验室(PRLab)的梁嘉骏、廖宇程,在司晨阳教授的指导下,联合新加坡南洋理工大学、英国帝国理工学院 ,提出 连续扩散语言模型 AURORA-LM (Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling),对连续空间下的语言建模作出了更多的思考和发现。AURORA-LM 的全部实验均在 昇腾 NPU 上完成,并进一步扩展至约 10 亿参数规模,验证了连续扩散语言模型在国产 AI 算力平台上的训练与扩展的可行性。