美团发布原生多模态 LongCat-Next:当视觉和语音成为AI的母语
美团开源原生多模态模型 LongCat-Next,融合视觉与语音理解,面向物理世界 AI 应用。
美团开源了 LongCat-Next,一个原生多模态模型(同时处理文本、图像、语音),以及它的离散分词器。它尝试让 AI 像人一样自然融合视觉与语言,为构建能感知和理解真实世界的智能体打下基础。
正文摘录
引言 物理世界的信息由图像、声音、文字交织而成。今天的大模型,本质上仍然是 以语言为中心的建模系统 ,语言作为人类智慧符号化表述,在"压缩即智能"的范式下表现出强大的能力。但通往真正的物理世界智能,也许语言并不是世界的边界。视觉、语音与文本等多模态信号,实际上是对现实物理对象的不同侧面投影。 这就引出一个根本问题: 能否让 AI 像处理语言一样,用同一种方式简洁有效地处理物理世界的多种信息? 如果能,那么物理世界的 AI 就有了统一的"母语",Token 不再局限于文本,而是成为描述一切物理信号的原生表示。对这些信号进行统一建模与压缩,可能使模型学到更加本质的表示,并实现更深层的模态内化。 LongCat 团队经过研究发现:在统一的建模框架与优化目标下,可以构造一种 语义完备的离散表示 。我们将图像、语音与文本统一映射为同源的离散 Token,使模型从学习连续空间的映射,转向学习离散 ID 之间的关系结构,并通过纯粹的 下一个 Token 预测 (Next Token Prediction, NTP)范式,以一种统一的、优雅的方式建模各种物理信号。 LongCat-Next 是我们在通往物理世界 AI 道路上的一次探索。今天,我们把研究思路的核心——LongCat-Next 模型和它的离散分词器全部开源,希望更多开发者能基于它,构建真正能感知、理解并作用于真实世界的 AI。 我们如何构造物理世界的“母语”? 接下来,我们将逐一拆解三项核心技术,看看我们是如何让 AI 真正拥有物理世界的“母语”。 1.1 离散原生自回归架构 DiNA:简洁统一 业界主流的多模态大模型长期受制于“语言基座+外挂视觉/语音模块”的拼凑式架构,非语言模态往往只作为辅助组件存在。