南洋理工等发布 NEO-ov,原生多模态模型跳过视觉编码器
南洋理工团队提出无编码器的多模态架构,挑战传统视觉编码器+LLM范式,在空间理解等任务上超越强模型。
传统视觉语言模型先用编码器(如 CLIP)压缩图像再送入大模型,会丢失细节。NEO-ov 彻底扔掉编码器,让原始像素直接进入大语言模型,端到端学习视觉和语言。在细粒度感知和空间理解任务上,甚至超过依赖编码器的强模型。
正文摘录
.jpg)  刁海文现为南洋理工大学博士后研究员,主要从事原生多模态大模型、理解生成一体化及具身智能等方向研究,相关工作包括 EVE系列、NEO系列 与 DynamicVLA 等研究。其合作导师刘子纬为南洋理工大学计算机与数据科学学院副教授,长期聚焦于多模态学习、生成式人工智能及 3D 视觉等方向研究。本工作同时与商汤研究院、大连理工大学等机构合作完成。 当前多模态大模型都在图像「进门」前就被压缩了 今天几乎所有主流视觉语言模型(VLM)—— 无论是 Qwen-VL、InternVL,还是 LLaVA 系列 —— 都遵循着同一套经典架构:先用预训练视觉编码器(如 CLIP、SigLIP)将图像压缩为特征,再通过投影层把这些特征送入大语言模型。 这套「视觉编码器 + 投影层 + 大模型」的模块化范式非常成功,但也有一个天然前提:视觉信息在进入推理之前,就已经被压缩和过滤,一部分细节不可避免地丢失了。 NEO-ov 想挑战的正是这一假设: 如果直接抛开视觉编码器,让模型从原始像素一路学到语言,会怎么样? 答案是:不仅可行,而且效果出色。