行业新闻

南洋理工等发布 NEO-ov,原生多模态模型跳过视觉编码器

南洋理工团队提出无编码器的多模态架构,挑战传统视觉编码器+LLM范式,在空间理解等任务上超越强模型。

传统视觉语言模型先用编码器(如 CLIP)压缩图像再送入大模型,会丢失细节。NEO-ov 彻底扔掉编码器,让原始像素直接进入大语言模型,端到端学习视觉和语言。在细粒度感知和空间理解任务上,甚至超过依赖编码器的强模型。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/2540409b-78fc-497e-9265-f8d4fa041506/055(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsg&tp=webp&wxfrom=5&wxlazy=1imgIndex=0) 刁海文现为南洋理工大学博士后研究员,主要从事原生多模态大模型、理解生成一体化及具身智能等方向研究,相关工作包括 EVE系列、NEO系列 与 DynamicVLA 等研究。其合作导师刘子纬为南洋理工大学计算机与数据科学学院副教授,长期聚焦于多模态学习、生成式人工智能及 3D 视觉等方向研究。本工作同时与商汤研究院、大连理工大学等机构合作完成。 当前多模态大模型都在图像「进门」前就被压缩了 今天几乎所有主流视觉语言模型(VLM)—— 无论是 Qwen-VL、InternVL,还是 LLaVA 系列 —— 都遵循着同一套经典架构:先用预训练视觉编码器(如 CLIP、SigLIP)将图像压缩为特征,再通过投影层把这些特征送入大语言模型。 这套「视觉编码器 + 投影层 + 大模型」的模块化范式非常成功,但也有一个天然前提:视觉信息在进入推理之前,就已经被压缩和过滤,一部分细节不可避免地丢失了。 NEO-ov 想挑战的正是这一假设: 如果直接抛开视觉编码器,让模型从原始像素一路学到语言,会怎么样? 答案是:不仅可行,而且效果出色。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-06-24原文

相关内容