行业新闻

NTU 论文:视觉理解与生成能否相互促进,从表征、任务到系统分层验证

这篇论文用受控实验回答了统一多模态模型的一个基础问题:理解与生成不是天然互相促进,共享路径会冲突,任务知识重合才有增益,并给出任务解耦的架构方案。

统一多模态模型(UMM)想把视觉理解和图像生成放进同一个模型,但两者放进同一套参数后到底会不会互相帮忙,此前没有一致答案。南洋理工大学 MMLab 的论文在原生 pixel in、pixel out 架构下,把这一问题拆成表征、任务、系统三层做受控实验:表征层两者都能给对方提供有用的学习信号,但硬共享计算路径会让一方主导;只有依赖同一底层知识的理解与生成任务才真正互相促进。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/b0e95560-1cc0-427f-bba3-43e89431807a/017(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsg&tp=webp&wxfrom=5&wxlazy=1imgIndex=0) 理解生成统一模型(Unified Multimodal Models, UMMs)正在成为多模态模型的重要发展方向。相比传统的理解模型 + 生成模型,UMM 希望在同一个模型中同时完成视觉理解和图像生成,让文本和图像能够在统一上下文中被理解、推理和生成。 但这里其实存在一个更基础的问题: 当视觉理解和生成被放进同一个模型之后,它们真的会互相帮助吗? 现有工作对此并没有给出一致答案。一方面,理解和生成可能共享视觉知识,从而形成正向迁移;另一方面,两种目标也可能竞争模型容量、产生表示冲突,最终只是功能上统一,却没有真正形成学习上的协同。 MMLab@南洋理工大学的最新论文《Uncovering Understanding–Generation Synergy in Native Unified Multimodal Models: From Representation, Task to System》,尝试在一个受控的原生多模场景下回答这一问题。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-14原文

相关内容