NTU 论文:视觉理解与生成能否相互促进,从表征、任务到系统分层验证
这篇论文用受控实验回答了统一多模态模型的一个基础问题:理解与生成不是天然互相促进,共享路径会冲突,任务知识重合才有增益,并给出任务解耦的架构方案。
统一多模态模型(UMM)想把视觉理解和图像生成放进同一个模型,但两者放进同一套参数后到底会不会互相帮忙,此前没有一致答案。南洋理工大学 MMLab 的论文在原生 pixel in、pixel out 架构下,把这一问题拆成表征、任务、系统三层做受控实验:表征层两者都能给对方提供有用的学习信号,但硬共享计算路径会让一方主导;只有依赖同一底层知识的理解与生成任务才真正互相促进。
正文摘录
.jpg)  理解生成统一模型(Unified Multimodal Models, UMMs)正在成为多模态模型的重要发展方向。相比传统的理解模型 + 生成模型,UMM 希望在同一个模型中同时完成视觉理解和图像生成,让文本和图像能够在统一上下文中被理解、推理和生成。 但这里其实存在一个更基础的问题: 当视觉理解和生成被放进同一个模型之后,它们真的会互相帮助吗? 现有工作对此并没有给出一致答案。一方面,理解和生成可能共享视觉知识,从而形成正向迁移;另一方面,两种目标也可能竞争模型容量、产生表示冲突,最终只是功能上统一,却没有真正形成学习上的协同。 MMLab@南洋理工大学的最新论文《Uncovering Understanding–Generation Synergy in Native Unified Multimodal Models: From Representation, Task to System》,尝试在一个受控的原生多模场景下回答这一问题。