论文

Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding P

Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding P

尽管多模态大语言模型(MLLMs)已取得显著进展,视觉理解与视觉生成通常被视为相互独立的目标。现有统一框架往往依赖离散视觉标记化或扩散目标,其生成目标与视觉理解模型所采用的连续表示不一致,因此难以直接迁移至现有预训练 MLLMs 以增强其能力。 为此,我们提出 GAS,一种生成引导的训练框架,将视觉生成重新诠释为辅助监督以促进表示学习。具体而言,GAS 采用解耦的 Mixture-of-Transformers(MoT)架构,并适配下一嵌入预测(NEP) 作为跨模态生成范式。通过共享低层主干并保持并行的上层结构,GAS 让生成损失以更精细的空间精度和更强的视觉保持力丰富共享视觉通路,同时避免生成梯度直接影响上层理解模块。为最大化协同效应,我们进一步构造了需要深层认知加工的高度相关生成任务,而非仅仅依赖通用合成。 跨模型规模与训练阶段,GAS 均能提升综合多模态理解能力,尤其在感知与空间理解方面增益最为稳定。关键的是,由于辅助生成分支在训练后被丢弃,这些增益不引入任何推理开销。大量受控对比与表示层面分析进一步阐明了生成引导训练何时以及为何有益于理解,并证明了生成引导训练作为增强多模态理解的一种实用路径的可行性。

论文精读

TL;DR GAS 将视觉生成作为辅助监督,通过 Next Embedding Prediction 与解耦 MoT 架构,在不增加推理开销的前提下增强 MLLM 的视觉理解,尤其提升感知与空间理解能力。

问题

问题背景: 当前多模态大模型(MLLMs)在视觉理解与生成任务上往往分别优化,但业界期待统一框架能同时增强两者,尤其希望生成能力反哺理解。

现有方法局限: 既有统一模型通常依赖 离散视觉 token 化 或 扩散目标。前者将连续图像特征量化为离散序列,导致细粒度视觉信息丢失;后者以去噪过程为生成目标,其输出空间与理解模型所需的连续表征不一致,难以直接迁移到现有预训练 MLLM。而且若在共享 Transformer 上直接施加生成损失,会向理解高层注入干扰梯度,损害语义抽取能力。因此,多数方案只能分立训练,生成信号无法辅助理解。

难点与重要性: 核心挑战在于:生成监督需提供 空间精度 与 视觉保持 等收益,同时不能污染理解分支。这要求架构级解耦与高相关任务设计。业界对多模态统一模型需求强烈,但对推理开销敏感,任何附加生成模块都会增加部署成本。能在训练期注入生成监督、推理期零额外开销,将显著降低统一框架落地门槛。

行业类比: 类似在自动驾驶视觉 backbone 训练中,将 未来帧预测 作为自监督辅助任务来提升 BEV 3D 检测精度,部署时仅保留检测网络。

核心洞察

  • Next Embedding Prediction (NEP) 将生成目标定义为连续视觉嵌入预测,而非离散 token 或 diffusion 去噪,从而直接对齐 MLLM 的连续表示空间。这避免了过去统一框架中因生成目标与理解表示异构而难以迁移到现有模型的障碍,让生成侧梯度能够直接强化预训练视觉编码器的特征质量,无需任何适配层或 tokenizer 重新训练。
  • 解耦 Mixture-of-Transformers (MoT) 架构允许生成损失只作用于共享底层视觉通路,而将理解专用上层与生成分支隔离,训练后直接丢弃生成分支。与常规联合训练或共享全部参数的方法不同,这种设计既实现零推理开销,又防止生成任务对高层语义表示造成干扰,让辅助监督的收益聚焦于底层感知与空间定位。
  • 论文通过构建需要深度认知 grounding 的生成任务(如空间关系合成)而非通用图像生成,验证了生成任务与理解目标的相关性决定了辅助监督的迁移效果。这比单纯增加生成数据或采用更强生成模型更本质,解释了过去生成辅助训练结论不一致的原因,为选择生成任务提供了实用准则。

方法

输入与整体流程

GAS 的输入包含 图像 与对应的 文本描述或任务指令。图像先通过共享视觉编码器(shared lower trunk)得到连续视觉嵌入序列,该嵌入同时输入理解路径和辅助生成路径。

关键模块:解耦 MoT 架构与 NEP

核心设计为 Next Embedding Prediction (NEP) 与 解耦 Mixture-of-Transformers (MoT) 架构:

  • 共享底层 trunk:视觉编码器,由理解损失和生成损失联合优化,促使视觉表征兼顾语义理解与空间细节。
  • 并行上层:理解上层执行多模态推理(如 VQA、定位);生成上层执行 NEP,预测下一视觉嵌入(而非离散 token 或扩散噪声)。
  • NEP 的目标为连续嵌入,与视觉理解模型内部表征直接对齐,梯度可自然反传至共享 trunk,无需额外适配层。
  • 解耦设计使生成梯度仅更新共享 trunk 和生成上层,屏蔽理解上层 直接接收生成损失,避免理解能力被生成目标干扰。

生成任务构造强调 高认知相关性,例如根据局部图像或文本指令预测后续视觉嵌入,要求模型理解空间关系与物体属性,而非低级的像素重构。

输出与推理阶段

训练完成后,生成分支整体丢弃,仅保留共享视觉编码器与理解上层。推理时输入图像,输出多模态理解结果(如答案、定位框),推理成本与原模型一致。

与离散视觉 token 化或多模态扩散等同类统一框架相比,GAS 的差异点在于:生成目标使用与理解模型一致的连续表示,并通过解耦 MoT 实现辅助监督,无需改变现有 MLLM 的表示空间或增加推理开销。

实验

实验设计

论文未在摘要中披露具体数据集与指标数值,但明确实验覆盖 多种模型规模 与 多个训练阶段,包含大量受控对照与表征层分析。核心验证点包括:生成监督迁移的条件、任务相关性对理解增益的影响、层级监督注入位置、以及视觉信息保留程度的诊断(线性 probing、注意力可视化)。此外,论文与 重建目标 做了对齐比较,并检验了文本推理能力的轻微提升。

关键发现

  • GAS 在感知与空间理解任务上提升最稳定,聚合多模态理解能力整体改善。
  • 生成分支仅在训练时存在,推理时丢弃,因此 零推理开销 这一优势被反复强调。
  • 高度相关的生成任务(需深层认知 grounding)比通用合成更能促进共享视觉通路的空间精度与视觉保留。
  • 表征层诊断显示,生成损失主要增强 shared lower trunk 的表示质量,而上层理解层被隔离,避免梯度干扰。

与基线对比深度解读

与依赖离散 tokenization 或 diffusion objective 的既有 unified 框架相比,GAS 的 解耦 Mixture-of-Transformers(MoT) 架构选择连续 embedding 预测作为生成目标,更贴近视觉理解模型的表征空间。基线方法往往让生成目标直接作用于整个网络,导致理解分支被生成梯度污染。GAS 通过共享 lower trunk + 并行 upper layers 的设计,只让生成损失塑造视觉通路,同时保护上层理解模块,因此能将生成训练收益无损迁移到已有预训练 MLLM,且无需任何推理期结构保留。这一「生成即辅助监督」的范式,为后续在现有 MLLM 上低成本注入生成能力提供了清晰的工程路径。

行业影响

落地场景

GAS 零推理开销 的特性使之特别适合已部署 MLLM 的在线服务:视觉问答、图像描述、文档解析、商品属性识别、内容审核、医学影像报告生成 等。由于生成分支仅在训练阶段存在,推理时模型结构与原 MLLM 完全一致,可在不增加任何延迟或显存的前提下提升视觉理解。

商业价值

  • 降本:训练后模型推理成本不变,无需升级推理硬件或增加推理算力;辅助生成分支不进入部署包。
  • 体验提升:感知与空间理解更可靠,减少视觉幻觉和定位错误,直接改善用户在高精度视觉任务中的信任度。
  • 数据效率:可利用大规模生成式数据或合成生成任务作为辅助监督,降低对昂贵人工标注的依赖,缩短模型迭代周期。

与现有产品/工作流的接口

GAS 采用 解耦 MoT 架构:保留底层共享视觉主干,上层并行理解与生成分支。训练完成后丢弃生成分支,导出模型与现有推理栈、模型序列化格式、服务框架完全兼容。可作为一个 插件式训练模块,接入现有预训练或 SFT 流程,无需修改推理代码或部署流水线。

具体 use case

  1. 电商商品属性与空间问答:商品详情页的视觉问答中,用户常问“鞋带在鞋的哪个位置”或“这个包有几个隔层”。GAS 增强空间定位与感知细节,降低错误率,同时零推理开销适合高并发在线服务。
  2. 内容平台自动审核与场景描述:对 UGC 图像或视频帧进行违规内容定位或细粒度描述时,GAS 提升感知精度与空间推理能力,可减少人工复核量,且训练后的模型可直接替换现有推理服务,无需改造上下游。

局限

  • - **训练数据与任务构造依赖性强**:GAS 需要构建“高度相关的生成任务”才能有效迁移,这要求额外的数据标注或合成 pipeline,尤其对非空间类任务(如 OCR、逻辑推理)构造同等深度的生成监督难度较高。论文承认最可靠提升集中在**感知与空间理解**,说明方法未必能普惠所有多模态理解维度。
  • - **训练开销高于常规微调**:虽然推理时丢弃生成分支实现零开销,但训练阶段需维护并行生成层和解耦 MoT 结构,显存与计算量显著增加。此外,生成损失对共享 trunk 的梯度影响可能与其他理解任务产生冲突,需要更细致的损失平衡与学习率调度,超参敏感性未被充分讨论。
  • - **与统一生成-理解模型缺乏直接对比**:GAS 的定位是“辅助监督”而非统一多模态模型,因此无法直接输出图像。在与 Emu、Chameleon 等同时具备生成能力的 MLLM 对比时,论文未提供同等规模下的端到端理解性能对比,难以判断辅助监督路线相对于联合训练是否更具效率或效果。
论文Zhongbin Guo2026-08-12原文

相关内容