FLAT: 将图像与文本重采样为 1D 柔性长度对齐的跨模态 token 以用于检索与生成
传统多模态表示学习 与生成被拆分为两个独立阶段:先训练对比学习或自监督视觉编码器,再单独训练下游生成模型。这种设置使生成性能受限于冻结的嵌入表示。 FLAT(Flexible-Length Aligned Transmodal representations) 是一个表示预训练框架,联合优化共享多模态编码器与下游 T2I / I2T 解码器。它结合对比对齐与双向跨模态生成目标,让表示同时充当判别式语义描述符与生成条件。架构上,FLAT 将视觉与文本输入映射到统一的连续 1D 序列空间,并对前缀 K 个 token 施加 nested dropout 以支持动态输出长度。 单阶段预训练后,FLAT 即可在可变前缀 K 下完成跨模态检索与生成,T2I GenEval 得分 71.1。任务特定微调后: - T2I 生成:GenEval 83.1 - 图像描述(MS-COCO):BLEU-4 40.5,CIDEr 138.6 - 检索 Recall@5:MS-COCO 86.8 (I2T) / 75.8 (T2I),Flickr30K 98.3 (I2T) / 93.6 (T2I) 定性评估进一步表明,FLAT 的表示天然支持线性插值、隐空间算术与零样本组合检索。
论文精读
TL;DR FLAT 联合优化多模态表示与文本-图像双向生成,输出可变长度对齐 token,使同一表征同时具备判别检索、生成条件与线性插值能力。
问题
问题背景
多模态表示学习正从单一对比对齐走向统一支持 检索 与 生成 的基础模型。
现有方法局限
传统两阶段流程先训练 对比或自监督视觉编码器(如 CLIP),再单独训练下游生成模型,编码器参数冻结。这带来三个具体限制:
- 生成梯度无法回传 至视觉编码器,生成性能受限于冻结嵌入中的信息瓶颈;
- 对比学习学到的 单位球面嵌入(如 L2 归一化后的 CLIP 特征)对线性插值和算术操作不友好,难以作为生成条件直接消费;
- 表示长度固定,无法根据任务计算预算动态调整前缀 token 数量。
为什么这个问题难/重要
联合优化判别与生成目标面临 训练不稳定 和 多任务权重平衡 难题;统一 1D 序列空间需要视觉与文本 tokenizer 输出同构,且保持跨模态对齐的同时支持双向生成。业界对单一预训练模型同时完成检索与生成有较高需求,因为可减少服务部署复杂度与推理延迟。FLAT 通过嵌套 dropout 与共享编码器缓解了上述矛盾,使一个 checkpoint 在 variable prefix K 下同时支持多任务。
行业类比
类似多模态搜索引擎或 AIGC 创作工具中,用一个模型同时返回相关图片和生成新图,无需分别维护检索库和生成模型,降低维护成本与一致性问题。
核心洞察
- FLAT 的核心洞察在于用单一联合训练框架同时优化对比对齐和双向生成目标,使表征本身直接被生成解码器消费,从而消除传统“先训练判别性编码器、再冻结用于生成”的两阶段信息瓶颈。与 DALL·E 系列依赖离散 token、或 CLIP 类模型仅提供全局语义向量不同,FLAT 在连续 1D 序列上施加嵌套 dropout,让同一表征在不同 prefix K 下动态截断,兼顾检索的判别力和生成的丰富条件,确保无微调时也能跨任务泛化。
- 嵌套 dropout 在 FLAT 中被重新用作动态长度控制机制,而非单纯正则化手段。与传统固定长度表征(如单向量 CLIP 或固定 16 个 token 的 VQGAN)相比,FLAT 允许从完整序列到任意短前缀的平滑退化,使模型在推理时可按需平衡计算成本与表达能力。这种设计不仅带来灵活的多模态检索与生成,还支撑了零样本 composed retrieval 和 latent arithmetic,因为不同长度的前缀共享同一语义流形,可进行连续插值与向量运算。
方法
输入与表征映射
FLAT 的输入为成对的图像与文本。视觉与文本编码器分别提取初始 token 序列,随后通过 共享多模态编码器 将这些异构 token 重采样并映射到统一的连续 1D 序列空间。这一映射使图文表示具有相同的维度与顺序结构,为后续统一处理提供基础。
关键模块与联合训练
- 对比对齐头:在共享表示上施加 CLIP 风格的对比损失,强制匹配的图文对在嵌入空间中彼此靠近,不匹配对相互远离,从而赋予表示判别性语义。
- 双向生成解码器:T2I 解码器从文本侧表示生成图像,I2T 解码器从图像侧表示生成文本。生成损失与对比损失共同反向传播到共享编码器,避免表示偏向单一任务。
- 嵌套 dropout 与 prefix-K:训练时对序列末尾的 K 个 token 施加 nested dropout,随机丢弃部分尾部 token,迫使模型学会利用任意前缀长度的表示进行生成与检索。推理时可通过截断 prefix 动态控制计算成本与性能。
输出与应用
预训练完成后,共享表示可直接用于:
- 跨模态检索(计算余弦相似度);
- 作为生成条件输入 T2I/I2T 解码器。
单一 checkpoint 即支持变长 K 的检索与生成任务,无需额外适配。
与同类方法的差异
相较于传统“先对比预训练、后冻结编码器接生成器微调”的两阶段范式,FLAT 从预训练初期就联合优化表征与生成目标,并将表示压缩为可变长的 1D 前缀,从根本上缓解了冻结嵌入对生成性能的瓶颈。
实验
实验设计
FLAT 采用单阶段联合预训练,将对比对齐与双向生成目标(T2I 和 I2T)结合,在同一共享多模态编码器上优化。预训练阶段直接评估跨模态检索与生成,利用嵌套 dropout 在 prefix-K 上动态调整输出长度,测试不同 K 下的泛化。随后进行任务特定微调,分别针对文本到图像生成、图像字幕和跨模态检索进行优化。
关键发现
- 预训练单一阶段即可实现 T2I GenEval 71.1,展示生成与判别共享表示的可行性。
- 微调后各项指标达到或接近 SOTA:T2I GenEval 83.1;MS-COCO 字幕 BLEU-4 40.5 / CIDEr 138.6;检索 Recall@5 在 MS-COCO 为 86.8 (I2T) / 75.8 (T2I),在 Flickr30K 为 98.3 (I2T) / 93.6 (T2I)。
- 定性结果显示 FLAT 表示支持线性插值、潜在空间算术和零样本组合检索,表明表示空间具有语义可操作性和连续几何结构。
与基线对比解读
摘要指出微调性能“与最先进基线对齐”,但未给出具体对比模型或数值差距。从方法设计看,传统两阶段流程中冻结视觉嵌入形成生成瓶颈,而 FLAT 通过联合优化编码器与解码器,生成的表示可直接作为生成条件,消除了瓶颈。这解释了为何能在预训练阶段就获得较好的生成性能,并在微调后达到与专用生成模型相当的水平。然而,缺乏逐项对比数据,难以量化相对优势,需查阅论文完整实验表。
行业影响
落地场景
FLAT 的统一 1D 序列表示使其能同时服务检索与生成任务,适合需要跨模态理解与内容生产的平台。典型场景:
- 电商搜索与商品图生成:用户用自然语言查询商品,模型先做 T2I 检索 召回候选商品,再利用同一表示直接生成商品场景图或搭配建议,无需额外训练生成模型。
- 内容平台的多模态资产管理:对 UGC 图片和视频帧提取可变长度前缀表示,动态调整存储与计算开销;同一嵌入可做相似图检索、自动打标、以及基于插值的风格迁移。
- 零样本组合检索:如“把这张沙发的材质换成皮革”,FLAT 的潜在空间算术可原生支持,无需微调即可用于设计工具或广告素材生成。
商业价值
- 降低训练与推理成本:传统两阶段流程需分别训练视觉编码器和生成模型,FLAT 单次预训练即可同时获得判别式检索和生成式解码能力,减少模型数量和运维开销。
- 提升用户体验与转化率:电商场景中,更精准的检索 + 即时商品图生成可缩短用户决策路径;内容平台能提供一键式风格迁移或描述生成,增加互动。
- 灵活的资源适配:通过 nested dropout 控制前缀 K 长度,同一 checkpoint 可在边缘设备用短前缀做粗检索,在云端用长前缀做高质量生成,实现算力弹性。
与现有产品 / 工作流的接口
- 替代或增强现有 CLIP 类检索索引:FLAT 输出的 1D token 可直接存入向量数据库(如 FAISS、Milvus),替换原来的固定长度 embedding,支持更细粒度的匹配。
- 作为生成模型的文本编码器:FLAT 的文本表示可替代 CLIP text encoder 或 T5 encoder,输出连续 token 序列给 diffusion 或 autoregressive decoder,无需额外适配。
- 统一 API 设计:现有系统通常分开部署检索服务和生成服务,FLAT 可合并为单一服务,通过参数
prefix_len控制输出长度,后端灰度迁移成本较低。
局限
- **计算与训练开销大**:联合训练对比学习与双向生成目标需要同时优化共享编码器和两个解码器,显存与计算成本显著高于单独训练对比编码器或生成模型,限制其在资源受限环境中的可复现性。论文未详细报告预训练数据规模与训练时长,难以评估实际训练成本与碳排放,可能使得该框架难以在中小规模团队中快速验证。
- **灵活长度的潜在权衡**:虽然 nested dropout 实现了动态 prefix-K 输出,但不同 K 值下表示质量和生成性能可能不一致,且需精心设计前缀采样策略。论文仅在部分 K 值上评估,对于极端短前缀(如 K=1)或未见过长度的泛化能力未充分验证,实际部署时需额外调优,可能抵消其灵活性优势。
- **与专用 SOTA 模型的差距**:尽管微调后在多个基准上接近或达到 SOTA,但作为统一模型,FLAT 在特定任务上可能仍不及高度优化的专用模型(如纯文本到图像扩散模型或大规模视觉语言模型)。此外,当前框架仅覆盖图像和文本模态,缺乏对视频、音频等扩展,限制了其作为通用多模态骨干的潜力。