字节Seed团队:文生图扩展新变量是描述信息量而非长度
这项研究告诉你:文生图模型提升瓶颈可能不在模型参数,而在训练文本的信息密度;衡量并优化它比单纯加长描述更有效。
字节Seed团队发现,文生图训练中配文(Caption)长度增加并不等于信息量增加;真正能降低扩散模型训练损失的是配文中与图像绑定的信息量。他们提出两个衡量指标,并据此设计Structured Prompt,在复杂组合、推理等任务上显著提升。
正文摘录
.jpg)  文生图模型一直在扩展模型、数据和算力, 但训练图像所配 Caption 的信息量,却很少被作为一个独立变量系统研究 。ByteDance Seed 团队发现:自然语言 Caption 变长,并不意味着模型获得了更多可用的视觉监督;相比长度,Caption 中与图像绑定的信息量更能预测扩散模型最终达到的训练损失。 基于这一发现,团队提出 Structured Prompt,并从 Diffusability 与 Promptability 两侧共同提升文本条件,最终在复杂组合、推理和世界知识生成任务上取得显著提升。  论文 Figure 1|自然语言长度很快饱和;结构化条件持续增加图像信息,并沿统一关系降低扩散训练损失。 过去几年,文生图模型的进步几乎沿着一条熟悉的路线展开:更大的模型、更多的数据,以及更高的训练算力。 但文生图与语言模型之间存在一个容易被忽略的差异。语言模型可以直接从文本序列中进行自监督学习;文生图模型则依赖图像与 Caption 的配对,学习 “什么样的文字对应什么样的视觉内容”。图像中可能包含大量物体、属性、位置、动作和关系,但只有被 Caption 准确描述并清晰绑定的部分,才能作为文本条件监督传递给模型。