LLaDA-Image 开源,纯图像预训练后语言对齐拿下双榜第一
LLaDA-Image 证明文生图训练不必从图文对开始,纯图预训练建立视觉先验再对齐语言,性能登顶开源榜。
LLaDA-Image 采用全扩散架构,6B DiT 在预训练阶段超过 90% 样本只用纯图片监督,先学视觉再学语言。在 Qwen-Image-Bench 中英文开源模型榜单均列第一,权重、训练代码与配方已开源。
正文摘录
.jpg) 先学会画,再学会听话。 LLaDA-Image 在预训练和中期训练阶段直接从图片学习视觉先验,超过 90% 的累计生成训练样本采用 image-only 监督;图文对则集中用于后续语言对齐。模型权重、训练代码和完整配方同步开放。  先看成绩:在 Qwen-Image-Bench 上,LLaDA-Image 的英文、中文总分分别达到 53.53 和 53.38 ,在技术报告列出的开源模型中拿下双榜第一。  Qwen-Image-Bench 中英文综合成绩。模型按两条轨道的平均分排序;LLaDA-Image 在报告列出的开源模型中取得中英文双榜第一。 榜单给出了它在主流模型中的量化坐标。