Iris-3B:通过像素空间扩散训练、转换与微调超越 latent
像素空间扩散模型 避开了 latent 模型中有损的 VAE,这暗示它们在细粒度细节至关重要的下游任务上具备优势。我们沿通往像素空间主干的两条路径检验了这一说法。 1. 从零预训练 Iris-3B:一个 3B 参数的像素空间文生图 transformer,经由 256→512→1024 的课程学习;此前先在 256² 上消融预测目标与表示对齐,以决定该缩放什么。 2. 将一个预训练 latent 模型 FLUX.2 Klein base 4B 转换为像素空间。 我们为单目深度估计与图像修复/超分辨率对这两个模型族进行微调,发现使用像素空间生成先验并未带来显著提升。在深度任务上采用同一套匹配的直接回归配方微调后,Iris-3B 与 latent 版 FLUX.2 Klein 持平,而转换得到的像素版 FLUX.2 Klein 则落后于它;在 4× DIV2K 修复任务上,两个像素模型都没能胜过微调后的 latent FLUX.2 Klein,转换版略逊一筹。我们记录了这一负面结果背后的配方、失败模式与残余混杂因素。 尽管如此,Iris-3B 表明,使用 PixelDiT 的 pixel-transformer(PiT)头做像素空间预训练可扩展到 3B 参数,并达到与 latent 模型相当的文生图质量,在 1024² 下于官方评测器上 OneIG 与 Qwen-Image 持平。我们公开其权重与训练代码,希望能为像素空间生成的后续研究铺路。
论文精读
TL;DR Iris-3B 证明像素空间扩散模型可扩展至 3B 参数并匹敌潜在模型,但下游深度估计与超分任务中未观察到像素空间先验的显著优势。
问题
问题背景
扩散模型已成为高分辨率图像生成的主流范式,其中 Latent Diffusion 通过压缩到 VAE 潜空间降低计算成本,但像素空间生成因避免有损编码而重新受到关注。
现有方法局限
Latent Diffusion 依赖 VAE 将图像映射到低维潜空间,此过程是有损的,会丢失高频细节与细颗粒纹理,可能影响下游密集预测或恢复任务。直接训练像素空间扩散模型面临高维像素的计算与内存瓶颈,难以扩展到高分辨率;而将潜在模型转换为像素空间需要额外初始化、微调和稳定性调优。现有工作多停留在小规模或单一任务验证,缺乏系统对比。
为什么这个问题难 / 重要
像素空间扩散的训练与推理成本远高于潜空间,特别是在 1024² 分辨率下处理百万级像素 token。从头预训练 3B 参数像素 transformer 并保持文本到图像质量竞争力,涉及预测目标、表示对齐(REPA) 和课程策略等复杂设计。同时,下游任务是否真正受益于无损像素先验仍不明确,负面结果提示潜在模型的有损编码可能并非瓶颈。业界关注该方向,因为若能突破,可能重塑图像生成与视觉理解的统一架构。
行业类比
类似用无损 RAW 图像训练视觉模型替代有损 JPEG 输入,理论上保留全部信息,但实际吞吐与收益需谨慎权衡。
核心洞察
- 像素空间扩散模型并未在下游稠密预测任务中体现出理论上的细节保留优势。与直觉相反,尽管避免了 VAE 的有损压缩,Iris-3B 和转换后的像素 FLUX.2 Klein 在单目深度估计和 4 倍 DIV2K 超分上均未超越 latent 基线,转换模型甚至略差。这表明下游任务性能主要受微调配方和任务头设计制约,而非生成先验是 pixel-space 还是 latent。
- 像素空间扩散预训练的可扩展性得到实证,但其计算成本与下游收益需要重新评估。Iris-3B 成功将 pixel-transformer (PiT) 架构扩展到 3B 参数并在 OneIG 上匹配 Qwen-Image,证明像素空间生成在文本到图像质量上是可行的,但这一优势并未外溢到深度估计或图像恢复任务;同时 latent-to-pixel 转换方法导致性能下降,提示直接微调 latent 模型可能是更经济的路线。
方法
核心路线概览
本工作同时探索两条获得像素空间生成先验的路径:从零预训练 与 从 latent 模型转换。
输入与预处理
- 文本提示经文本编码器提取条件向量;
- 图像在像素空间直接分块(patchify)为输入序列,分辨率按 256 → 512 → 1024 课程递进。
关键模块与训练技巧
- Pixel-transformer (PiT) head:沿用 PixelDiT 的 PiT 头,在像素空间进行去噪扩散生成,避免 VAE 压缩损失。
- 预测目标消融:在 256×256 分辨率下比较不同预测目标(如噪声或像素残差),选定更优目标后再扩展到高分辨率。
- REPA 表示对齐:引入表示对齐损失,强化中间特征与预训练视觉特征的语义一致性,作为辅助正则。
- 课程学习:从 256 到 1024 的分辨率课程,平衡训练效率和最终高分辨率质量。
转换路线
对于预训练的 latent 模型 FLUX.2 Klein base 4B,通过 ridge initialization 初始化像素头,并调整 trunk 学习率,将 latent 空间权重转换到像素空间。
输出与下游微调
两种路线得到像素空间生成模型后,分别作为 backbone 微调用于单目深度估计和图像恢复/超分辨率任务,输出深度图或高分辨率图像。
与 latent diffusion 的根本差异在于,本方法直接在原始像素空间训练或转换生成模型,绕过有损 VAE,以检验像素级先验是否带来下游细粒度任务的增益。
实验
实验设计
论文旨在验证 pixel-space diffusion 是否在下游密集预测任务中优于 latent diffusion。作者采用两条路线构建 pixel-space 骨干:
- 从零预训练:训练 3B 参数的 Iris-3B,采用
256→512→1024分辨率课程,先在小尺度上消融 预测目标 与 representation alignment (REPA),再扩展至全尺寸。 - 模型转换:将预训练 latent 模型 FLUX.2 Klein base 4B 转换到 pixel space。
随后对两类模型分别微调用于 单目深度估计 和 图像恢复 / 超分(DIV2K 4×)。同时评估生成质量(OneIG 基准)。
关键发现
- 下游任务无显著优势:无论是从零预训练还是转换得到的 pixel-space 模型,在深度估计和恢复任务上均未超过 latent 基线。
- 深度估计:Iris-3B 与 latent FLUX.2 Klein 表现持平,转换后的 pixel FLUX.2 Klein 明显落后。
- 图像恢复:在 4× DIV2K 上,两个 pixel 模型均未击败 latent FLUX.2 Klein 微调版本,转换模型稍差。
- 生成能力:Iris-3B 证明 pixel-space 预训练可扩展到 3B 参数,并在 OneIG 上达到与 Qwen-Image 相当的水平(官方评测器,1024²)。
与基线的深度对比
论文明确指出:“no significant improvement from using a pixel-space generative prior”。
这一负面结果说明,仅仅移除 VAE 有损压缩并不能自动转化为下游任务收益。可能的原因包括:预训练数据分布、模型容量、任务适配策略等混杂因素占据主导。转换模型表现更差提示从 latent 到 pixel 的直接映射可能破坏原有表示结构。对于工程实践,这暗示在下游密集预测任务中,盲目追求 pixel-space 骨干未必值得;更务实的做法是优先优化微调协议或利用 latent 先验的通用性。同时,Iris-3B 的成功为 pixel-space 生成研究提供了可复现的基线和代码,未来工作可探索更适配的下游迁移方法。
行业影响
落地场景
像素空间扩散模型 Iris-3B 直接在高分辨率像素空间训练,避免了 VAE 压缩带来的细节损失,适合对像素级保真度要求苛刻的场景。例如电商产品图生成中材质纹理、微小标识的还原;医学影像超分辨率中细微病变的增强。但论文在深度估计和 DIV2K 4x 超分上的负结果表明,当前像素空间先验并未带来预期提升,需进一步优化。
商业价值
论文的核心结论是负面结果:微调后像素空间模型与 latent 模型打平甚至落后,因此暂时不能宣称下游任务降本增效。不过 Iris-3B 在文本到图像生成上匹配 Qwen-Image,证明像素空间预训练可以扩展到 3B 参数,且避免了 latent 模型编解码 VAE 的计算开销,未来若在特定细节任务上突破,可减少端到端延迟。开源权重与代码降低了复现门槛,对研究社区有长期价值。
与现有工作流集成
- 作为生成模型,可直接替换 latent diffusion 后端,但需注意 3B 参数对显存要求较高。
- 论文提供了从 latent 模型(如 FLUX.2 Klein)转换到像素空间的 ridge initialization 方法,便于迁移已有权重。
- 微调配方(深度估计、超分)可直接借鉴,适配自定义数据集。
具体 use case
- 电商产品图生成:需要还原布料纹理、产品 logo 等高频细节,像素空间生成理论上优于 latent 模型,但本论文未验证该场景,可尝试利用 Iris-3B 做进一步 fine-tune。
- 工业质检图像增强:对缺陷细节敏感,若像素空间模型能在特定数据集上超越 latent 基线,可降低质检误判率。
局限
- 论文核心结论是下游任务上 pixel-space 生成先验未带来显著优势,甚至不如 latent 模型。作者在摘要中明确承认“We find no significant improvement”,且转换 pixel 模型在深度和恢复上落后。这暴露了实验设计或假设的局限性:仅在两个任务(深度估计、4x DIV2K 超分)上用单一微调 recipe 测试,可能不足以证明 pixel-space 先验无用;另外 negative result 可能源于 pixel-space 模型训练不充分或噪声调度未调优。加上本身 pixel-space 训练计算开销大,3B 模型虽可扩展但离实际高分辨率生成仍有差距。
- 与同类工作对比,Iris-3B 架构基本沿用 PixelDiT 的 PiT head 和 REPA 对齐,方法创新有限,主要贡献是规模化验证和转换流程。此外评估维度单一,仅在 OneIG 上匹配 Qwen-Image,缺乏在 T2I-CompBench、GenEval 等更广泛 benchmark 上的验证,文本条件生成质量可能仍有不足。pixel-space 模型推理时多次 denoising 在像素空间进行,内存和延迟显著高于 latent 模型,论文未讨论实际部署效率。且转换方法对 FLUX.2 Klein 的适配可能受限于特定 latent 架构,泛化到其他 latent 模型尚需验证。
- 可推断的局限:论文只微调了 3B 模型,下游任务可能受模型容量限制;同时使用的 depth 数据集和 restoration 数据集规模较小(如 DIV2K 仅 800 训练图),不足以充分释放 pixel-space 细节优势。此外,直接回归头与扩散生成先验的结合方式较简单,未尝试更先进的 adapter 或 prompt 式微调,可能低估了 pixel-space 潜力。作者也提到 remaining confounds,说明负面结论需谨慎解读。未来工作可以在更大模型、更多任务和更精细的微调策略上重新评估。