论文

从 RGB 生成到密集场读出:基于文本到图像模型的像素空间密集预测

从 RGB 生成到密集场读出:基于文本到图像模型的像素空间密集预测

大规模文本到图像模型因其 RGB 生成预训练学习到丰富的语义、结构和几何先验,成为密集预测任务的有吸引力的骨干网络。现有生成与编辑方法将密集预测转化为目标生成,将深度、法线、透明度遮罩、掩码和热力图等标注编码到 RGB 训练的 VAE 潜空间,再解码为图像状目标。我们认为这种做法继承了过多的生成输出接口:与 RGB 合成不同,密集预测要求在同一图像平面上的像素正确、任务原生场,而不是渲染新的 RGB 内容。 关键观察:预训练的 DiT 已通过图像平面上的 patch-to-token-to-patch 格子组织 RGB 输入,因此每个 token 索引一个固定输出 patch,其通道可以携带任务原生量而非 RGB 外观。我们将其实例化为 ReChannel:保留 VAE 编码器(用于 DiT 的输入分布),但丢弃目标端解码器;通过 task LoRA 适配冻结的 DiT,并使用一个共享的 token 局部线性头(约 33K 参数,无空间混合)将每个 token 映射到其 p×p×Kt 像素空间 patch。 基于 FLUX-Klein,我们在六项密集预测任务和十余个基准上评估。该最小化接口在无 trimap 抠图、KITTI 深度和指代分割上取得了新 SOTA,并在法线、显著性、姿态上保持竞争力。在匹配的 4B 设置下,它比“编辑+潜解码”方案更准确且快 2.48 倍——密集感知可以从生成预训练中受益,无需继承其输出接口。

论文精读

TL;DR ReChannel 让预训练 DiT 的 patch token 直接输出像素级任务原生场,抛弃 RGB 生成路径,以极少的参数(~33K)在六项密集预测任务上达到 SOTA,速度提升 2.48 倍。

问题

密集预测(深度估计、法线预测、抠图、分割等)是视觉感知的基础,其核心挑战在于从单张 RGB 图像恢复像素对齐的密集场。随着大规模文本到图像扩散模型展现出强大的结构与语义先验,如何将生成预训练迁移至密集预测成为研究热点。

现有方法多将密集预测重新定义为目标生成:将深度、法线或分割图等标注编码到 RGB 训练的 VAE 潜空间,再通过解码器输出“类图像”结果。这种做法继承了完整的生成输出接口,包括潜空间编解码与图像渲染流程,但密集预测并不需要生成新纹理或光照,只需在图像平面上给出像素精确的任务原生场。额外解码不仅引入计算开销,还因 VAE 压缩损失导致高频细节退化,尤其对像素级精度敏感的任务(如抠图边缘、深度不连续区域)影响严重。

该问题的难度在于:预训练的 DiT 已在 patch-to-token-to-patch 的网格上组织信息,如何绕过图像生成路径,直接利用 token 特征产出密集预测,同时保持预训练先验不受破坏。这要求设计既能保留输入分布一致性,又能将每个 token 映射回其对应输出 patch 的轻量适配接口。业界对此类“感知复用生成”方案关注度持续上升,因其有望减少对大规模标注的依赖,并推动视觉基础模型的统一。

可类比自动驾驶感知栈:与其用生成模型先渲染场景再提取特征,不如直接让骨干网络读出深度与语义——ReChannel 正是将这一“直接读出”思想系统化地植入扩散 Transformer。

核心洞察

  • 从生成目标到直接字段读出的范式转变:传统方法将稠密预测视为目标图像生成,需将深度、法向等标注编码到 VAE 潜空间再解码,这保留了不必要的生成式输出接口(RGB 渲染)。ReChannel 观察到预训练 DiT 的 patch→token→patch 网格天然对应输入图像平面,因此可直接将每个 token 映射为像素级的任务字段(如深度值、分割掩码),绕过了 RGB 生成环节。这一视角打破了“生成模型做感知必须走生成”的定式,让扩散模型直接输出感知结果,更贴合稠密预测对像素正确、任务原生输出的本质需求。
  • 极简适配方案:token-local 线性头 + LoRA:ReChannel 冻结预训练 DiT,仅插入任务 LoRA 和共享的 token-local 线性头,将每个 token 解码为 $p \times p \times K_t$ 的像素块,参数量约 33K,无空间混合。这使得适配成本极低,无需解码器,且推理速度比编辑+潜空间解码方案快 2.48 倍(4B 参数)。这为工程落地提供了高效、低门槛的路径:可在不破坏预训练先验的前提下,快速迁移到各种像素级任务,且性能达到最先进水平(如 trimap-free matting、KITTI depth 等)。

方法

ReChannel 将预训练扩散 Transformer (DiT) 改造为密集预测模型,核心思路是:保持 DiT 的 RGB 输入分布,但将输出端从 RGB 生成改为像素级密集场直接读出。

输入 → 关键模块 → 输出

  1. 输入处理:RGB 图像通过预训练 VAE 编码器 映射为潜在特征,与任务文本条件(如 “depth map”)一同送入冻结的 DiT backbone(例如 FLUX-Klein)。
  2. 内部适应:在 DiT 的 Transformer 层中插入任务 LoRA(低秩适配),仅学习约 33K 参数,保留生成预训练学到的语义、结构与几何先验,同时完成高效任务迁移。
  3. Token 到像素映射:DiT 内部通过 patch → token → patch 的网格组织输出——每个 token 对应输入图像上的一个固定输出 patch。作者丢弃目标端 VAE 解码器,改用共享的 token-local 线性头将每个 token 独立投影到 p×p×K_t 的像素空间块(K_t 为任务通道数,如深度为 1、法线为 3)。该线性头不含空间混合,保证输出与输入像素严格对齐。
  4. 任务原生输出:直接产生深度、法线、遮罩、热度图等密集预测场,无需任何后处理或 RGB 解码。

与同类方法的差异

与现有“编辑 + 潜在解码”范式(将任务目标编码到 VAE 潜在空间再解码为 RGB)相比,ReChannel 完全移除生成输出接口,不要求将密集信号渲染为图像,因此更轻量、更快(推理速度提升 2.48 倍),且能输出像素准确的任务原生字段。

实验

实验设计

ReChannel 基于 FLUX-Klein(DiT 主干)在六个密集预测任务上进行评估,涵盖几何、抠图、分割、显著性等,共十余个基准。对比方法包括:① 生成式路线(将目标编码为 VAE 潜在空间再解码为类 RGB 图像),② 判别式基线(如 DINO/SAM 特征 + 任务专属解码器)。

实验保持 VAE 编码器冻结,仅通过 任务 LoRA 适配 DiT,并使用共享的 token-local linear head(~33K 参数)将每个 token 映射回像素级密集场,无需任何空间混合或上采样。

关键发现

  • 精度:在 trimap-free mattingKITTI depthreferring segmentation 上达到新 SOTA;在 surface normalssaliencyhuman pose 上与最先进工作竞争力相当。
  • 效率:在 4B 参数匹配设置下,比“编辑 + 潜在解码”方案准确率更高,同时推理速度快 2.48 倍
  • 极简接口:仅通过线性头将 DiT 的 patch 格局重用于密集读出,避免生成式输出范式引入的冗余解码。

与基线对比的深度解读

传统的“生成式密集预测”将目标视为图像合成,必须借助 VAE 解码器将潜在码渲染回图像空间,这一过程引入了不必要的生成先验(如纹理、外观),且解码器为全图重建计算代价高昂。ReChannel 直接摒弃目标端解码器,利用 DiT 内在的 patch→token→patch 平面结构,让每个 token 通道携带任务原生量(如深度、法线分量),相当于将生成模型的输出接口从“渲染 RGB”替换为“读出场”。在 4B 规模下,该方法不仅精度更高,而且 2.48 倍的提速证明了丢弃渲染路径带来的计算收益。这揭示了大规模生成预训练可高效迁移到密集感知任务,关键在于保留其结构化表示而无需沿用其生成输出格式。

行业影响

落地场景

ReChannel 的核心能力是用极少的附加参数(~33K)将大规模文生图模型转化为像素级稠密预测器,可直接输出深度、法向、分割、抠图、关键点等任务原生场,而无需生成 RGB 图像。这使其特别适合需要实时、高精度几何或语义感知的嵌入式或云边协同场景:

  • 自动驾驶与机器人:利用预训练 FLUX 模型,快速输出深度图、表面法向和语义掩码,用于路径规划、障碍物检测。
  • 电商与内容创作:在商品图处理中,一次性产出自适应抠图、深度估计和姿态估计,取代多模型串联,加速 AIGC 工作流。
  • 医学影像分析:通过适配微调,从 2D 图像直接预测器官掩码、深度结构或关键点,辅助诊断与手术规划。

商业价值

该方法在保持相同预训练骨架的前提下,推理速度比编辑-解码方案快 2.48 倍,且显存和计算量大幅降低。这意味着:

  • 降本:模型参数量仅微增 ~33K,可实现轻量化部署,降低服务器或端侧 GPU 成本。
  • 增收:单一基础模型复用多个任务,减少模型存储、训练和迭代成本,加快产品上线速度。例如,在商品创意平台中,用一个模型取代多个专业网络,简化维护与更新流程。
  • 体验提升:消除 RGB 解码带来的伪影和时延,提供像素级精准输出,直接改善下游应用效果(如更准确的交互式抠图、更低失效率的自动驾驶感知)。

与现有产品/工作流的集成

ReChannel 的设计天然支持即插即用集成

  • 基础模型复用:企业若已部署 FLUX 等 DiT 基座,可直接加载预训练权重,仅追加任务 LoRA 与一个线性头,无需重建推理管线。
  • 接口标准化:任务原生场输出(如单通道深度、3 通道法向)可直接对接现有后处理模块(如 SLAM、渲染引擎、量化评估工具),无需额外颜色映射或逆归一化。
  • 堆栈兼容:保留 VAE 编码器接收图像,后端仍可使用主流 Hugging Face Diffusers 或自定义推理框架,仅需替换最后的输出投影层,改动极小。

具体落地 Use Case

  1. 自动驾驶数据闭环:在采集的 2D 街景图像上,用单个 ReChannel 模型同时输出语义分割和单目深度,替代级联的 Mask2Former+ZoeDepth 等专用模型,减少 GPU 占用与端到端延迟,加速高精地图构建与仿真场景生成。
  2. 全球电商平台的 AIGC 商品图美化:商家上传商品图后,系统调用 ReChannel 预测高精度 alpha matte(抠图)和表面法向,直接送入 3D 场景合成器,生成任意背景的商品展示图,无需人工修图或等待渲染农场,大幅缩短“上架到上线”周期。

局限

  • ReChannel 依赖预训练 DiT 的 VAE 编码器处理条件图像,对与预训练数据分布差异大的输入域可能性能下降,且难以保留原始分辨率的精细细节。方法仅在 FLUX-Klein 上验证,迁移到其他 DiT 架构(如 SD3、PixArt-α)的有效性未知。
  • 每个任务需要独立训练 LoRA 和 token-local 线性头,无法实现单模型多任务或 zero-shot 推理,限制了动态场景的适用性。token-local 预测的感受野受限于固定 patch,尽管自注意力传播了全局信息,但像素级映射仍是局部操作,可能不利于需要长程上下文理解的任务。
  • 与判别式密集预测模型(如 DPT、ZoeDepth)相比,ReChannel 仍需扩散采样步骤,尽管比编辑方法快,但推理速度和显存开销高于纯判别模型,且 patch-wise 输出可能产生块状伪影,在精细分割或高分辨率场景下不如专用判别式架构。
论文Zanyi Wang2026-07-09原文

相关内容