让RGB成为视觉的语言
本文提出了一种统一的视觉模型范式,将自然图像之外的多种视觉信息(如掩码、深度图和其他结构化视觉信号)均表示为RGB图像,并将通用视觉任务转化为常见的RGB到RGB图像编辑问题。在该范式中,不同类型的视觉信息与自然图像共享相同的编码解码架构和参数,使得单一模型能够通过统一的视觉接口跨任务迁移,类似于语言模型处理文本的方式。我们将这一范式称为RINO(RGB In and RGB Out)。 基于通用图像编辑骨干网络,无需任务特定的微调,RINO在密集理解任务(如分割和深度估计,我们将输出统一为RGB)以及密集条件生成任务(如姿态到图像生成,我们将输入统一为RGB)上展示了鲁棒且具有竞争力的零样本性能。以分割任务为例,模型可直接输出RGB编码的掩码;深度估计则输出RGB编码的深度图。 我们希望这项工作能为通用的统一视觉语言系统提供有用见解,使多样化的视觉任务能够通过共享的视觉语言进行表达、解释和解决。代码已开源:https://github.com/yangtiming/RINO。
论文精读
TL;DR 将所有视觉任务统一为 RGB 图像到 RGB 图像的编辑问题,像语言模型处理文本一样,用单一模型零样本支持分割、深度估计和条件生成。
问题
问题背景
计算机视觉领域正致力于构建更通用的基础模型,类似于语言模型中文本作为统一的输入输出格式。目前,视觉任务如分割、深度估计、图像生成等各自使用不同的数据表示,导致模型架构碎片化,难以实现跨任务的知识迁移。
现有方法局限
当前视觉模型普遍采用任务专用表示:自然图像用 RGB、分割掩码用 one-hot 编码、深度图用连续值矩阵。这种差异迫使研究者为每种任务设计独立的编码器和解码器,并引入额外的适配组件。例如,SAM 依赖提示编码器处理点/框输入,DepthAnything 需定制解码头预测深度。这种异构性不仅增加了工程复杂度,更阻碍了模型复用——一个在分割上训练好的模型无法直接用于图像生成,与语言模型中“万物皆 token”的灵活交互形成鲜明对比。
为什么这个问题难/重要
统一视觉表示的核心难点在于不同视觉模态的信息密度和语义鸿沟极大:RGB 像素携带稠密的纹理、光照信息,而分割掩码是离散的语义标签,深度图则是几何距离。强行映射到同一空间容易丢失关键细节或引入歧义。然而,若能突破这一瓶颈,则有望实现单一视觉骨干处理所有理解和生成任务,大幅降低多任务系统的部署成本,并推动视觉-语言模型走向真正的通用交互。业界对此高度关注,因为当前多模态系统通常需维护多个独立模型,资源开销大且推理链路复杂。
行业类比
这类似于自动驾驶系统中,若能将激光雷达点云、摄像头图像和地图标注统一转化为同一中间表示,感知、预测、规划模块便可共享骨干网络,避免多传感器异构处理的冗余设计。
核心洞察
- 将异构视觉信息统一为 RGB 图像,消除模态特异性架构。传统视觉模型为每种数据类型(如分割掩膜、深度图)设计专用编码器/解码器,这导致模型碎片化,难以跨任务迁移。RINO 将所有视觉信号映射到共享的 RGB 空间,使得同一骨干网络无需适配即可处理多种输入输出,真正实现了“视觉即语言”的范式。这一设计打破了视觉领域的格式壁垒,让视觉模型向 LLM 的通用文本接口看齐,为构建统一的视觉-语言系统提供了简洁的基础。
- 零样本任务泛化验证了统一 RGB 表示的有效性。RINO 基于通用图像编辑模型,未针对下游任务微调,即能在密集预测(分割、深度估计)和条件生成(姿态到图像)等差异显著的任务上取得有竞争力的表现。这表明 RGB 通道足以编码丰富的视觉语义和几何信息,且共享表示空间有利于跨任务知识共享。相比需要多阶段对齐或任务特定头部的现有方法,RINO 的零样本能力揭示了统一视觉界面的巨大潜力,为未来通用视觉模型指明了一条低开销、高灵活性的路径。
方法
输入统一:一切视觉信号皆为 RGB
RINO 将分割掩码、深度图、姿态关键点等非自然图像的结构化视觉信息,重新编码为 RGB 图像。具体而言,每个任务类型被映射到一个固定的 RGB 色彩空间表示:
- 分割掩码 → 逐像素 one-hot 着色图(每种语义类别对应固定 RGB 颜色)
- 深度图 → 归一化后通过伪彩色映射(如 Turbo 或 Viridis)转为 RGB
- 人体姿态 → 关键点绘制为骨架图,背景赋予固定颜色
这种设计使得所有输入和输出都遵循自然图像的 3 通道 RGB 约定,从而可以共享同一个视觉 backbone,无需为每种模态设计专用编码器或适配器。
关键模块:通用图像编辑 Backbone
RINO 采用一个预训练的图像编辑模型作为统一处理引擎(例如基于扩散模型的 InstructPix2Pix 架构)。该模型原本用于基于文字指令的图像编辑,本次工作中被直接当做 RGB 到 RGB 的映射器,不做任何任务特定的微调。模型接收一张输入 RGB 图像(问题定义图)和一张可选的参考图像(条件图,如 Canny 边缘或骨架),通过去噪过程生成输出 RGB 图像。任务的差异化仅仅体现在输入 RGB 图像的绘制方式上,模型结构、参数、训练目标完全不变。
输出统一与任务解耦
对于理解任务(如分割、深度估计),模型输出为 RGB 图像,再通过简单的后处理解析规则映射回任务所需格式(如将着色掩码的颜色 ID 映射回类别标签或深度值)。对于生成任务(如姿态到图像),输入条件(姿态骨架)被绘制为 RGB,模型直接输出自然图像。整个过程形成一个封闭的 RGB 循环,将多样的视觉任务抽象为统一的可控图像生成 / 翻译问题。
与同类方法的差异
相比同时期的视觉通用模型(如 Unified-IO 2、Prismer 等需要任务头、多模态编码器适配的方案),RINO 完全复用现有图像编辑模型的权重,零样本执行多任务,没有任何额外的任务头或模态编码器,展现出一种极致的视觉表示统一范式,其思想类似于语言模型中“万物皆 Token”的简化路线。
实验
实验设计
RINO 将多种视觉任务统一为 RGB-in RGB-out 图像编辑范式,不进行任何任务特定微调。实验在两大类任务上评估零样本性能:
- 稠密理解任务(分割、深度估计):将输出统一为 RGB 图像(如彩色掩膜或彩色深度图),模型直接预测。
- 稠密条件生成任务(姿态到图像生成):将输入条件(如姿态关键点)渲染为 RGB 图像,模型从该条件生成自然图像。 所有任务共享同一个预训练图像编辑骨干网络,未引入额外编码器或适配器。
关键发现
RINO 在未见过任务上展现了出人意料的泛化能力:
- 分割和深度估计任务中,模型能够生成语义合理的彩色输出,即便从未见过该类标注格式。
- 姿态到图像生成中,模型能基于简化姿态图生成复杂的人体外观,保持姿态一致性的同时生成高质量纹理。
- 零样本结果与部分经过专门设计的基线模型性能可比,表明 RGB 接口本身蕴含了足够的视觉先验。
基线对比与解读
与专用模型相比,RINO 的优势在于模型完全统一,无需任务分支或输出头。但零样本性能仍弱于强监督微调方法。这揭示了一个重要权衡:统一范式牺牲了一定的极限精度,换取了极强的跨任务迁移效率。作者认为这种折衷是迈向通用视觉-语言系统的关键一步,类似语言模型中“一切皆文本”的思路。未来的工作可探索如何在不引入任务特定模块的前提下,通过更好的提示或训练策略缩小与专用模型的差距。
行业影响
核心价值:统一视觉接口降低工程复杂度
RINO 将分割、深度估计、姿态驱动生成等异构视觉任务统一为 RGB 图像到 RGB 图像的编辑问题,消除了为每种数据格式定制编码器/解码器的需要。这一范式使单个通用模型即可覆盖多种下游应用,大幅简化视觉 AI 系统的部署与维护。
落地场景
- 内容创作与电商:自动生成给定姿态的模特试衣图、背景替换、图像修复,输出可直接用于商详页,减少拍摄与修图成本。
- 自动驾驶数据增强:将语义分割标注、深度图统一为 RGB 输入,可基于同一模型生成多样化路况场景,提升感知模型鲁棒性。
- 医学影像分析:将 CT/MRI 分割掩膜或深度估计转换为 RGB 伪彩图,利用 RINO 零样本完成跨模态理解或报告生成前端处理。
- AR/VR 交互:实时把深度传感器输出转换为 RGB 图像,再通过统一接口驱动虚拟内容生成,简化多模态融合管线。
商业价值
- 降本:无需为每个新任务训练专用模型或设计适配层,基础设施复用率提高,维护人力与算力开销降低。
- 增收:产品形态更灵活,可快速拼接出新的视觉功能模块(如从姿态生成到背景替换的自动化流水线),缩短功能上线周期,抢占市场窗口。
- 体验提升:交互式应用中,统一的 RGB 通道让意图表达更直观,用户可通过自然图像编辑方式操控多个任务,降低使用门槛。
与现有产品/工作流的接口
RINO 基于主流图像编辑骨干网络(如扩散模型),与现有生成式 AI 工作流天然兼容:
- 作为 API 或插件嵌入 Photoshop、Figma 等设计工具,将结构化输入(mask、pose)直接投射为 RGB 图层,由用户二次编辑。
- 在 ML pipeline 中替换任务头:现有视觉模型的前处理阶段可将输出统一为 RGB 掩膜图,RINO 作为零样本后处理器,统一执行颜色化、修补、增强等任务,无需额外训练。
- 支持 ComfyUI 等节点工作流,以单一节点覆盖多种视觉任务,简化低代码应用搭建。
具体用例:某全球电商平台使用 RINO 接收用户上传的服装平铺图与姿势草图,实时生成模特上身效果,同时自动输出分割蒙版用于边缘精细化;同一模型还用于修复图像瑕疵,整个流程只维护一套推理服务,延迟低于 2 秒。
局限
- **RGB 表示的信息容量限制**:将深度图、分割掩码等异构视觉信号强行映射到 3 通道 RGB 空间,可能造成精度损失。例如深度图的连续浮点值被量化到 [0,255] 整数,分割掩码的离散类别需通过颜色编码区分,在类别极多或边缘锐利时易产生歧义,影响密集预测任务的细粒度准确率。
- **对基座编辑模型能力的依赖**:RINO 的性能紧密耦合于所采用的通用图像编辑主干(如基于扩散的 Inpainting 模型)。若基座模型对特定风格、分辨率或复杂结构的编辑存在系统性偏差,则所有基于 RGB 映射的下游任务都会继承这些缺陷,且无任务专属微调机制来修正。
- **实验验证的任务范围有限**:论文只展示了分割、深度估计、姿态到图像生成等少数任务的零样本效果,未涉及动态视频、3D 场景、多模态推理等更复杂的视觉问题。RGB 统一表示能否泛化到这些高维或时序任务尚不明确,距离真正的通用视觉接口仍有较大距离。