Channel-wise Vector Quantization
我们提出 Channel-wise Vector Quantization (CVQ),一种新颖的图像分词范式,用通道级令牌替代补丁级令牌。与传统向量量化将每个补丁特征向量分配一个离散令牌不同,CVQ 量化特征图的每个通道。该表示将图像视为视觉细节的离散层级,而非空间补丁的网格。基于 CVQ,我们引入新的视觉自回归框架——下一通道预测。我们的 Channel-wise Autoregressive (CAR) 模型不按光栅顺序逐补丁渲染图像,而是顺序预测图像通道,逐步生成更丰富的视觉细节。具体而言,它先勾勒全局结构,再细化细粒度属性,类似于人类艺术家的创作流程。实验证明: 1. CVQ 在无需额外技巧的情况下,实现了 16K+ 码本大小的 100% 码本利用率,并显著提升了重建质量。 2. CAR 在文本到图像生成任务中取得了 DPG 分数 86.7 和 GenEval 分数 0.79,展现出强大的有效性。
论文精读
TL;DR CVQ 将图像 token 从空间分块改为通道量化,100% 码本利用率且重建质量显著提升;基于此的逐通道自回归模型 CAR 在文生图任务上表现领先。
问题
问题背景
离散图像生成(如 text-to-image)高度依赖向量量化 (VQ) 将连续特征转为离散 token,再通过自回归或掩码模型进行生成。当前主流范式沿用逐 patch 量化,即把特征图每个空间位置的局部向量独立映射到码本索引。
现有方法局限
- 码本利用率低:patch-wise VQ 面对高维、冗余的局部特征,码本向量常塌缩到极少聚类中心,即使码本容量上万,实际使用率也不足 10%,导致严重的信息丢失与重建模糊。
- 生成顺序僵硬:传统自回归模型按光栅扫描顺序逐 patch 预测,先左上后右下,缺乏全局到局部的渐进生成能力,难以像人类绘画一样先勾轮廓再补细节,且并行性差。
- 空间冗余固化:patch 级别 token 强制为固定网格,无法自适应图像内容复杂度,平坦区域浪费编码,纹理丰富区域又欠表达。
为什么这个问题难且重要
- 技术挑战:码本坍缩是 VQ 训练的固有问题,需在不增加额外损失(如 commitment loss、EMA 调参)的前提下提升利用率;变更量化粒度从"空间块"到"通道"意味着重构整个图像表示框架,需解决通道间关系建模与码本扩展性。
- 业界关注度:码本效率直接决定重建质量上限,且影响下游生成模型的训练稳定性和生成细节丰富度。近期 VAR 等工作虽尝试多尺度自回归,但仍基于 patch token;CVQ 的 channel-wise 方案则从源头重定义了图像离散化,可能带来类似语言模型中 tokenizer 改进的连锁提升。
行业类比
就像 NLP 中 BPE tokenizer 替代字符级编码,更高效的 tokenization 可大幅提升生成模型性能;CVQ 将图像 token 从空间 patch 换成语义通道,有望成为视觉生成的新基础组件。
核心洞察
- 从空间分块到通道聚合的表示转变:CVQ 将图像 token 化从“空间网格上的 local patch”转换为“通道维度的全局 detail level”,彻底颠覆了 VQ 默认的 patch-wise 范式。这种视角使得自回归模型可以先预测低细节的全局结构,再逐通道细化纹理,模拟人类绘画的由粗到细过程,而传统的 raster order 预测只会按固定空间顺序生成,缺乏这种渐进式的内容规划能力。
- 码本利用率与重建-生成解耦的突破:传统 VQ 经常遭遇 codebook collapse,需要额外的 entropy 惩罚或重初始化才能勉强利用大型码本。CVQ 在无任何辅助技巧下实现了 100% 码本利用率(16K+),根本原因在于通道量化将离散化压力分散到整个特征图,单个码字需代表全局信息模式而非局部 patch,自然促进了码本使用。这直接带来重建质量提升,并为下游生成模型提供更精确的离散表示,在 DPG 和 GenEval 上验证了有效性,对工程中减少码本浪费、提高训练稳定性有实际意义。
方法
输入与特征提取
给定输入图像 $I \in \mathbb{R}^{H \times W \times 3}$,先用一个编码器 $E$ 将其映射为连续特征图 $Z \in \mathbb{R}^{h \times w \times C}$,其中 $C$ 为通道数,$h \times w$ 为空间尺寸。与 patch-wise 方式不同,CVQ 不沿空间维度分块,而是将整个特征图的每个 通道 视为一个待量化的单元。
通道级向量量化(CVQ)
传统 VQ 将每个 $1 \times 1 \times c$ 的局部特征向量替换为码本中最近的嵌入向量,而 CVQ 对每个通道的特征切片 $Z_{:,:,k} \in \mathbb{R}^{h \times w}$ 进行整通道量化。具体而言,为每个通道 $k$ 学习一个专属的码本 $\mathcal{B}k = {e_1, e_2, \ldots, e_V}$,码本尺寸可达到 16K 以上。量化过程将 $Z{:,:,k}$ 与码本向量逐一匹配,选出距离最近的索引 $i_k$,从而将图像离散化为 $C$ 个索引序列。这一步骤自然地打破了 patch 之间的空间耦合,使 token 序列对应的是“视觉细节的层级”而非空间网格。
关键设计:CVQ 无需像传统 VQ 那样依赖额外的熵惩罚或重置策略来避免码本坍塌,在 16K+ 码本大小下仍能实现 100% 的码本利用率,大幅减少信息损失。
通道自回归生成(CAR)
基于 CVQ 得到的离散 token 序列 $[i_1, i_2, \ldots, i_C]$,CAR 模型采用 next-channel prediction 的生成范式。它以已生成的通道索引为条件,自回归地预测下一个通道的量化索引。生成顺序模仿人类绘画过程:从低频的全局结构通道开始,逐步推导高频细节通道,最终合成完整图像。训练时使用交叉熵损失,并引入 嵌套通道丢弃(nested channel dropout) 策略以增强模型的稳健性。
输出与工程启示
解码器根据所有通道的量化索引重建图像,输出 $\hat{I}$。由于 CVQ 码本利用率极高,重建质量显著优于同条件下的 VQGAN 等基线。
与同类方法的差异:CVQ + CAR 将图像 token 化从“空间分块”转换为“通道分层”,以极低的训练成本和简单的架构实现了高保真重建与高质量文本到图像生成,无需复杂的两阶段训练或大规模码本扩充技巧。
实验
实验设计
CVQ 方法在图像重建和文本到图像生成两个核心任务上进行验证。重建任务 对比 CVQ 与传统 patch-wise VQ 的码本利用率(codebook utilization)和重建质量(如 rFID、PSNR),并在 16K+ 的超大码本规模下测试无额外训练的利用率稳定性。生成任务 基于 CVQ 构建 Channel-wise Autoregressive (CAR) 模型,采用下一通道预测范式,在标准文本到图像生成 benchmark 上评测 DPG 和 GenEval 指标。
关键发现
- CVQ 实现 100% 码本利用率:在 16K 以上码本尺寸下,无需任何技巧(如 k-means 重启或 EMA 均匀化)即可完全利用所有码字,彻底解决传统 VQ 的索引崩塌(index collapse)问题。
- 重建质量大幅提升:相比 patch-wise VQ,CVQ 以相同的码本大小获得显著更优的 rFID,验证了通道级离散化能更高效地保留图像细节,避免因空间分块带来的信息瓶颈。
- CAR 生成表现强劲:DPG 达 86.7,GenEval 达 0.79,表明由粗到精的通道预测策略(先全局结构后局部细节)有效提升了文本对齐与视觉质量,生成过程更贴近人类艺术家的分层创作。
与基线对比解读
传统 patch-wise VQ 通常面临两个核心限制:码本利用率不足 导致表达能力浪费,以及 重建质量受限 源于局部特征向量的离散化损失。CVQ 转向通道维度的量化,将图像表达为多级视觉细节的离散层次(而非空间块的网格),从根本上跳出了 patch 范式,因而在码本利用率和重建保真度上获得质的突破。在生成任务上,CAR 的 下一通道预测 与常见的逐块自回归(如光栅扫描)形成鲜明差异:后者往往需要逐像素/逐块生成,可能丢失全局一致性;CAR 优先建立全局布局,再逐步注入高频细节,这种 coarse-to-fine 的进程更符合图像的自然构成方式,从而在 DPG 和 GenEval 等综合性指标上取得优势。尽管摘要未给出具体基线数值比较,但定性分析与指标绝对值均表明 CVQ+CAR 在重建及生成两大任务上具有明确的有效性。
行业影响
落地场景
CVQ 与 CAR 框架可赋能生成式图像产品中需要高保真与精细控制的场景:电商商品图自动生成、数字营销素材创作、游戏角色与场景概念设计、视频内容平台的封面图合成等。其核心优势在于码本利用率 100% 和渐进式细节生成,特别适合对图像纹理、光影等细节要求严格的业务。
商业价值
- 降本:CVQ 的 16K+ 码本无需特殊技巧即可完全利用,避免码本坍塌导致的训练浪费,提升模型训练效率;CAR 按通道自回归生成,可能减少冗余的 patch 预测步数,节省推理算力。
- 体验提升:重建质量显著高于传统 VQ,生成图像细节更丰富,解决以往细节失真问题,直接提高用户满意度。
- 增收:高质量生成服务可增强 AIGC 产品竞争力,吸引更多企业订阅或按量付费,同时渐进式生成支持交互式设计,可能衍生新的增值功能。
与现有产品/工作流的接口
CVQ 可作为即插即用的 tokenizer,替代现有自回归框架(如 LlamaGen、MaskGIT)或扩散模型中的 VQ 模块,仅需更换编码器-量化器,保持 pipeline 其他部分不变。CAR 模型可与主流文本编码器(T5、CLIP)结合,构建 text-to-image 系统,并通过 next-channel prediction 输出多阶段图像,为下游应用提供多层次中间结果,方便集成到交互式设计工具或 AI 创成式填充流程。
具体落地用例
- 全球电商平台:自动生成商品主图时,CVQ 重建能保留衣物纹理、金属反光等细节,避免因压缩使商品失真。CAR 可先输出构图草图供商家确认,再逐步补全细节,实现“先审全局,后定细节”的效率优化。
- 游戏工作室概念设计:利用 CAR 生成角色概念图,先快速锁定轮廓姿态,再通过控制通道级别的视觉属性(如材质粗糙度、色彩饱和度)迭代出多种方案,大幅缩短设计周期。
局限
- **计算与存储开销**:CVQ 对特征图的每个空间位置独立量化一个通道向量,码本大小达 16K+,导致每个像素对应的索引数量等于通道数,远多于 patch-wise VQ 的单个索引。这会显著增加离散表示的比特率和存储需求,尤其在高分辨率图像上可能造成传输压力与解码复杂度,限制了实际部署效率。
- **生成顺序与解码并行度**:CAR 采用固定通道顺序逐通道预测,虽能渐进细化细节,但生成过程天然串行、难以并行解码,推理速度可能不及一次生成所有 tokens 的 MaskGIT 等并行模型。同时,早期通道压缩全局信息的能力若不足,后续通道修复困难,对生成质量上限有约束。
- **实验覆盖与基线对比不足**:当前验证主要基于 ImageNet 和 DPG/GenEval 基准,未在高分辨率(>1024×1024)或视频生成等主流场景测试。与最新扩散模型(如 SDXL、DALL·E 3)的对比有限,且未与无需 VQ 的连续扩散或强自回归模型(如 LlamaGen)做充分消融,结论的泛化性待进一步确认。