论文

ViQ: 任意分辨率下的文本对齐视觉量化表示

ViQ: 任意分辨率下的文本对齐视觉量化表示

文本与视觉的统一表示是自然的追求,因为它能实现更简单的多模态建模和更高效的训练。然而,将图像像文本一样表示为离散信号不可避免地会引入严重的信息损失。现有工作难以在离散表示中平衡低层细节与高层语义:面向重建的表示通常缺乏语义信息,而语义更强的特征往往遭受严重细节损失。 我们提出 ViQ (Visual Quantized Representations),一个旨在平衡离散表示中语义与细节的框架,同时支持原始分辨率输入,从而使其能够作为任意视觉输入的通用离散表示。我们的方法将量化学习分为两个阶段: - 文本对齐预训练:利用预训练语言模型的语义丰富监督增强视觉编码器,并使其能够处理原始分辨率视觉输入。 - 特征离散化:提出 近邻表示学习 策略逐步紧凑化特征空间,以及 位置感知头部量化 机制,实现灵活处理任意分辨率。 大量多模态任务实验表明,ViQ 在保持低层重建高精度的同时,与使用连续高维视觉特征的最新多模态视觉编码器相比取得了具有竞争力的性能。我们还展示了使用视觉量化表示进行多模态训练大幅提升了效率,在不同基础 LLM 和训练配置下实现了 20% 至 70% 的加速。

论文精读

TL;DR ViQ 通过文本对齐预训练与特征离散化,在保留细节的同时注入语义,得到支持任意分辨率的离散视觉表示,显著加速多模态训练(最高达70%)。

问题

问题背景

统一文本与视觉的离散表示是多模态建模的自然追求:若能像文本 token 那样用离散符号表达图像,模型架构与训练流程将大幅简化,并有望获得显著的效率提升。然而,将高维连续的视觉信号压缩为有限且离散的码本向量,本质上意味着严重的信息丢失。

现有方法局限

当前视觉离散表示方法普遍在低层细节高层语义的保留上顾此失彼:

  • 重构导向的方法(如 VQ-VAE 系列)以像素级重建为目标,擅长保留纹理、边缘等低层信息,但其离散特征缺乏与自然语言的语义对齐,在下游多模态理解任务中表现疲弱。
  • 语义导向的方法(如 SEED 等利用 CLIP 或文本对齐模型生成离散 token)虽能承载丰富的语义,却往往以牺牲空间保真度为代价,难以处理高分辨率输入中的精细结构,导致在 OCR、细粒度定位等细节敏感任务上性能不足。

这种割裂使得现有离散表示无法同时满足“语义丰富”与“细节可辨”的要求,限制了它作为通用视觉 token 的可能性。

技术挑战与重要性

视觉离散化面临的核心矛盾在于连续信号的表达力与离散码本的有限容量之间的对立。要同时捕捉纵横比任意、分辨率可变的自然图像中的精细纹理与高层概念,码本设计必须既有紧凑的语义空间,又能灵活适应多样的空间结构。此外,多模态大模型的训练效率已成为产业落地的瓶颈——视觉 token 数量直接决定模型的计算开销。若能用高信息密度的离散 token 替代现有连续高维特征,将带来可观的训练加速(本文报告 20%–70% 加速)。因此,一种既能保持语义与细节平衡,又支持原生分辨率输入的离散视觉表示,既是学界追求统一多模态表征的关键突破点,也是工业界降低成本、提升吞吐的迫切需求。

行业类比

这类似于自动驾驶感知系统中对视觉中间表示的需求:环视摄像头的高分辨率图像既要被压缩为低带宽的离散 token 用于云端大模型推理,又必须无损保留交通标志的细节和场景语义,否则任何信息丢失都可能威胁行车安全——平衡细节与语义的离散表示才能真正走向实时且可靠的 AI 系统。

核心洞察

  • 文本对齐预训练为离散视觉表示注入高层语义。与传统的 VQ-VAE 等仅以重建为目标的量化方法不同,ViQ 在第一阶段让视觉编码器与预训练语言模型对齐,使离散码本在保持低层纹理细节的同时,捕获了丰富的语义信息,解决了离散表示长期存在的“语义空洞”问题。这使 ViQ 在下游多模态理解任务中,能够以离散特征达到与连续高维特征相当的竞争力,而无需依赖额外的语义增强模块。
  • 位置感知头量化机制实现任意分辨率下的原生离散编码。现有离散视觉模型通常使用固定尺寸的网格或需要调整输入大小,导致分辨率变化时细节损失或计算浪费。ViQ 提出针对不同图像区域动态分配量化“头”,在特征图中按位置自适应选择码本,从而无需插值即可原生支持任意分辨率输入。该设计不仅保留了高分辨率下的精细信息,还让多模态训练直接受益于原生分辨率视觉信号,训练效率提升 20%-70%,同时避免了传统方法中分块带来的边界伪影。

方法

方法流程

ViQ 的核心思路是通过两阶段训练生成兼具语义丰富度和细节保真度的离散视觉表示,并能处理任意分辨率输入。整体遵循 原始图像 → 文本对齐预训练 → 离散化学习 → 离散 token 序列 的线索。

第一阶段:文本对齐预训练

本阶段目的是为视觉编码器注入语言空间的语义知识,并使其具备任意分辨率处理能力。

  • 输入:任意分辨率的原生图像,无需固定尺寸裁剪或下采样。
  • 关键模块
    • 使用一个可处理高分辨率的视觉编码器(如 ViT),参考位置感知头(position-aware head) 机制,在不同图像尺度下灵活分配计算量。
    • 引入预训练语言模型(如 BERT 或 GPT 系列)作为监督信号源,通过对比学习或生成式对齐让视觉特征与文本嵌入空间对齐。这类似于 CLIP 风格的多模态预训练,但更强调语义上的密集监督,而非仅依靠图文匹配。
  • 效果:视觉编码器不再仅关注像素重建,而是学会提取富含高层语义的特征,同时保留原生分辨率带来的细粒度信息。

第二阶段:特征离散化

在获得语义丰富的连续特征后,第二阶段的 target 是将特征压缩为离散化表示,同时维持细节重建能力。

  • 近端表示学习(Proximal Representation Learning)
    • 通过逐步收紧特征空间的策略,避免直接量化造成的严重信息损失。训练时使用一个带温度系数的损失函数,先允许特征松散分布,再渐进式地向离散码本靠拢,兼顾重建质量和语义保持。
    • 这与传统 VQ-VAE 的硬量化不同,可缓解 codebook 崩溃和梯度断裂问题。
  • 位置感知头量化(Position-Aware Head-wise Quantization)
    • 为适应不同分辨率输入,每个空间位置或注意力头独立选择量化码本,避免将不同局部模式强行映射到相同的离散 token。
    • 这使得模型能自然地处理任意尺寸图像,输出长度可变的离散序列,而不是固定长度的平坦化 token。

输出与应用

最终得到的离散视觉 token 序列可直接像文本 token 一样送入语言模型,用于多模态理解、生成或检索等任务。在训练 VLM 时,这些 token 压缩了视觉信息,显著降低序列长度,带来 20%-70% 的训练加速,同时保持与连续高维特征相当的竞争力。

与现有量化方法的差异:多数离散表示工作(如 VQ-GAN、RCD)偏重图像重建而弱化语义,或偏重语义却丢失细节;ViQ 通过“文本对齐预训练 + 渐进式量化”的双阶段设计,首次在离散空间中统一平衡了语义丰富度与低层细节,并原生支持任意分辨率输入,避免了传统固定尺寸处理的局限性。

实验

实验设计

实验覆盖三个核心维度:多模态理解训练效率图像重建。多模态理解任务上,将 ViQ 量化特征输入到视觉语言模型 (VLM),与多种连续特征 SOTA 视觉编码器对比。效率测试在不同基础 LLM 与训练策略下测量 VLM 训练吞吐量。重建实验直接评估离散编码保留图像细节的能力。此外,通过消融研究验证各组件贡献,并分析局限性。

关键发现

  • 语义与细节的平衡:ViQ 在多模态理解任务上达到与连续高维特征编码器可比的性能,同时低层重建精度远优于纯语义表示,突破了离散表示在高层语义与低层细节之间的 trade-off。
  • 显著训练加速:使用 ViQ 量化特征训练 VLM 可获得 20%–70% 的加速,受益于离散 token 序列长度大幅减少和更高效的计算。
  • 原生分辨率支持:位置感知的 head-wise 量化机制使得模型能灵活处理任意分辨率输入,无需额外插值或裁剪。

与基线的深度对比

现有离散表示工作通常侧重一方:重建导向方法(如 VQ-VAE)细节保留好但语义匮乏;语义导向方法(如 BEiT)强于理解但丢失大量纹理与结构信息。ViQ 通过两阶段(文本对齐预训练 + 特征离散化)和邻近表示学习策略,在压缩特征空间的同时防止语义崩塌。与连续特征编码器相比,ViQ 的离散表示在理解能力上并未明显下降,却在存储和计算效率上具先天优势,为统一文本与视觉的离散多模态训练提供了实用方案。

行业影响

落地场景与商业价值

ViQ 将任意分辨率图像压缩为语义丰富的离散 token,使视觉信号可与文本 token 统一处理,直接应用在 多模态大模型训练、推理加速、视觉内容存储与检索 等方向。商业价值集中于:

  • 降本:离散 token 序列相比连续特征或原图显著减少存储与传输开销,训练加速 20%-70%,降低 GPU 成本;图像可仅存储 token 序列,节省 CDN 与数据库成本。
  • 增收:更高效的 VLM 可快速迭代多模态应用(如智能客服、商品分析),缩短上线周期;支持原生分辨率避免细节丢失,提升回答质量,增强用户黏性。
  • 体验:任意分辨率输入让用户无需预处理图片,结果更精准,尤其适合需要高精细度的医疗影像、设计素材等场景。

集成路径

ViQ 可作为现有 VLM 视觉编码器的直接替代,输出离散 token 而非连续向量,与 LLM 的 token embedding 层自然对接:

  1. 替换编码器:加载 ViQ 预训练权重,替代原 ViT/SigLIP 等编码器,输出 token id 序列。
  2. 适配训练框架:由于仍为序列输入,可直接沿用 DeepSpeed、FSDP 等分布式训练方案,仅需调整图像 token 的词表大小与 position id 生成逻辑。
  3. 存储与检索:离散 token 可直接作为图像摘要存入向量数据库或倒排索引,用于相似搜索、去重等,无需额外特征提取。

典型用例

  • 电商商品理解:商品图经 ViQ 编码为 token,与标题、描述文本 token 拼接后送入 LLM,完成分类、属性抽取、多模态搜索。对比传统编码器,存储成本降低 10 倍以上,且支持高分辨率细节图,提升长尾商品识别准确率。
  • 视频内容审核:在短视频平台,高分辨率视频帧经 ViQ 编码为稀疏 token 流,结合文本审核模型,可并行检测违规内容(如暴力、水印),大幅降低计算延迟与带宽消耗,适合实时流处理。

局限

  • **量化表示仍存在信息损失。** ViQ 将连续视觉特征离散化为有限码本向量,虽通过文本对齐和近端学习缓解语义退化,但在精细结构(如文本、细小纹理)的重建任务中仍可能出现模糊或伪影,限制了其在需要像素级精度任务(如医学图像、遥感)中的直接应用。此外,码本大小固定导致对长尾视觉概念的覆盖可能不足,罕见物体的离散表示易产生语义漂移。
  • **未充分验证在超大规模多模态模型上的扩展性。** 实验主要在 ViT-B/L 规模构建的视觉塔上进行,最高验证在 7B 参数的大语言模型上。当模型规模进一步扩大到数十亿参数时,量化特征的空间压缩比(如 256 倍)是否仍能保持信息完整、是否会出现表示瓶颈,缺乏实证支撑。此外,训练效率提升的幅度(20%-70%)在不同训练配方下波动较大,可能与具体超参敏感,实际部署时需额外调优成本。
  • **两阶段训练流程带来工程复杂性。** ViQ 需要先进行文本对齐预训练,再进行特征离散化,相比单阶段端到端训练的连续表示方法,增加了训练步骤、数据需求和调试难度。文本对齐阶段依赖预训练语言模型的语义监督,其质量直接影响离散表示质量,若语言模型本身存在偏见或领域不匹配,可能导致视觉表示出现系统偏差。此外,位置感知头向量化对输入分辨率的自适应能力尚待跨域数据上的鲁棒性测试。
论文Xumin Yu2026-06-25原文

相关内容