ARM:一种统一离散表示的自回归大型多模态模型
本文提出 ARM,一种基于离散表示的自回归模型,在下一个 token 预测框架内统一了图像理解、生成和编辑。 方法方面,首先训练一个离散语义视觉分词器,将图像映射为紧凑的 token 序列。该分词器通过多个目标进行监督,联合提升语义判别性、语言对齐和忠实重建,从而在共享潜在空间中支持多种任务。在此基础上,在大规模文本和图像 token 序列上训练一个 7B 自回归模型,无缝发展视觉语言感知和生成能力。 为进一步改善文本到图像生成和指令引导编辑的偏好对齐行为,ARM 应用强化学习 (RL) 优化任务级目标,如视觉质量、指令遵循和编辑一致性。令人惊讶的是,RL 不仅显著提升了目标任务性能(例如,WISE 整体从 0.50 提升至 0.56,GEdit-Bench-EN GO 从 5.75 提升至 6.68),还诱导了文本到图像生成与编辑之间的跨任务协同效应。 总体而言,这些发现凸显了自回归建模与强表示和偏好优化相结合,可作为多模态智能的可扩展基础。代码见:https://github.com/wdrink/ARM。
论文精读
TL;DR ARM 用离散语义分词与 7B 自回归模型统一图像理解、生成与编辑,RL 偏好对齐在提升单项任务的同时引发跨任务协同,展示自回归建模的多模态潜力。
问题
问题背景
多模态大模型(LMM)正从单一理解任务向理解与生成一体化演进,业界期望用一个统一架构同时完成视觉问答、文生图、指令编辑等任务,以简化系统设计和提高数据利用效率。
现有方法局限
已有统一方案大致分三类,均存在明显短板:
- 混合架构(如 Transfusion):在自回归中嵌入扩散去噪步骤,训练与推理管线复杂,且两种模态的优化目标难以对齐。
- 模块化设计(如 Qwen 系列):将 LMM 与独立扩散解码器级联,导致表示割裂,无法端到端联合优化,编辑任务往往需要额外后处理。
- 纯自回归模型:早期工作直接预测连续或离散像素 token,忽略了高层语义,重建保真度差;后续虽引入 VQ-VAE 等离散分词器,但缺乏语义判别性与跨模态对齐,导致生成图像模糊、理解能力退化。
技术挑战与重要性
统一理解与生成的核心难点在于:
- 离散表示瓶颈:视觉 token 必须同时具备高压缩率(支持长序列自回归)、语义丰富性(支撑理解)和精确重建能力(支撑生成),三者天然存在权衡。
- 跨任务梯度冲突:自回归训练中,文本预测与图像预测的监督信号可能相互干扰,导致生成图文不相关或理解性能崩塌。
- 偏好对齐盲区:生成与编辑任务的评价(如美感、指令遵循、编辑一致性)难以用传统似然损失优化,必须引入强化学习,但奖励信号的设计与跨任务泛化仍未被充分探索。 业界之所以高度关注该方向,是因为一旦突破,即可用单个模型代替现今碎片化的多模型流水线,极大降低部署与维护成本,并且有望催生更自然的多模态交互 Agent。
行业类比
这一思路类似于 NLP 领域 GPT 统一语言理解与生成的成功路径:用一个通用自回归框架取代原先分类、摘要、翻译等独立模块,大幅提升了开发效率与任务泛化性。
核心洞察
- 离散语义视觉分词器是统一多模态自回归模型的桥梁:ARM 并未采用常见的混合架构(例如自回归模型+扩散模型),而是通过一个精心设计的离散视觉分词器将图像压缩为紧凑的语义 token 序列。该分词器同时优化语义判别性、语言对齐和重建保真度,使得同一个自回归模型能够在共享的离散隐空间中无缝处理理解、生成和编辑任务。相比于 Chameleon 等基于 VQ-VAE 的纯重建 token,这种多目标监督的 token 携带了更强的语义先验,为统一模型提供了更坚实的表示基础。
- 强化学习在视觉 token 预测中的偏好对齐可诱导跨任务协同:通常 RL 仅用于提升单一任务的对齐效果,但 ARM 的实验表明,对文本到图像生成和指令引导编辑分别使用 RL 优化时,不仅各自指标显著提升(如 WISE 整体从 0.50 到 0.56,GEdit-Bench 的 G_O 从 5.75 到 6.68),还意外地带来了跨任务的正向迁移。这意味着在多模态自回归框架下,理解和生成技能并非孤立存在,而是共享部分底层知识,通过 RL 可以解锁这种协同潜力,为高效的多任务人类偏好对齐开辟了新路径。
方法
ARM 的方法体系围绕统一离散表示展开,可拆解为三个递进环节:
1. 离散语义视觉分词器
输入图像首先通过一个多目标训练的离散视觉分词器,将连续像素映射为紧凑的离散 token 序列。该分词器同时优化三个目标:
- 语义判别性:确保 token 能区分不同概念;
- 语言对齐:让视觉 token 与对应文本嵌入在共享空间中对齐;
- 忠实重建:从 token 解码回图像时保留细节。 这种设计使得视觉 token 既能承载语义信息,又可支持生成任务的重建需求,为后续统一建模奠定基础。
2. 自回归多模态大模型
在分词器之上,训练一个 7B 参数的自回归 Transformer,输入为文本 token 与图像 token 的混合序列。模型通过下一个 token 预测学习联合分布,从而获得多模态理解(如图像问答)和生成(如文本到图像合成)的能力。训练数据为大规模图文对,所有任务都统一为序列预测。
3. 偏好对齐(强化学习)
为进一步提升生成与编辑质量,ARM 引入强化学习(RL) 对视觉 token 预测做偏好优化。针对文本到图像生成,优化视觉质量与指令遵循度;针对指令引导编辑,优化编辑一致性。RL 阶段直接使用任务级奖励进行微调,使模型行为更符合人类偏好。
实验显示,RL 不仅显著提升生成(WISE overall 从 0.50 到 0.56)与编辑(GEdit-Bench-EN G_O 从 5.75 到 6.68)指标,还带来了跨任务协同——生成能力的改善会惠及编辑表现。
与同类统一多模态模型相比,ARM 的核心差异在于:完全基于离散语义 token 的自回归框架,避免了扩散模型或混合架构的复杂性,同时用 RL 直接对齐任务级偏好,实现了生成与编辑的协同增益。
实验
实验设计
ARM 在三个维度上进行评估:图像理解(视觉问答、描述生成等)、文本到图像生成以及指令引导的图像编辑。所有任务共享一个离散语义视觉 tokenizer,将图像映射为紧凑的 token 序列;随后通过一个 7B 自回归模型在大规模图文序列上完成预训练,统一了感知与生成。最后,对生成和编辑任务施加**强化学习(RL)**优化,任务级奖励覆盖视觉质量、指令遵循和编辑一致性,以对齐人类偏好。评估基准可能涵盖多个多模态标准数据集,但论文正文未显式列出具体名称。
关键发现
RL 优化带来显著性能提升:WISE overall 从 0.50 升至 0.56,GEdit-Bench-EN G_O 从 5.75 升至 6.68,直接说明视觉生成质量和指令跟随能力大幅增强。更值得注意的是,RL 训练诱发了跨任务协同——文本到图像生成和图像编辑之间相互促进,表明在统一离散表示空间下,自回归模型习得的操作能力具有可迁移性。这暗示精心设计的奖励信号不仅能提升单一任务,还能驱动模型内部表征向更通用的方向收敛。
与基线对比的深度解读
相比于将自回归模型与扩散模型耦合的混合架构(如 Transfusion),ARM 的纯自回归 + 离散 token 设计简化了训练和推理流水线,消除了模块间特征转换的损耗。传统自回归生成往往缺乏精细控制,而 ARM 通过 RL 直接优化人类偏好,突破了仅靠最大似然估计的局限,在生成质量和指令遵循上拉开差距。跨任务协同效应进一步表明,离散视觉 token 空间可能封装了概念级的编辑原语,这为构建真正统一的多模态基础模型提供了工程上可行的路线:一旦获得强大的离散表征,自回归结构与偏好优化相结合即可覆盖理解、生成与编辑,减少模型碎片化。
行业影响
落地场景
ARM 的统一离散表示结合自回归生成,使单一模型直接覆盖图像理解、生成与指令编辑。内容平台 可基于同一模型完成视频封面理解、生成与风格化修改;电商系统 能实现商品图背景替换、模特适配等编辑任务,并同时维护描述文本与图像的语义一致性;教育科技 产品可依据教材文本生成配图并支持交互式视觉讲解;协作设计工具 可在画布中直接对话修改视觉元素。
商业价值
通过将多任务压缩至单个 7B 模型,ARM 显著降低部署与维护多套专用模型的成本。强化学习(RL) 对齐后,视觉质量与指令遵循度提升明确(WISE 从 0.50 到 0.56,GEdit-Bench 一致性从 5.75 到 6.68),可减少人工审核与后期修正。在 UGC 平台 中,更可控的生成与编辑能力能提升创作者效率与内容多样性,直接增加用户留存与广告库存价值。
与现有产品/工作流的接口
ARM 的自回归架构天然兼容现有 LLM 推理栈(如 vLLM、TensorRT-LLM),可轻松接入基于文本 API 的编排管线。离散 token 输出支持缓存与投机解码,延迟可控。企业可将 ARM 作为多模态微服务,通过提示工程或轻量 RL 快速适配品牌视觉风格,无需额外训练扩散模型。
具体落地用例
- 电商商品图智能工厂:给定商品白底图与文案,ARM 生成多场景展示图,并依据“将沙发移到窗边,调亮光线”等自然语言指令实时编辑,直接输出带透明通道的成品图,接入商品管理系统。
- 社交媒体创作助手:用户上传旅行照片,说出“添加极光天空,增强色彩”,ARM 一步完成理解-编辑,同时可对照片生成字幕与话题标签,实现从视觉到文案的全流程辅助。
局限
- - **分词器的对比与泛化性不足**:论文提出的离散语义视觉分词器虽联合了语义判别、语言对齐和重建等多个目标,但并未系统对比不同目标组合或与现有主流分词器(如 VQGAN、ViT-VQGAN)在各任务上的量化表现差异,难以判断每个目标的实际贡献。此外,分词器在域外图像(如医疗、遥感)上的泛化能力未经验证,可能限制其在更广泛场景中的应用。
- - **RL 优化的成本与覆盖范围有限**:ARM 的强化学习阶段仅针对文本到图像生成和指令编辑任务设计奖励,未涉及图像理解任务,导致多模态能力的对齐不完整。而且 RL 训练需要额外的奖励模型和大量采样,7B 参数的策略模型训练成本较高,可能影响其工程复现与部署的可行性。
- - **模型规模与对比基线尚欠充分**:虽然 7B 参数的自回归模型展现了能力,但论文未探索更大规模(如 13B、30B)下的扩展规律,也未与同等规模的混合架构(如 Transfusion、Show-O)或最新扩散模型(如 SD3)进行更深入的公平比较,难以准确定位其在多模态模型谱系中的优势边界。