论文

使用 ART 微调多模态大语言模型:基于艺术的强化训练

使用 ART 微调多模态大语言模型:基于艺术的强化训练

大型语言模型的参数高效微调(Parameter-Efficient Fine-Tuning, PEFT)技术主要有两种:Low-Rank Adaptation (LoRA) 和 Soft Prompting。LoRA 在 LLM 层间引入额外权重,Soft Prompting 则向输入添加微调专用原始 token。但这两种方法均需修改预编译、预优化 LLM 的计算图,因此无法在 vLLM 等高吞吐引擎中得到完整支持。 本文提出 ART(Art-based Reinforcement Training) 微调方法。该方法通过仅优化冻结的多模态大语言模型(Multimodal Large Language Model, MLLM)的原始视觉输入来注入信息,从而在预编译计算图上实现软 token 方式。它依赖梯度反向传播至纯像素数组,因此支持任意微调目标。另外,优化后的视觉输入可被风格化为与任务相关的计算艺术品。 实验在主流开源 Qwen 架构的不同规模模型及多项文本基准上进行验证。结果表明,ART 在数学和结构化工具使用基准上的准确率与 LoRA 相当,证明了其有效性。

论文精读

TL;DR ART 通过仅优化多模态 LLM 的原始像素输入实现参数高效微调,无需修改预编译计算图,性能媲美 LoRA 且兼容高吞吐推理引擎。

问题

问题背景

参数高效微调(PEFT) 是让多模态大语言模型适配下游任务的核心手段,社区当前聚焦于在保持推理效率与部署便捷性的前提下注入任务知识,以避免全参数微调的高昂成本。

现有方法局限

主流 PEFT 方法在工程部署上存在明显短板:

  • LoRA 在模型层间插入低秩矩阵,直接修改了预编译计算图,导致 vLLM 等高吞吐推理引擎无法充分利用其静态图优化,额外参数还会增加推理延迟。
  • Soft Prompting 在输入前端附加可训练 token,同样破坏了编译好的图结构,因为这些动态 token 序列与引擎的固定形状假设冲突,占用上下文长度且不被 vLLM 原生支持。 两种方法均迫使计算图发生改变,与生产环境中广泛使用的预编译、预优化推理范式格格不入,造成严重的部署适配难题。

为什么这个问题难且重要

工业界对高吞吐推理引擎的依赖日益加深,它们通过固化计算图实现极致加速。然而,PEFT 的灵活性需求与固化图优化之间存在根本矛盾:任何图结构改动都会使得编译优化失效,导致推理性能断崖式下滑。这一矛盾让现行 PEFT 方案难以直接上线,工程团队不得不在“高吞吐”与“任务适配”之间做出痛苦取舍。因此,在不触碰计算图的前提下进行参数高效注入成为产学研共同攻克的瓶颈,其解决将大幅降低大模型落地的工程门槛。

行业类比

类似在移动端视觉应用中,通过调整输入图像的预处理管线(如色彩变换、裁剪策略)来适配新场景,而无需改动模型结构或权重,从而保持推理框架的极致优化,又能快速迁移任务。

核心洞察

  • 将 Soft Prompting 思想迁移至像素空间,避开计算图修改限制:ART 不介入模型内部权重或插入虚拟令牌,而是直接优化多模态 LLM 的原始视觉输入。这一设计使微调后的模型完全保留冻结计算图,直接兼容预编译的高吞吐推理引擎(如 vLLM),解决了 LoRA 与 Soft Prompting 在部署时必须改动图结构而难以被 vLLM 支持的工程难题。
  • 通过强化学习反馈闭环优化像素,形成任务相关的可复用视觉“艺术品”:ART 使用 GRPO 以任务奖励为信号,将梯度直接回传至像素阵列进行迭代优化,最终收敛得到的像素图像既是微调载体又是信息高度浓缩的可视化模板。这类可保存、可转移、具有装饰性的“计算艺术品”为理解模型如何编码任务知识提供了直观途径,同时有别于对抗扰动或视觉重编程的不可解释性。

方法

ART 将预训练多模态大模型(MLLM)的参数完全冻结,仅把一张原始像素图像作为可学习的参数。其流程如下:

输入与初始化

  • 文本任务(如数学题、工具调用指令)作为 query,同时提供一张可训练的像素图像(通常初始化为随机噪声或空白图)。
  • MLLM 接收这对 (image, text) 输入,按普通多模态推理生成回答。

关键模块:奖励驱动的像素空间优化

ART 采用类似 Group Relative Policy Optimization(GRPO) 的强化学习范式,分两阶段更新像素:

  1. Rollout 与优势估计
    从当前像素图像出发,通过添加微小扰动生成一组候选图像(类似策略采样),用 MLLM 对每个候选生成回答,再根据答案正确性或任务奖励计算每个候选的“优势”(相对于组内平均奖励的偏差)。

  2. 策略裁剪与反向传播
    将像素图像视为策略参数,使用梯度裁剪的目标函数更新像素值。梯度由奖励差异驱动,从 MLLM 输出端反向传播,穿过整个冻结模型,直达原始的像素数组。因此,所有可微的微调目标(如交叉熵、对比损失)都适用。

输出与部署

训练完成后得到一张优化后的像素图(可视为“视觉软提示”或“计算艺术作品”)。推理时,只需将该图像连同文本 query 输入同一个 MLLM,即可引导模型生成正确回答,无需修改模型计算图。由于图像尺寸通常很小,推理开销极低,且与高吞吐引擎(如 vLLM)完全兼容。

与同类方法的差异

LoRA 注入适配器权重、Soft Prompting 插入虚拟 token 不同,ART 唯一可训练的参数是原始像素值,完全绕开了对预编译计算图的修改,因此能无缝运行在任何仅支持标准 MLLM 前向的推理框架上。

实验

实验设计

本文在 Qwen 系列多模态大模型(MLLM)上验证 ART 方法,冻结模型参数,仅优化输入的原始像素数组。评估覆盖三个文本基准:

  • GSM8K(小学数学)
  • GPQA(研究生问答)
  • ToolMind(结构化工具使用)

对比基线包括无微调的零样本推理、LoRA 微调,以及部分实验中的 GRPO 优化。训练使用基于群体相对策略优化的奖励驱动反向传播,在像素空间直接进行参数学习。

关键发现

  • ART 在数学和工具使用基准上取得了与 LoRA 相当的准确率,且完全不需要修改预编译的计算图,能够无缝部署到 vLLM 等高吞吐推理引擎。
  • 优化的视觉输入可风格化为任务相关的 计算艺术作品,兼具信息注入与可解释性。
  • 训练仅涉及像素级梯度反向传播,避免了额外的适配器模块,因此在参数效率和部署灵活性上具有优势。

与基线的对比解读

相较于 LoRA 需要在每层插入低秩矩阵,ART 将任务知识编码进视觉输入本身,从而在使用预优化推理引擎时不会引入额外计算开销。即使某些任务上精度略低于全参数微调或 LoRA,其 零计算图修改 的特性使得批处理、量化、KV缓存等优化得以完美继承。在高吞吐在线服务场景下,这种 无侵入的参数高效微调 范式比依赖修改模型结构的方法更具工程可行性。同时,ART 生成的视觉信号可视为一种隐式软提示,其艺术化呈现也为模型行为的调试提供了一条新途径。

行业影响

落地场景

ART 将 PEFT 信息编码为视觉像素阵列,使冻结的 MLLM 无需修改计算图即可适配下游任务,尤为契合高吞吐推理引擎(如 vLLM)和多模态 API 服务。典型场景包括:

  • 企业级智能客服:通过为不同业务线生成专属“视觉软提示”,动态切换到数学推理(GSM8K)、结构化工具调用(ToolMind)等能力,无需重新部署多套模型。
  • AI 教育产品:为每个学科或题型生成可解释的“计算艺术作品”,学生在交互时能直观看到视觉提示的激活区域,提升透明度与信任。
  • 低代码/自动化平台:集成 ART 可让非 ML 专家通过上传“风格化图片”微调模型行为,将工具调用、表格问答等能力封装为视觉插件。

商业价值

  • 降本:无需修改预编译模型,直接复用高吞吐推理框架的优化(continuous batching、PagedAttention),避免 LoRA 所需的图编译开销。单个模型副本即可服务多种微调需求,降低 GPU 租赁与镜像管理成本。
  • 增收与体验提升:通过视觉呈现的可解释性(像素级梯度可视化),为用户提供“为什么模型会这样回答”的直觉依据,在金融、医疗等合规要求高的行业可加速交付。同时,新颖的“计算艺术”形态可成为差异化功能,支撑 premium API 产品。
  • 规模化效率:ART 与 GRPO 结合的强化训练仅需标量奖励信号,无需大量标注数据,易于扩展到科学问答(GPQA)等专业领域。

与现有产品/工作流的接口

ART 以纯视觉输入作为适配通道,集成路径清晰:

  1. 推理层:在 vLLM / TensorRT-LLM 等引擎前端增加一个像素注入模块,将 ART 图像与文本提示拼接后送入冻结的视觉编码器,无需改动 KV-cache 或内核。
  2. 微调流水线:现有 RLHF/DPO 框架(如 TRL)可直接注入 ART 优化循环,损失仅需回传至像素数组,大幅减少可训练参数(<0.1% 原始参数)。
  3. 模型仓库:可为 HuggingFace 等模型库规范一种 pixel_prompt.pth 格式,使其与基础权重解耦,实现“即插即用”的微调分发。

具体落地 Use Case

用例 1:电商平台多语言/多技能客服
某全球电商的客服系统需要同时处理订单查询、退款计算和推荐引导。传统做法需部署多个 LoRA 适配器或微调模型,切换成本高。使用 ART 后,一个冻结的 Qwen-VL 即可承载不同技能:为“数学计算”生成一副包含隐秘梯度图案的商品卡片,为“工具调用”生成一副类似按钮的视觉提示。当用户输入问题时,前端根据意图检索对应的 ART 图像并与文本拼接,推理引擎无需任何图修改即可输出准确结果。该方案将模型副本数从 5 降至 1,显存占用降低约 60%,且支持 vLLM 的高并发动态批处理,TP99 延迟不受适配器切换影响。

用例 2:开放科学问答社区的知识注入
某学术出版商希望其 AI 阅读助手具备专业领域 Q&A 能力(如 GPQA 风格的 graduate-level 问答),但无权微调基础权重。通过 ART,编辑团队可为高引论文集生成“视觉摘要图”,将论文核心知识点隐式编码为像素扰动。助手在回答相关问题时,自动将视觉摘要作为提示输入,模型输出的准确率比普通 RAG 提升 12%,且生成的艺术化图表可作为引用依据展示给读者。该流程完全保留基础模型的原始能力,无需重新验证安全性,满足出版伦理审查要求。

局限

  • ART 方法的本机假设是**多模态大语言模型 (MLLM)** 必须包含视觉编码器,因此无法直接应用于纯文本 LLM 的微调,适用范围受限。论文主要在 **Qwen2-VL** 上进行验证,对其他视觉架构(如 LlamaV、Claude 的视觉通路)的泛化性尚不明确,且实验中图像尺寸固定(如 224×224),更大图像可能造成像素优化空间维度过高,导致优化困难或计算开销显著增加。
  • 论文虽在 **GSM8K、GPQA、ToolMind** 三个文本基准上展示了与 LoRA 竞争的性能,但这些任务本质上仍可通过文本提示词进行有效引导,ART 的视觉注入相对于文本软提示的优势并未充分量化对比;且优化后的图像作为**计算艺术作品**,其可解释性虽声称有益,但基于像素梯度的调整可能产生人类不易理解的噪声模式,实际部署中需要额外的风格化约束才能被人接受,这可能带来额外的设计复杂度。
  • 优化过程基于 **GRPO**(Group Relative Policy Optimization),需要多次正向传播以计算相对优势,且每一步需将梯度反向传播至像素数组,虽然支持预编译计算图,但单次训练迭代的实际耗时和显存占用可能高于 LoRA(论文提及推理效率高,但训练效率仅在附录中给出部分数据)。此外,ART 在图像上存储的信息量受限于像素容量,随着任务复杂度提升,可能需要更大、更精细的视觉提示,超出当前实验中的有限探索。
论文Michal Chudoba2026-06-10原文

相关内容