论文

DRIFT: 一种用于视觉-语言模型中连续输出解码的残差流适配器

DRIFT: 一种用于视觉-语言模型中连续输出解码的残差流适配器

许多现代视觉-语言模型(VLM)基于离散令牌的自回归解码。虽然基于文本的输出接口支持可扩展的预训练和跨多种任务的强零样本泛化,但它们不适用于需要精确连续输出的问题,例如事件时间边界定位或机器人控制动作生成。 为解决这一挑战,我们提出DRIFT,一个用于将预训练VLM适配到连续解码任务的通用框架。DRIFT结合一个基础预测器(提供目标输出的粗略估计)和一个基于流匹配的生成式精炼模块(迭代改进预测)。这种残差公式将生成建模问题从学习全局输出分布转化为在强先验周围建模局部残差分布,大幅简化优化。 我们在感知和规划任务上评估DRIFT,包括视觉定位和机器人控制。在多个任务和架构(包括MLLM、VLA和WAM)上,DRIFT始终优于一组强大的回归和生成基线方法。

论文精读

TL;DR DRIFT 通过残差流匹配将 VLM 的离散解码扩展至连续输出,简化生成优化,在感知和规划任务上显著提升性能。

问题

当前大规模视觉-语言模型(VLMs)多采用自回归架构,将视觉输入与文本输出统一建模为离散 token 序列。这种范式支撑了强大的 zero-shot 泛化能力,但在需要精确连续输出的任务中暴露明显短板,例如事件时序边界定位、机器人末端执行器位姿控制等。

现有解决方案主要面临三类技术局限:

  • 回归方法:直接预测连续值,但难以捕捉多模态目标分布(例如一条指令可能对应多条可行轨迹),常退化为 mode averaging,输出不可靠的均值结果。
  • 离散化方法:将连续空间量化成离散 token 再自回归解码,精度受限于量化间隔,且在高维动作空间中面临维度灾难,训练信号稀疏。
  • 纯生成式方法:将连续输出建模为全局分布并一次性采样,优化过程复杂,且没有利用预训练VLM中已编码的强先验,导致训练收敛慢、数据效率低。

该问题兼具学术价值与工程紧迫性:(1) 连续解码是 VLMs 从感知迈向具身智能的关键桥梁,涉及机器人操作、自动驾驶等领域,业界正快速推进多模态大模型落地;(2) 技术挑战在于,如何将离散 token 预训练的语义表征能力无缝迁移到高精度连续控制,同时保持生成多样性、避免模式坍缩。粗暴微调容易破坏预训练知识,独立回归head则割裂了端到端系统。

类比:这类似于在自动驾驶中,我们用大语言模型理解高维场景语义,但最终仍需生成一条平滑可行的方向盘转角曲线——离散 token 可以提建议,却画不出连续轨迹,DRIFT 提供了一把从文本空间到连续动作空间的“细化尺子”。

核心洞察

  • - **残差流匹配将连续生成转化为局部修正问题**:DRIFT 不再直接拟合目标输出的全局分布,而是先由基础预测器提供一个粗糙估计,再用流匹配仅在残差空间上建模精细分布。相比直接学习完整位移场的生成模型,这种“从全局到局部”的分解大幅降低了优化难度,尤其在视觉定位和机器人控制等需要高精度连续值的任务中,能更稳定地收敛并避免模式坍塌。这与依赖离散 token 自回归的 VLM 形成互补,也优于常规回归头或训练难度高的全生成模型。
  • - **适配器式架构让预训练 VLM 零改动接入连续解码**:DRIFT 以残差流适配器的形式挂载到现有 VLM 上,无需修改骨干网络的离散 token 输出接口。相比需要从头构建连续输出专有架构的工作(如 GATO 或 RT 系列),它直接复用预训练视觉语言知识,仅增加轻量级细化模块,极大降低了连续任务适配的算力与数据成本。这种即插即用特性让同一 VLM 可快速切换于离散文本任务和连续感知规划之间,为通用视觉语言模型拓展行动空间提供了工程友好的路径。

方法

DRIFT 将连续解码适配问题分解为两阶段:粗预测 + 残差精炼,整体遵循“输入 → 基础预测器 → 流匹配精炼模块 → 输出”的管线。

输入与基础预测

给定多模态输入(例如图片 + 文本指令),首先利用预训练 VLM 的自回归解码头或额外附加的回归头生成一个基础预测y_coarse)。这个预测是一个连续向量(如目标框坐标、机器人动作参数),由模型现有能力直接给出,但不要求高精度。

核心模块:基于流匹配的生成式精炼

DRIFT 的核心是一个生成式残差精炼模块,它将精炼过程建模为从简单噪声分布到目标残差的条件迁移。具体做法:

  • 残差定义:真实输出与基础预测的差值 r = y_true - y_coarse,构成新的建模目标。
  • 流匹配训练:采用连续时间流匹配(如条件流匹配)学习一个时间依赖的向量场,该向量场定义了从标准高斯噪声 z_T 到残差 r 的概率路径。训练时,仅需回归真实残差与噪声之间的插值路径上的向量场,损失函数本质是 MSE 风格的条件期望。
  • 推理采样:测试时,从噪声出发,利用训练好的向量场通过 ODE 求解器(如欧拉法)迭代演化 T → 0,生成精炼残差 Δy,最终输出 y_pred = y_coarse + Δy

设计动机与优势

这种残差形式将生成建模从“学习全局输出分布”转化为“学习围绕强先验的局部残差分布”,大幅缩小了搜索空间,简化优化。基础预测器提供强依赖先验,即使其本身不够准确,流匹配模块也能在局部邻域内高效修正,尤其适合多模态分布或需要精确细粒度调整的任务。

应用与训练

框架可适配多种 VLM 架构(MLLM、VLA、WAM)。训练时,基础预测器可冻结或微调,精炼模块独立训练;两者可联合端到端优化。评估任务包括视觉定位(时间定位、目标定位)和机器人控制

与同类方法的差异:相比纯回归方法(直接预测坐标),DRIFT 通过生成式精炼能更好地捕获不确定性和多模态性;相比全局生成模型(如直接扩散生成输出),DRIFT 利用残差先验显著降低建模难度。与自回归离散解码的 VLM 适配方案不同,DRIFT 在保持生成灵活性的同时,直击连续输出难题。

实验

实验设计

DRIFT 在两个代表性连续解码任务上进行评估:感知类的 视觉定位 (visual grounding) 和规划类的 机器人控制 (robotic control)。实验覆盖多种主流架构,包括 多模态大语言模型 (MLLMs)视觉-语言-动作模型 (VLAs)世界-动作模型 (WAMs)。基线方法选取了强回归基线(如直接回归头、高斯混合模型)和生成基线(如扩散模型、离散 token 解码)。所有实验均基于预训练模型适配,不进行全量微调,以验证方法的即插即用性。

关键发现

DRIFT 在所有任务和架构上一致取得最优表现。残差流适配器 将全局输出分布学习转化为围绕强先验的局部残差分布建模,大幅简化了优化目标。流匹配 细化的迭代过程允许模型以较少步骤生成高质量连续输出,且在推理时可灵活调节步数权衡质量与速度。可视化结果表明,DRIFT 能捕捉多模态输出空间,而回归基线则产生模糊预测。在机器人控制中,DRIFT 生成的轨迹更平滑且符合物理约束。

与基线对比解读

相比回归方法,DRIFT 的生成式细化能处理不确定性和多模态性,避免了均值回归导致的模式坍缩。相比纯生成方法(如扩散模型),DRIFT 的基预测器提供了粗粒度初始化,显著降低了生成难度,提升了训练稳定性和样本效率。这种残差设计兼具回归的效率和生成的表达能力,为视觉-语言模型的连续解码提供了一种实用范式,尤其适合需要精确连续输出的交互与决策任务。

行业影响

落地场景

DRIFT 为需要连续输出的视觉语言模型(VLM)应用打开了可能性,典型场景包括:

  • 视频理解与编辑:在长视频中定位“进球瞬间”或“产品演示片段”的时间边界,输出精确的起止时间戳。
  • 机器人操控:仓库自动化中,机械臂根据自然语言指令(“拿起红色盒子置于左侧”)生成连续的关节角度末端执行器位姿,而非离散动作槽。
  • 自动驾驶:给出语言导航指令,直接预测方向盘转角、油门/刹车等连续控制曲线。

商业价值

  • 降本:DRIFT 仅需在强大预训练 VLM 上附加轻量适配器,避免从零训练专用连续输出模型,显著降低数据采集与算力成本。基座模型的通用知识被复用,使小样本任务也能快速适配。
  • 体验提升:精确的连续预测减少人工后处理。例如,视频平台自动剪辑准确率提升可直接转化为用户留存与内容消费时长;机器人动作更平滑精准,减少碰撞和返工,提升产线效率。
  • 增收:更快更准的自动化能力可嵌入更高附加值的产品线(如实时体育直播自动标记、协作机器人订阅服务),拓展原有 VLM 产品的功能边界。

与现有产品/工作流的接口

DRIFT 作为可插拔的残差适配模块,能无缝接入现有 VLM 推理管线:

  • 架构层面:任何自回归生成离散 token 的 VLM(如 LLaVA、GPT-4V)均可通过在其输出端增加 DRIFT 头实现连续解码,无需改动主干网络。
  • 训练流程:仅需针对具体连续输出任务微调 DRIFT 参数,冻结预训练 backbone,可与 LoRA 等参数高效微调方法协同,适合MLOps 管道中多任务扩展。
  • 推理集成:提供 base_predictor + flow_matching_refiner 两阶段 API,可部署为微服务或边缘模块,与现有决策系统通过标准数值数组通信。

具体用例

  1. 全球电商仓库自动化:客户提出“将货架第三层所有盒子移到传送带”,部署于 VLM 的 DRIFT 适配器解析视觉场景后连续输出机器人运动轨迹,直接驱动机械臂完成操作,替代传统硬编码的抓取点计算,使系统更灵活应对货品形状、摆放变化。
  2. 流媒体内容平台自动剪辑:创作者上传赛事素材并输入文本提示“每个得分时刻”,DRIFT 结合 VLM 理解画面语义,输出精确的时间段列表(精确到帧),自动生成高亮集锦,将人工标记事件的时间成本从小时级降至分钟级,且剪辑一致性大幅提升。

局限

  • **迭代采样开销**: DRIFT 的生成精炼模块基于 flow matching,推理时需多步 ODE 求解(如文中默认的 10 步 Euler 积分),相比单步回归方法显著增加了计算量和延迟。在需要高频连续输出的场景(如实时机器人控制 >100Hz)中,该开销可能限制直接部署,需额外采用蒸馏或更高效的采样器。
  • **基础预测器依赖**: 残差设计将主要的输出分布建模转移到粗估计附近,因此最终精度高度依赖于 **base predictor** 的质量。若 base predictor 出现系统性偏差或对某些输入失效,残差分布的方差会增大,flow matching 可能需要更多步骤或更大模型容量才能纠正,极端情况下甚至无法恢复合理输出。
  • **任务泛化有限**: 虽然论文在视觉 grounding 和机器人控制两类任务上验证了 DRIFT,但都集中在时序边界或低维动作空间。对于更高维度、多模态的连续输出(如 3D 姿态、连续语音特征),残差分布的建模难度和计算开销会急剧上升;缺少此类实验,框架的通用性仍存疑,且需要额外设计适合的 base predictor 和条件编码方式。
论文Zhuoming Liu2026-06-04原文

相关内容