论文

LocateAnything: 基于并行框解码的快速高质量视觉语言定位

LocateAnything: 基于并行框解码的快速高质量视觉语言定位

现有视觉语言模型通常将视觉定位与检测视为坐标令牌生成问题,将二维框序列化为多个一维令牌,令牌间独立学习与解码。这种逐令牌解码方式不匹配框几何的耦合结构,且因严格顺序生成造成推理瓶颈。为此,我们提出 LocateAnything,一种基于 并行框解码(Parallel Box Decoding, PBD)的统一生成式定位与检测框架。 PBD 将边界框、点等几何元素作为原子单元单步解码,从而保持框内几何一致性并释放并行性潜力。实验表明,PBD 同时提升了解码吞吐量与定位精度。我们进一步开发了可扩展数据引擎,构建包含超过 1.38 亿训练样本的大规模数据集 LocateAnything-Data,显著增加了高精度定位的数据多样性。 广泛评估显示,LocateAnything 推进了速度-精度前沿,在多种基准上不仅实现更高解码吞吐量,还提升了高 IoU 下的定位质量。这些结果凸显了并行框解码与大规模训练数据在实现高效、精确的统一视觉定位与检测中的互补优势。

论文精读

TL;DR LocateAnything 提出 Parallel Box Decoding,将边界框作为原子单元并行解码,消除顺序生成瓶颈,结合大规模数据引擎,在速度与高 IoU 定位精度上显著超越现有方法。

问题

问题背景

视觉语言模型(VLMs)在指代表达理解(REC)与开放词汇检测等任务中,普遍将视觉定位转化为坐标 token 的生成问题。模型需根据文本描述在图像中输出精确的边界框或点坐标,这成为实现精细视觉理解的核心能力。

现有方法局限

当前主流方案将 2D 框序列化为多个 1D 坐标 token(如 [x1, y1, x2, y2]),并通过自回归逐 token 生成。该范式存在两个显著缺陷:

  • 几何耦合性缺失:框的四个坐标值并非独立,它们共同定义了一个几何实体。逐 token 解码破坏了这种耦合结构,导致模型难以学习框的内在一致性,在高 IoU 定位时精度不足。
  • 推理吞吐瓶颈:严格串行生成使每个框的解码步数与 token 数量线性相关,在需输出多目标或高精度坐标时严重拖慢推理,无法满足实时应用要求。

技术挑战与业界关注度

并行解码面临的核心挑战在于如何保持框的几何一致性——若将四个坐标作为独立 token 同时输出,缺乏相互约束,极易产生无效框(如 x2 < x1)。同时,大规模、多样化定位数据的匮乏限制了模型对复杂场景和精细坐标的泛化能力。随着具身智能、自动驾驶、交互式 AI 对实时性、高精度视觉定位需求陡增,突破串行解码的效率瓶颈已成为 VLMs 迈向实际部署的关键。

行业类比

这一演进路径与自然语言处理中的非自回归生成(如 Mask-Predict 翻译模型)高度相似:通过并行解码在保证生成质量的前提下大幅提高吞吐,标志着序列生成技术从“逐 token 推理”向“原子语义单元并行预测”的范式转型。

核心洞察

  • **Parallel Box Decoding** 将边界框作为原子单元并行解码,直接内建几何一致性,打破了现有 VLM 将坐标序列化为多个独立 token 逐次生成的范式。这不仅消除了顺序解码造成的推理延迟,还避免了因 token 间独立预测而破坏框的几何耦合关系,从而实现更高的定位精度和吞吐量。与需要昂贵自回归生成的方案相比,PBD 在保持统一生成框架的同时,显著推进了检测模型的速度-精度前沿。
  • **LocateAnything-Data** 展示了数据规模与多样性对生成式定位的决定性作用,通过数据引擎生成超 1.38 亿训练样本,覆盖多种标注类型和任务场景。这与多数仅依赖预训练 VLM 少量微调的方法形成对比,证明了大规模高质量定位数据是释放并行解码潜力、提升高 IoU 性能和零样本泛化的关键互补因素。数据引擎的设计为未来视觉定位的数据扩展提供了可复用的范式,打破了依赖精细化人工标注的瓶颈。

方法

整体流程

LocateAnything 遵循“视觉-语言输入 → Parallel Box Decoding (PBD) 生成 → 几何目标输出”的管线。给定图像与自然语言提示,模型需要输出对应的边界框或关键点坐标。传统方案将每个 2D 框序列化为多个 1D 坐标 token,再逐 token 自回归解码,既破坏了框的几何耦合性,又形成严重的串行推理瓶颈。

核心创新:Parallel Box Decoding

PBD 将每个几何单元(如边界框、点)视为原子实体,在单个解码步骤中直接生成其全部几何参数。具体来说:

  • 编码方式:不再将坐标拆分为离散 token 序列,而是用一组专门的 embedding 一次性表征框的位置与尺寸。
  • 解码并行性:每个框的解码可独立并行,生成阶段只需极少前传步骤,大幅提升吞吐。
  • 几何一致性:由于所有坐标参数联合预测,避免了顺序生成中常见的错位或漂移,高 IoU 定位质量显著改善。

训练与数据引擎

模型训练分两阶段:先用大规模图文数据注入世界知识,再用定位-检测增强数据进行微调。为此构建了 LocateAnything-Data——一个超 1.38 亿样本的数据集,通过多目标标注引擎从检测数据、无标签图像等自动生成多样化定位指令,保证高精度定位所需的数据多样性。训练中引入 Stream PackingMagiAttention 等技术提升长序列与异质掩码训练效率。

输出与推理模式

最终输出为一组结构化几何目标(框坐标、类别、点位置等),可直接用于下游检测或指代表达理解。推理支持 on-demand 模式,可按需选择仅生成区域提议或直接输出精细定位。

与同类方法的差异:相比 Pix2Seq 等序列化解码策略,PBD 用并行原子解码替代逐 token 自回归,从根本上解决了解码速度与内部几何一致性的矛盾,而非仅仅在 token 编排上做改良。

实验

实验设计

作者基于 LocateAnything-Data(超 1.38 亿样本)微调基础 VLM,在多个公开 grounding 与检测基准上评估模型。实验重点对比 Parallel Box Decoding (PBD) 与传统 sequential token 解码,通过消融研究分析解码架构、数据规模及吞吐特性。

关键发现

  • 解码吞吐显著提升:PBD 将框作为原子单元单步生成,解码吞吐远优于顺序解码,且推理速度与批处理规模正相关。
  • 高 IoU 定位质量增强:在高 IoU 阈值下,PBD 定位精度显著更优,得益于框坐标联合建模维持了几何一致性。
  • 数据规模化收益:使用大规模 LocateAnything-Data 训练后,模型在跨域场景中鲁棒性明显增强。
  • 统一框架兼容性:单一模型可灵活支持图文定位与通用检测,并可通过 on-demand 推理模式切换任务,工程实用性高。

与基线的深度对比

传统自回归坐标生成将框拆解为独立 token 串行输出,不仅拖慢推理,还破坏框的耦合几何结构,导致高 IoU 场景下角点偏差。PBD 通过一次性预测完整框,从根本上消除了序列依赖,使解码阶段高度并行,同时内在地约束坐标间的空间关系。实验结果显示,PBD 在吞吐上获得数量级提升,同时在 strict grounding 指标上优于各类 SOTA 方法,尤其当结合大规模数据后,优势进一步放大,证明了“架构并行化 + 数据规模化”是提升视觉定位效率与精度的有效路径。

行业影响

落地场景

LocateAnything 的高吞吐定位能力可嵌入需要实时视觉定位的产品线:

  • 交互式视觉助手:在视频通话、直播或 AR 眼镜中,用户用自然语言指代物体(“把桌上的蓝色杯子递给我”),模型需在单步内解码出 2D 点或框,满足低延迟交互。
  • 机器人操控:VLA(视觉-语言-动作)系统中的视觉 grounding 模块,可并行解码多个目标框/点,提升抓取规划效率。
  • 自动驾驶感知:端到端模型可通过语言查询(“前方穿红衣服的行人”)直接输出 3D 投影框,无需传统检测头。
  • 内容审核与电商:批量理解图像中的品牌 logo、违禁物品或商品位置,生成结构化元数据,替代多阶段检测管线。

商业价值

  • 降本:消除逐 token 串行解码瓶颈,PBD(Parallel Box Decoding) 单步生成框/点,显著提高每秒查询数(QPS)。在 GPU 集群上部署时,相同硬件可支撑更大流量,降低单位成本。
  • 体验提升:低延迟响应使对话式 AI 产品(如多模态助手)的用户体验从“明显卡顿”变为“即时反馈”,提升留存与付费转化。
  • 统一架构精简:合并 detection 和 grounding 为同一生成式框架,减少模型冗余,简化训练与维护开支。
  • 高精度定位:在高 IoU 阈值下性能提升,满足工业级质检或自动驾驶对精细定位的要求,降低漏检带来的风险。

与现有产品/工作流的接口

LocateAnything 可作为 视觉编码器 → 语言模型 流程中的一个可插拔 grounding 模块:

  1. 复用现有 VLM 的视觉 backbone(如 SigLIP)和 LLM,仅微调 LoRA 和新增的定位头,集成成本低。
  2. 提供 On-Demand 推理模式:可按需切换点、框或掩码输出,兼容不同下游任务。
  3. 训练数据引擎可复用用户自有检测/grounding 标注,或通过预置的 LocateAnything-Data 进行 warm start,加速落地。
  4. 可与流行的模型服务框架(如 vLLM)结合,利用 KV Cache 管理实现高并发在线推理。

具体落地 Use Case

  • 电商直播商品智能讲解:主播手拿商品时,系统根据语音“介绍这双鞋子的材质”实时定位到画面中的鞋子区域,并触发对应商品卡片弹出。PBD 在每一帧只需一次 forward 即可解码出坐标,确保定位与主播动作同步,避免传统检测模型带来的滞后。
  • 自动驾驶即时查询:L2+ 系统接收用户指令“注意前方那个突然停下的摩托车”,模型并行解码出该目标框并触发预警。相比于串行生成 token 的模型,LocateAnything 单步定位的延迟降低数倍,安全关键场景下优势明显。

局限

  • **对复杂几何形状与密集场景的覆盖不足**:当前方法仅将包围框和点作为原子单元解码,未扩展到多边形、分割掩码等更丰富的空间表示。在需要层次化或非刚性局部定位的场景(如医学图像、遥感的任意形状目标)中,并行解码的原子性假设可能失效,因为这类对象无法用单步解码的刚体框/点充分表达。此外,密集多目标场景下依赖点采样与排列不变的集合匹配,可能损失目标间的相对关系,导致重叠或遮挡目标的召回偏低。
  • **大规模数据依赖与训练开销**:LocateAnything-Data 包含 1.38 亿样本,虽然显著提升了定位质量,但模型对数据规模和质量高度敏感。训练过程需先进行 VLM 基座的世界知识注入,再执行细粒度的检测/定位微调,两阶段管线复杂且计算开销大,不利于资源受限团队复现。此外,数据引擎依赖现有检测数据集和未标注图像自动标注,自动标注的噪声可能限制定位精度上限,且在域外数据上泛化能力未充分验证。
  • **仅在特定解码模式下体现吞吐量优势**:并行框解码的加速效应主要在纯定位任务(无文本生成)中明显;对于需要交错生成文本与坐标的对话式交互,由于文本部分仍为自回归解码,整体加速比受限。论文虽然提出了 on-demand inference modes,但在真实 VLM 对话场景下的端到端延迟和吞吐量提升仅部分展示,与全功能对话系统的整合尚有工程挑战。
论文Shihao Wang2026-05-26原文

相关内容