ABACUS: 适应统一基础模型以桥接图像计数理解与生成
ABACUS 是一个统一的视觉语言模型,能够处理物体计数、人群计数、指代表达计数和计数忠实图像生成,无需针对任何基准进行特定训练。 该模型基于现有的 3B 参数统一基础模型,并通过三项关键创新适配于物体定位任务: 1. 密度感知自适应缩放与 目标性图(objectness maps)用于空间定位; 2. 基于 GRPO 的边界感知计数策略,消除裁剪边界误差; 3. 循环一致性 GRPO 策略,其中理解分支自我批评生成输出,无需外部标注即可弥合理解与生成之间的差距。 ABACUS 在七个基准上取得了最先进的结果,超越了任务专用专家和更大的通用模型。
论文精读
TL;DR ABACUS 是一个统一的视觉语言模型,无需按基准定制的训练,即可同时处理多种计数任务与按数生成图像,靠密度感知缩放、边界感知策略和循环自批评学习在七个基准中达到 SOTA。
问题
问题背景
图像计数理解与计数忠实生成是AI视觉领域的两个关键方向。前者涵盖对象计数、人群计数、指代表达式计数,后者要求根据文本提示生成恰好包含指定数量实例的图像。近期研究趋势开始尝试将两者纳入统一的视觉-语言框架,以减少任务孤岛,提升模型泛化能力。
现有方法局限
传统计数方法高度专用化:每个子任务依赖独立的架构(如密度图回归)、损失函数和训练流水线,无法在任务间迁移。通用视觉-语言模型(VLM)虽然具备较好的类别泛化性,但在细粒度实例级指令上表现崩溃。根本原因在于缺乏训练时显式的空间定位信号:模型难以在图像中分辨“对象性”(objectness),即一个独立实体的连贯表示,导致对大图中小目标的计数不准确,或无法生成长尾分布的精确数量。
为什么这个问题难且重要
核心挑战在于空间-语义对齐的粒度差异:计数需要像素级定位与全局数量推理的结合,而生成则需要将离散数量约束注入连续视觉空间。现有模型要么擅长“看”(理解)要么擅长“画”(生成),但两者间的闭环反馈缺失——例如,生成结果的计数准确性无法自动验证。业界关注度来自实际应用需求:自动驾驶中的障碍物计数、工业质检中的缺陷数量统计、数字内容创作中的元素控制等,都迫切需要一个统一、无需任务特定训练的基础模型。
行业类比
类似文本到图像生成中属性绑定(如“三只红色猫和两只蓝色狗”)的控制困难,计数忠实生成要求模型具备理解抽象数量并据此刻画视觉场景的能力,本质上是视觉推理与生成协同的通用问题。
核心洞察
- **循环一致自我批评填补理解-生成鸿沟**:ABACUS 通过理解分支对生成图像进行自评估,提供无外部标注的反馈信号,实现计数理解与生成的联合优化。与以往用固定规则或单独训练模型的方法不同,这种闭环机制让模型自身发现并修正生成中的计数错误,显著降低了高质量标注的依赖,使统一模型在多个计数任务上媲美甚至超越专用模型。
- **密度感知自适应空间接地提升细粒度计数**:引入 objectness map 指导的 adaptive zooming,让通用视觉语言模型能自动聚焦于密集或小尺寸实例区域,解决了现有统一模型在实例级空间定位上的不足。相比依赖全局特征或固定网格的方法,这种动态聚焦策略能在保持计算效率的同时,实现对物体位置的精细推理,是通用模型迈向精确计数任务的关键步骤。
方法
模型整体流程
ABACUS 基于 3B 参数的统一视觉语言基础模型,接收图像和自然语言指令(计数查询或生成提示),输出精确的计数值或符合计数约束的生成图像。模型通过三个核心技术创新实现跨任务泛化,无需针对特定基准进行微调。
密度感知自适应缩放与对象性地图(Spatial Grounding)
对于计数理解任务,模型首先生成 对象性地图(objectness maps),表示图像中每个位置属于独立实例的概率。在此基础上执行 密度感知自适应缩放(density-aware adaptive zooming):系统自动识别高密度区域并动态放大裁剪,以缓解小目标或密集场景下的空间语义混淆。该过程通过迭代将大图分割为可处理的重叠子区域,每个子区域的计数由对象性峰值读出,最终聚合得到全局计数。此机制让模型具备类似检测器的空间定位能力,又不依赖显式的边界框标注。
边界感知计数策略(Boundary-Aware Count Policy via GRPO)
自适应缩放在区域边界处容易引入重复计数或漏检。针对这一痛点,ABACUS 引入 边界感知计数策略,通过 群组相对策略优化(GRPO) 训练模型学习在裁剪边缘如何分配对象归属。具体而言,GRPO 将计数问题分解为多步决策,每一步向模型呈现一个裁剪窗口,模型输出动作(包含扣除边界附近计数或继续缩放)。奖励函数显式惩罚边界错误,驱动模型自主学会从周围上下文推断对象是否应计入本窗口,从而消除拼接误差。
循环一致自我批评策略(Cycle-Consistent GRPO)
为弥合计数理解与生成之间的鸿沟,ABACUS 采用 循环一致 GRPO 训练。理解分支对生成分支输出的图像进行计数评估,并将评估结果与原始生成条件比较,产生自批评信号(self-critique)。该循环不依赖外部标注,使生成分支学会更精准地控制图中实例数量。通过这种联合优化,模型在计数理解和生成两个方向上相互监督,形成闭环迭代提升。
差异点小结
与现有任务专属模型或通用大模型相比,ABACUS 最大的差异在于 通过对象性地图和自适应缩放将计数任务转化为统一的定位—聚合范式,并用 GRPO 驱动的边界感知与自我批评机制消除拼接误差和模态鸿沟,实现了单一模型在七项基准上的全能SOTA,且无需任何基准特定训练。
实验
实验设计
ABACUS 以 3B 参数统一基础模型 为底座,针对物体计数、人群计数、指代表达计数与计数忠实图像生成四类任务进行适配,无需任何基准特定训练。评估覆盖 七个公开基准,涵盖从稀疏物体到高密度人群的多样场景,并与两大基线簇对比:①任务专用模型(如 FSC‑147、CARPK 等计数专家,CountBench 等生成模型);②更大规模通用视觉语言模型(如 7B–13B 参数的通用 VLMs)。同时通过消融实验量化三项核心创新的贡献,并分析计数读出头和边界策略的收益分解。
关键发现
- 全面最优:ABACUS 在全部七个基准上达到 SOTA,超越所有专用模型和参数量数倍于己的通用模型。
- 空间定位突破:密度感知自适应缩放 结合 物体性地图 提供精准空间接地,使模型能正确响应细粒度实例级指令,克服了以往 VLMs 在计数任务上崩溃的问题。
- 边界错误消除:边界感知计数策略 通过 GRPO 奖励塑形,显著降低裁剪边缘造成的重复或遗漏,在跨图像拼接推断中尤其关键。
- 理解–生成闭环:循环一致 GRPO 策略 让理解分支自动批判生成结果,无需外部标注即可弥合理解与生成鸿沟,大幅提升生成图像的数量忠实度。
- 效率与泛化:3B 模型在推理成本低于大模型的同时保持高准确率,且训练流程无需针对新基准重新设计,展现强泛化潜力。
与基线的深度对比
与 任务专用模型 相比,ABACUS 无需定制架构、密度图回归头或任务特定损失函数,以统一范式覆盖异构任务,打破了计数任务长期以来的孤立研究模式。在 CountBench 等生成基准上,其计数忠实度大幅领先专用生成模型,印证理解能力可通过自我批判有效迁移至生成环节。与 更大通用 VLMs 相比,ABACUS 通过物体性空间接地解决了 VLMs 缺乏实例级定位能力的通病,证明关键不是参数规模,而是适配的空间感知机制。消融进一步显示,移除任何一项创新均会导致跨基准性能显著下降,验证了每项设计对统一计数能力的必要支撑。
行业影响
落地场景
- 电商产品计数与生成:商品图库中的对象计数,确保页面显示正确数量;根据库存需求自动生成包含指定数量商品的营销图像。
- 人群密度监控:公共安全、零售分析等场合的实时人群计数,无需对每个新场景重新训练专用模型。
- 内容生成平台:自动生成符合“三只猫一只狗”等多对象组合描述的图像,提升创作工具的精确性。
- 医学影像:细胞计数、病变检测计数,辅助诊断。
商业价值
- 降本:统一模型替代多个任务专用模型,减少标注、训练和维护成本。
- 增效:无 benchmark 特定微调即可跨任务泛化,部署周期短。
- 体验提升:计数更精确(特别是边界误差消除),生成图像更符合描述,提高用户信任度。
与现有产品/工作流的接口
ABACUS 可封装为 推理 API 或 轻量插件,输入图像和自然语言指令,输出计数结果或生成图像。现有系统(如电商后台、内容审核管道)可通过 REST/gRPC 调用,替换当前专用计数模块。其 3B 参数量相对轻量,适合在边缘设备或云端低延迟服务。与主流 VLM 框架(如 Hugging Face Transformers)兼容,易于集成。
具体用例:
- 电商自动上架:当卖家上传图片时,ABACUS 自动检测并计数图片中的商品实例,与 SKU 数量比对,避免上架错误;同时根据促销需求生成包含精确数量商品的宣传图。
- 智慧零售客流分析:基于普通监控摄像头,用 ABACUS 实时估计店内各区域人群密度,优化员工排班和热区规划,无需为每个门店定制模型。
局限
- **极端场景下的计数精度不足**:虽然ABACUS在七个基准上达到SOTA,但密度感知自适应缩放与对象性图可能仍难以应对极度密集(如每平方千像素目标数极高)或严重遮挡的场景。这类情况下对象性图可能无法可靠分离相邻个体,导致计数偏低。论文未明确给出模型在超密集人群基准(如 UCF-QNRF, NWPU-Crowd)上的性能极限分析,也未讨论最小可分辨目标尺寸的限制,这可能影响模型在安全监控等高风险场景的部署。
- **循环一致性训练对自我批评质量的依赖**:ABACUS的cycle-consistent GRPO策略假设理解分支能准确评估生成图像的计数保真度。若理解分支存在系统偏置(例如对特定类别过度/低估),则self-critique信号将引导生成分支偏向错误分布,可能形成反馈循环,损害生成多样性。论文未分析理解分支校准误差对生成质量的影响,也未提供这一自监督机制失效时的后备方案,这在实际数据分布迁移时可能问题凸显。
- **3B参数规模的能力上限**:该模型基于统一基础模型适配,参数规模3B,虽优于部分更大模型,但在需要复杂场景构图、细粒度属性绑定(如“生成exactly 5只斑马,每只姿态不同”)的生成任务,以及与人类交互的灵活指令理解方面,可能弱于更大规模多模态模型。论文未探索增大模型容量或与解码器风格生成(如扩散模型)的结合,限制了系统在开放式指令下的扩展性。