TAPe+ML:面向多任务计算机视觉的紧凑结构化表示
我们提出 TAPe+ML v3,一个基于 TAPe(Theory of Active Perception,主动感知理论)的紧凑计算机视觉系统。TAPe 是一种结构化表示,在识别之前先编码各感知元素之间的关系。系统不直接作用于像素张量,而是使用共享的 TAPe 表示与模块化识别架构,统一支撑图像分类、目标检测与实例分割。 TAPe+ML v3 结合了背景与轮廓处理、局部目标定位、基于原型的分类,以及一个用于协调各专用子模型的协调器。在所报告的实验中,其参数量少于 100,000 个。 在 COCO 目标检测上,它取得 84.7 mAP50 与 65.3 mAP50-95;在 COCO 实例分割上,取得 80.7 mask mAP50 与 58.4 mask mAP50-95。分类实验中,在与 raw-pixel 基线采用相同训练设定时,于 Imagenette 上达到 92% 验证准确率,在 ImageNet-Real 上达到 89.9% Top-1 准确率。我们还评估了其在视频场景检测中的紧凑性,以及在工业试点中分布偏移下的适应性。 结果表明,把一部分建模负担从网络参数转移到结构化输入表示,有助于构建对数据、内存与算力需求更低的紧凑多任务视觉系统。
论文精读
TL;DR TAPe+ML v3 用结构化感知表示替代原始像素输入,以不到 10 万参数完成分类、检测、实例分割,COCO mAP50-95 达 65.3,展示紧凑多任务视觉系统的可行路线。
问题
问题背景
当前多任务计算机视觉(分类、检测、分割)主要依赖 深度神经网络 直接处理像素张量,模型规模与数据需求持续膨胀,业界对 紧凑、低资源、多任务系统 的需求日益强烈。
现有方法局限
- 主流框架(如 CNN / Transformer 骨干 + 多任务头)把建模负担几乎全部交给网络参数,参数量动辄数千万到数十亿,训练与推理成本高。
- 多任务通常采用共享骨干 + 独立任务头,但共享表示仍是隐式学习,缺乏对 感知元素间结构化关系 的显式编码,导致小模型性能骤降、跨任务泛化能力弱。
- 直接操作 raw pixel 使模型对 分布偏移、遮挡、形变 敏感,需要大量标注数据才能获得鲁棒性。
为什么难/重要
- 核心挑战在于:如何构造一个 共享结构化表示,既能捕捉通用视觉关系,又足够紧凑;如何让一个不足 10 万参数的系统同时完成检测、分割、分类,且性能接近大模型。
- 业界关注 边缘 AI、低数据学习、多任务学习,减少参数、内存与计算是降低部署门槛和能耗的关键。
行业类比
这类似于 自动驾驶或机器人视觉:在车载低算力芯片上同时完成多类感知任务,若能用结构化表示替代巨型网络,可显著降低延迟与功耗。
核心洞察
- 结构化输入表示 TAPe 将视觉先验注入输入层,使参数量低于 10 万也能完成多任务。与主流直接操作像素张量的 CNN/Transformer 不同,TAPe 在识别前编码轮廓、背景和对象关系,将部分建模负担从网络参数转移到表示,从而在 COCO 检测/分割和 ImageNet 分类上以极小模型取得有竞争力结果,为边缘部署和低数据场景提供了新范式。
- 模块化协调器与共享 TAPe 结合,实现多任务统一而无需大 backbone。传统多任务学习依赖共享特征提取器加多个 head,参数仍较高;TAPe+ML 使用专用子模型并由协调器调度,共享同一紧凑表示,在检测、分割、分类间切换,且能适应分布偏移。这证明结构化表示可替代部分网络容量,降低对海量数据和算力的依赖。
- 该工作重新定义了“压缩”:不是模型蒸馏或量化,而是从输入端设计紧凑表示。与直接压缩像素流的方法相比,TAPe 基于主动感知理论提取中级特征,保留元素关系,因此在 <100k 参数下仍保持泛化能力,工业试点也验证了分布偏移下的鲁棒性。这为构建低功耗、可解释的视觉系统提供了工程上可行的路线。
方法
输入与表示
TAPe+ML v3 的输入是原始图像,但不直接使用像素张量 作为识别主干。系统首先从图像中构建 TAPe (Theory of Active Perception) 结构化表示,该表示在识别前显式编码感知元素(如边缘、轮廓、局部区域)之间的空间与拓扑关系。这种表示可以看作一种紧凑的、基于感知理论的中间层,替代了传统深度网络中的隐式特征图。
关键模块
系统采用模块化识别架构,主要包含:
- 背景与轮廓处理:提取场景背景和物体轮廓,为检测和分割提供几何先验。
- 局部目标定位:在 TAPe 表示上定位潜在目标区域,生成候选框。
- 基于原型的分类:通过将目标区域与学习到的原型 比对进行分类,而非使用全连接层直接映射。
- 协调器 (coordinator):根据任务类型(分类、检测、分割)动态组合或调度专门子模型,避免所有任务共享同一网络造成参数浪费。
各模块共享同一 TAPe 表示,任务间通过该表示传递信息,减少重复计算。整个系统参数量少于 100 万(报告实验中<100k),远低于主流深度模型。
输出与训练
系统直接输出图像分类标签、检测框与类别、实例分割掩码。训练时使用紧凑的监督信号,可能结合分类损失、定位回归损失和分割损失,但结构化的表示减少了需要学习的参数量。
跟同类方法的差异点:与直接端到端学习像素到输出的 CNN/Transformer 相比,TAPe+ML 把建模负担从参数量巨大的网络转移到可解释的感知结构化表示上,实现了低参数、低数据需求的多任务视觉系统,更接近经典符号感知与现代学习的结合。
实验
实验设计
TAPe+ML v3 采用共享 TAPe 结构化表示与模块化识别架构,覆盖 图像分类、目标检测、实例分割 三类任务。评估数据集包括 COCO(检测与分割)、Imagenette 与 ImageNet-Real(分类),并额外测试了视频场景检测和工业试点中的分布偏移适应性。系统参数总量 <100K,刻意将部分建模能力转移到输入表示,以检验紧凑多任务视觉的可行性。
关键发现
- COCO 目标检测:84.7 mAP50、65.3 mAP50-95
- COCO 实例分割:80.7 mask mAP50、58.4 mask mAP50-95
- Imagenette:92% validation accuracy(与原始像素基线同训练条件对比)
- ImageNet-Real:89.9% Top-1
- 参数总量:<100,000
结果表明,在极低参数量下,结构化表示能支撑起多任务输出,且在不同数据规模下具备一定泛化能力。
与基线的对比解读
摘要强调 Imagenette 实验采用 identical-training comparison,即与原始像素输入基线在相同训练流程下对比,TAPe+ML v3 达到 92%,说明性能提升并非来自训练技巧或额外数据,而是 结构化表示本身 的贡献。与常见大参数量 CNN/Transformer 相比,TAPe+ML v3 以约十万参数取得上述 COCO 指标,工程上意味着更低的显存占用、更快的推理和更少的数据需求。对实际工程的启示是:在资源受限场景(边缘设备、实时视频分析)中,设计紧凑的感知表示可能比单纯压缩网络结构更有效。
行业影响
落地场景
TAPe+ML v3 以低于 10 万参数的体量,同时覆盖分类、检测、实例分割,适合边缘与低算力环境下的多任务视觉需求。典型场景包括:
- 智能零售货架:实时识别商品类别、位置与轮廓,用于库存管理与缺货预警
- 工业质检:对产线零件进行缺陷检测与分割,无需高成本 GPU 集群
- 自动驾驶辅助:轻量感知模块处理车载摄像头输入,降低延迟与功耗
商业价值
降本线:模型内存与算力需求低,可直接部署在 MCU、手机 NPU 或嵌入式设备,减少云端推理与带宽开销。数据效率:结构化 TAPe 表示降低了标注数据量要求,适合小样本或快速冷启动的垂直场景。体验提升:本地实时处理避免网络延迟,并天然支持隐私敏感业务(如医疗影像、园区安防)。多任务统一架构也减少了维护多套模型的工程成本。
与现有产品的接口
该模型可作为现有 CV pipeline 的前端特征提取器,输出 TAPe 结构化表示 替代原始像素张量,供下游任务头复用。工程上可导出为 ONNX 或 TensorRT 格式,插入到已有的边缘推理框架(如 TFLite、NCNN)。对于已有检测/分割模型,可将 TAPe 作为轻量预处理模块,或通过 coordinator 调度专用子模型做增量能力扩展。
具体落地 Use Case
- 电商商品图像处理:自动对商品图进行实例分割,生成透明背景图与详情页主图,同时完成 SKU 分类,减少人工抠图与标注成本。
- 内容平台视频场景检测:对上传视频进行实时场景分类与物体定位,自动打标签、审核违规内容,减轻人工审核压力并提升上架速度。
局限
- - 论文未报告推理延迟或 FLOPs,仅强调参数数量。对于资源受限部署,计算量与内存带宽同样关键;缺少这些指标使得“减少计算需求”的结论不够完整。在视频场景检测的评估中,细节披露有限,工业试点的结果只是一个案例,难以量化方法在真实动态环境下的稳定性。
- - TAPe 表示依赖前置的感知元素提取和关系编码,该过程的计算开销与泛化能力未被系统评估。与同等参数规模的轻量级模型(如 MobileNetV3、EfficientNet-Lite)在检测和分割任务上缺少直接对比,无法判断性能提升主要来自结构化表示还是其他设计选择。
- - 虽然多任务共享 TAPe,但系统仍需专门的子模型与协调器,整体架构复杂度高于端到端统一模型。在分布偏移适应方面,仅有一个工业试点,缺少标准域泛化基准(如 DomainNet、WILDS)上的验证,鲁棒性证据强度不足。