面向停车位占用识别:一种自监督方法
随着城市区域扩张,自动监控停车场对于高效和可持续城市至关重要。本文提出一种自监督方法,用于停车位占用识别,无需目标停车场的标注样本。基于自监督迁移学习微调协议,训练策略包含两个自监督阶段:首先在未标注通用数据上,然后在未标注目标特定数据上,最后仅利用通用停车场标签进行监督微调。我们采用SimCLR和ResNet-50编码器,在三个公开数据集PKLot、CNRPark-EXT和PLds上,使用留一法跨环境协议评估方法。还引入两阶段部署策略:先部署强通用模型,然后利用部署前N天收集的未标注图像以自监督方式训练专用模型。实验结果表明,仅强通用模型即超越监督和自监督基线,平均准确率达97.2%,两阶段策略进一步提升至97.8%。这些结果证明自监督学习为实际停车占用监测提供了可扩展且标注高效的解决方案。我们的训练模型和源代码公开于:https://github.com/LoanMaikon/Parking-Spot-Occupancy-Recognition。
论文精读
TL;DR 提出无需目标停车场标注的自监督停车位占用识别方法,通过两阶段 SimCLR 预训练加微调,跨数据集平均准确率达 97.8%,并提供开源代码与模型。
问题
停车位占用识别 是智慧城市视觉监控的核心任务,旨在通过图像判断车位状态(空闲/占用),以缓解交通拥堵与碳排放。现有主流方法依赖监督学习,需大量目标停车场标注图像,而不同停车场在视角、光照、车辆外观和遮挡模式上的差异,导致跨场景泛化差,人工标注成本极高。域自适应或微调虽可缓解,但仍需目标域部分标签,且伪标签方法易受噪声干扰;此外,停车场监控常部署后初期无标注,实时获取标签更不现实。
该问题的挑战在于:停车位外观特征随环境剧烈变化(白天/夜晚、晴天/雨天、角度偏差等),模型必须学习鲁棒的车位占用语义而非场景表层模式;同时,标注效率是落地瓶颈——理想方案应能快速适配新停车场而无需人工标注。业界对自监督学习在减少标注依赖上的潜力高度关注,但如何将其有效迁移至细粒度的占用分类,并利用未标注目标数据持续提升性能,仍是开放难题。
这类似于 视觉异常检测中的少样本适应——在工厂产线快速部署缺陷检测模型时,同样需利用无标注目标图像实现自监督域适应,避免高昂的产线停机标注。
核心洞察
- 自监督迁移学习训练协议(两阶段 SSL + 一次通用标注微调)无需目标停车场任何标注样本,即达到 97.2% 平均准确率,显著优于纯监督和纯自监督 baseline。独特之处在于:不是简单的“预训练+微调”或单轮域自适应,而是先在通用数据上自监督,再用目标场景无标签数据自监督,使特征逐步贴近目标分布,最后仅用通用标注进行监督微调。该设计规避了跨域标注成本,同时避免直接无监督域对齐带来的语义漂移,比 SimCLR+线性分类等自监督 pipeline 更稳定。
- 提出的两阶段部署策略(Strong General Model → Specialized Model)将模型生命周期划分成“即刻部署”与“无标注在线适应”两个阶段。部署后只需收集 N 天无标签图像进行自监督微调,即可使准确率从 97.2% 进一步提升至 97.8%。这区别于常见的离线训练、固定部署范式,使得模型在目标场景运行时能自我进化,无需人工介入,对长期、大规模部署的停车监测系统极具工程价值。
方法
方法概览
该方法采用自监督迁移学习范式,无需目标停车场任何标注样本。整体流程分为训练策略和部署策略两个层面。
训练策略:三阶段渐进式学习
通用自监督预训练
使用大规模无标签通用图像(如 ImageNet)训练 SimCLR 框架,以 ResNet-50 作为编码器。通过对比损失(NT-Xent)最大化同一图像不同增强视图的一致性,学习通用视觉表征。目标域自监督适配
加载第一阶段权重,在目标停车场的无标签图像上继续 SimCLR 自监督训练。数据增强策略与第一阶段一致(随机裁剪、颜色失真、高斯模糊等),使编码器适应目标场景的光照、视角、遮挡等分布偏移。有监督微调
只使用通用停车场标注数据(来自其他停车场)进行有监督微调。通常冻结编码器部分层,仅训练一个线性分类头,输出二分类(占用/空闲)。该阶段产出 Strong General Model(强通用模型)。
整个训练协议的核心是利用无标签目标数据缓解域迁移,同时仅需通用标注,降低标注成本。
部署策略:两阶段自适应上线
- 阶段一:直接部署 Strong General Model,对新场景进行实时推理。
- 阶段二:收集上线最初 N 天的无标签图像,在 SimCLR 框架下对 Strong General Model 做进一步自监督微调,得到 Specialized Model(专用模型),替代原模型。这一过程无需任何人工标注,使模型持续适应目标环境变化。
关键技术细节
- 编码器:ResNet-50,输出 2048 维特征,后接一个 MLP 投影头生成 128 维嵌入用于对比学习。
- 损失函数:对比损失 NT-Xent,温度系数通常设为 0.5。
- 评估协议:留一环境交叉验证(leave-one-out cross-environment),即在三个公开数据集(PKLot、CNRPark-EXT、PLds)上,每次留出一个停车场作为目标域,其余作为源域。
- 基线对比:与纯监督、纯自监督(SimCLR+线性评估)等方案对比,验证各阶段贡献。
与同类方法的差异
相较于传统监督方法需要大量目标停车场标注,或标准域适应仍需目标域标签,本方案完全通过自监督实现目标域无标签适配,并创新性地将训练与部署视为闭环,通过在线无标签数据持续提升模型专用性,更贴近实际动态部署需求。
实验
实验设计
该工作采用 leave-one-out cross-environment protocol:轮流将 PKLot、CNRPark-EXT、PLds 中的一个数据集作为目标停车场,其余作为源域,以模拟跨环境部署的真实场景。训练分为两个自监督阶段:先在源域未标注数据上预训练 SimCLR(ResNet-50 编码器),再在目标域少量无标签图像上继续自监督适应,最后仅用源域标签做监督微调。部署引入 两阶段策略:先上线 Strong General Model,收集目标停车场前 N 天的未标注图像,自监督微调出 Specialized Model,无需任何目标域人工标注。
关键发现
- Strong General Model 在三个数据集上平均准确率达到 97.2%,优于所有监督和自监督基线方法。
- 结合 两阶段部署策略,准确率进一步提升至 97.8%,且仅需目标停车场少量未标注图像。
- 在完全不使用目标域标注样本的前提下,模型性能接近甚至超过部分依赖目标域标签的监督方法,验证了自监督表征学习在停车位检测场景下的强泛化能力。
基线对比解读
监督基线通常需要为每个新停车场标注数据,成本高且扩展性差;已有自监督方法大多依赖单一域内对比学习,跨域适应不足。本工作通过 “通用预训练 + 目标域自监督适应” 的双阶段设计,显著缩小了域间隙。与直接使用源域模型相比,Strong General Model 平均提升显著;加入目标域无标签数据自监督微调后,Specialized Model 进一步挖掘域特有分布,在保持标签零成本的同时逼近有标注微调效果。这表明对实际工程部署,仅需积累少量无标签场景图像即可持续提升模型准确性,大幅降低长期运维的标注负担。
行业影响
落地场景
该自监督停车位占用识别技术可直接嵌入智慧停车与智能交通系统,适用于购物中心、机场、办公园区等大型停车场,以及共享出行、物流配送等依赖临时停车的业务。通过摄像头实时判断车位状态,无需为每个新停车场采集标注数据,即可快速部署。
商业价值
核心商业价值在于大幅降低部署成本与加速上市时间。传统方案需对目标停车场拍摄大量图像并人工标注,成本高且耗时。本方法仅需未标注图像与通用停车场标签,即可获得 97.2% 以上的准确率,两阶段部署更可提升到 97.8%,显著减少人力投入。对于运营方,实时准确的占用信息可提升车位周转率,减少车辆巡游时间,从而降低能耗与排放,改善用户体验并增加停车收入。对于智能停车解决方案提供商,这种标签高效的迁移能力意味着可在全球停车场快速复制,边际成本极低。
与现有产品 / 工作流的接口
模型以 ResNet-50 为编码器,使用 SimCLR 自监督预训练,输出占用概率,可轻松集成到现有视频监控与分析管道。部署流程建议先安装强通用模型,在运行数天后利用收集的未标注图像进行自监督微调得到专用模型,无需额外标注工作。工程上,可将模型封装为 REST API 或部署在边缘设备(如 NVIDIA Jetson)上,直接接入停车管理系统或城市交通控制平台,通过标准协议(如 MQTT、ONVIF)推送车位状态。
具体落地案例
- 智慧零售园区:某大型连锁购物中心在数千停车位上部署摄像头,利用该方案仅需少量通用停车场图像与现场未标注图像即可快速上线,实时引导顾客至空位,减少拥堵并提升消费体验。
- 自动驾驶泊车服务:出行运营商在车队专用站点(如机场接驳区)安装视觉感知单元,通过自监督迁移学习,无需重复标注即可适配不同站点,为自动驾驶车辆提供精准的可用车位信息,优化调度与等待时间。
局限
- **部署冷启动问题**: 方法需要先收集 N 天的目标停车场无标签图像,才能通过自监督微调得到专用模型。在刚安装摄像头或停车场新开放时,无法立即启用最优模型,且论文未量化 N 的最小值对性能的影响。这延缓了系统达到最高精度的速度,对于期望开箱即用的实时监控场景存在实用落差。
- **数据集多样性限制**: 评估仅在 PKLot、CNRPark-EXT 和 PLds 三个公开数据集上进行,采用的 leave-one-out cross-environment 协议虽能测试跨环境泛化,但所有数据均来自固定视角的监控摄像头,未包含极端天气、夜间低光照、密集遮挡或鸟瞰图等复杂现实条件。模型在这些场景下的鲁棒性尚未验证,实际部署时可能面临性能退化。
- **资源需求与效率的权衡**: 自监督预训练和微调阶段均基于 SimCLR 框架与 ResNet-50 骨干,训练过程计算量较大。论文未讨论推理延迟或模型压缩方案,对于需要在边缘设备上实时处理的停车管理系统,直接部署原始模型可能不满足功耗和响应时间要求,限制了其在大规模、低成本摄像头网络中的应用。