PKINet-v2 遥感目标检测模型发布,推理速度提升近4倍
PKINet-v2 用可重参数化的多形状卷积核解决了遥感目标检测的尺度与几何多样性难题,在精度和速度上同时取得显著进步。
遥感图像中目标大小悬殊、方向任意,检测模型常需平衡精度和速度。PKINet-v2 通过让卷积核同时支持条带和方形形状,并在训练后合并成单一大核,在 DOTA-v1.0 上精度提升 2 个 mAP 点,推理速度提升至 4 倍,参数量基本不变。
正文摘录
 新智元报道  【新智元导读】 卫星和航空影像里的目标,不仅大小相差悬殊,还可能朝向任意方向:一边是细长的桥梁、船舶,一边是密集的小车和大面积运动场。PKINet-v2 是一种改进的遥感目标检测模型,能同时处理复杂形状和尺度变化的问题。 自然图像里的物体通常有较稳定的拍摄视角,遥感影像则不同。 一张高分辨率卫星图中,可能同时出现接近圆形的储罐、狭长的桥梁和船舶、密集排列的小汽车,以及占据大面积区域的足球场。它们的方向可以任意旋转,尺寸也可能从不足 10 像素的小目标跨越到覆盖大范围的场地目标。 这带来两类问题: 几何复杂性: 目标朝向和长宽比变化很大,细长目标尤其需要沿主轴方向聚合信息; 空间复杂性: 目标尺度跨度极大,模型既要保留小目标纹理,又要看到大范围上下文。 只使用条带卷积,虽然有利于描述桥梁、船舶等细长结构,却可能破坏规则目标的二维空间连贯性,并丢失微小目标的局部细节;只使用方形大核,可以扩大观察范围,却容易在细长目标周围引入更多背景噪声。 换句话说,遥感检测需要的不是一把固定形状的「放大镜」,而是一组能够随目标形态和尺度协同工作的观察窗口。 也就是说,遥感检测模型常常面临一个现实取舍:想让网络「看得更远、更细」,通常要付出更多计算;想跑得更快,又可能损失复杂场景下的检测精度。 南京理工大学、浙江大学等最新提出 PKINet-v2 同时满足了这两个看似互相矛盾的要求。