面向实时且自适应的 LiDAR 场景补全
LiDAR 场景补全是自动驾驶 3D 感知的关键组成部分,场景必须实时完成才能用于下游任务。现有方法通常遵循“初始化-细化”范式:先构建场景的粗糙初始化,再细化为完整的 3D 几何。生成式方法较慢,因为它们迭代地将随机高斯噪声细化为场景;而非生成式方法使用固定噪声尺度扰动部分场景,这限制了对大间隙和遮挡区域的覆盖,并且需要针对每种新传感器配置手动重新校准。 我们提出 RapidLiDAR,一种将初始化本身视为可学习数据驱动组件的 LiDAR 场景补全方法。我们提出一个 自适应初始化模块,为每个部分输入点预测空间变化的位移,将部分观测扩展为适应局部几何的粗糙场景初始化,无需手动噪声调整。为了将该粗糙初始化细化为完整且连贯的场景,我们还提出一个 多尺度重建模块,通过查询从输入扫描构建的多尺度 3D voxel 和 2D BEV 特征图来进一步细化点位置。通过用基于 voxel 和 BEV 的特征提取替代最远点采样 (farthest point sampling) 和 k 近邻搜索 (k-nearest neighbor search) 等点邻域算子,我们的架构更快,并且可以处理不同输入分辨率。 在 SemanticKITTI 和 KITTI-360 上的实验表明,我们的方法达到了与最先进方法相当的补全性能,同时在 0.1 秒内完成整个场景,比最快先验方法快 2.3 倍。这匹配了典型车载 LiDAR 传感器的 10 Hz 采集率,向实时 LiDAR 场景补全迈出了一步。
论文精读
TL;DR RapidLiDAR 将 LiDAR 场景补全的初始化变为可学习的自适应位移,配合多尺度体素/BEV 特征,以 0.1 秒完成 SOTA 级补全,速度比最快已有方法快 2.3 倍。
问题
问题背景
自动驾驶的 3D 感知要求对稀疏 LiDAR 扫描进行场景补全,以生成密集几何供下游任务使用。当前领域关注如何在不牺牲精度的前提下实现实时处理。
现有方法局限
现有方法多采用初始化-细化范式。生成式方法从随机噪声迭代去噪,推理耗时长,难以满足车载传感器 10 Hz 的采集频率;非生成式方法则用固定噪声尺度扰动部分输入来生成初始化,这导致:
- 对大面积遮挡或稀疏区域的覆盖不足,补全质量受限;
- 更换传感器配置时需手动重新标定噪声参数,缺乏适应性;
- 常用点邻域算子如最远点采样 (FPS) 和 k 最近邻 (k-NN) 计算开销高,且对不同输入分辨率不灵活。
为什么这个问题难且重要
场景补全需同时满足几何完整性与实时性:输入稀疏、遮挡随机、传感器差异大,固定的初始化策略难以泛化;而实时性要求单帧处理时间 ≤0.1 秒,传统点云处理流程的图结构搜索成为瓶颈。业界对可部署的实时补全方案需求迫切,因为它直接决定下游检测、分割的可靠性,但现有方法要么速度不够,要么泛化性差。
行业类比
这类似于实时图像超分辨率需要摆脱固定上采样核,而让网络自适应预测像素位移——LiDAR 补全也需要数据驱动的自适应初始化 来替代人工噪声调参。
核心洞察
- 自适应初始化将传统“固定噪声扰动”转变为可学习的空间位移预测,使初始化阶段能根据局部几何自动扩展部分观测,从而无需手动调整噪声尺度,且能覆盖大间隙与遮挡区域。这一设计区别于生成式模型逐层去噪的慢速迭代,也优于非生成式方法中单一噪声尺度导致的覆盖受限和传感器适配问题,显著提升了初始化的适应性与泛化能力。
- 使用多尺度 3D 体素与 2D BEV 特征代替点邻域操作(如 FPS 和 KNN),从根本上消除了传统点云完成方法中最耗时的邻域搜索步骤,同时天然支持不同输入分辨率。该方法在保持与 SOTA 相当的完成精度前提下,将完整场景推理时间压至 0.1 秒,比此前最快方法快 2.3 倍,首次将 LiDAR 场景完成推进到与传感器采集频率(10 Hz)匹配的实时水平。
方法
方法流程
输入:单帧 LiDAR 部分观测点云(包含由遮挡、稀疏采样导致的大面积缺失)。
多尺度特征提取:首先从原始扫描构建多尺度 3D 体素特征图 和 2D BEV 特征图。这些特征图由卷积网络生成,为后续初始化与重建提供多分辨率、上下文感知的几何描述,避免显式使用点邻域搜索。
自适应初始化模块:对每个部分输入点,通过解码其对应特征,预测一个空间变化位移向量。将所有点的位移叠加到原位置,将稀疏观测扩展为粗略的完整场景初始化。该位移由网络根据局部几何自适应学习,无需手动设置固定噪声尺度,从而覆盖不同大小的空洞与遮挡区域。
多尺度重建模块:将粗略初始化点云投影到体素与 BEV 特征图中,查询多尺度特征,并逐点更新其位置,逐步细化得到完整、连贯的 3D 场景几何。整个过程通过重建损失(如 Chamfer Distance)端到端训练,但论文未给出具体公式。
输出:与传感器帧率匹配的完整场景点云。
差异点:与先前方法不同,RapidLiDAR 用体素/BEV 特征查询替代 farthest point sampling 与 k-nearest neighbor search,显著降低计算开销并天然支持不同输入分辨率。
实验
实验设计
在 SemanticKITTI 和 KITTI-360 两个自动驾驶 LiDAR 数据集上评估,覆盖不同传感器配置和场景复杂度。对比方法包括生成式模型(基于扩散等)与非生成式方法(固定噪声扰动)。评估指标兼顾补全精度与效率,重点衡量全场景补全的端到端推理时间。
关键发现
RapidLiDAR 在补全质量上与当前最优方法相当,但推理速度显著提升:完成单个场景仅需 0.1 秒,是此前最快方法的 2.3 倍。这一速度与典型车载 LiDAR 的 10 Hz 采集频率匹配,使实时场景补全成为可能。速度优势源于用 voxel 与 BEV 特征提取 替代了 farthest point sampling 和 k-NN 等点邻域算子,同时自适应初始化模块避免了手动噪声调参。
基线对比解读
相比生成式模型,RapidLiDAR 避免了从随机高斯噪声逐步迭代,直接学习自适应位移初始化,显著降低了计算成本;相比固定噪声的非生成式方法,其数据驱动的空间变化位移能更好覆盖大空洞与遮挡区域,且无需针对新传感器重新标定。这一设计在精度与速度之间取得了务实平衡,为实际部署提供了可扩展性。
行业影响
落地场景
RapidLiDAR 适用于自动驾驶感知栈中的实时场景补全,可直接嵌入车载 LiDAR 点云处理流水线。典型产品包括 L3/L4 自动驾驶系统、高精地图众包更新、以及机器人导航的 3D 环境建模。其 0.1 秒完成全场景补全的能力,匹配 10 Hz 传感器帧率,能够为下游检测、分割、占用网格预测提供更完整的几何输入。
商业价值
- 降本:替代传统多帧累积或昂贵的高线束 LiDAR,用低线束传感器加补全模型即可获得稠密点云,降低硬件成本。
- 增收:软件授权模式可向车企或 Tier 1 供应商提供实时补全模块,作为感知软件栈的增值组件。
- 体验提升:在复杂城市道路中,实时补全被遮挡的行人、车辆,可改善 AEB 和规划决策的可靠性,直接提升安全性和用户信任。
原作者强调:该方法无需手动噪声调参,自适应初始化覆盖大尺度空洞,更适合多传感器配置的快速迁移。
与现有工作流集成
现有自动驾驶感知栈普遍使用 点云体素化 + 3D 骨干网络 或 BEV 特征。RapidLiDAR 的多尺度 3D voxel 与 2D BEV 特征提取可无缝对接主流检测头(如 CenterPoint、BEVFormer),且无需 farthest point sampling 和 kNN 等点邻域算子,在 TensorRT 或 ONNX 部署时更易优化。集成路径:
- 输入原始 LiDAR 帧,经过 RapidLiDAR 输出完整点云;
- 将补全点云输入现有 3D 检测或占用网络,或直接使用其 BEV 特征图作为附加输入;
- 模型可通过蒸馏或联合训练与下游任务对齐。
具体用例:某自动驾驶公司的多传感器融合方案中,使用低线束 LiDAR 降低成本,RapidLiDAR 实时补全远距离车辆和行人,使 3D 检测召回率提升,同时保持 10 Hz 帧率;另一个用例是机器人配送车在园区环境实时构建稠密 3D 地图,用于避障和路径规划。
局限
- - **泛化性有限**:论文仅在 SemanticKITTI 和 KITTI-360 两个室外自动驾驶数据集上验证,未在室内场景或不同 LiDAR 传感器配置(如固态、低线束)下测试。虽然方法声称无需手动噪声调参,但跨传感器、跨场景的适应性仍需实验证明,实际部署时可能面临鲁棒性挑战。
- - **点密度不增**:自适应初始化模块通过对每个部分输入点预测空间位移来扩展场景,本质上只是移动原始点,并未显式生成新点或增加点密度。在完全遮挡区域或大空洞处,可能因缺乏局部原始点而无法产生合理的几何结构,限制了补全的覆盖范围和稠密度。
- - **精度与延迟评估不完整**:推理时间 0.1 秒/场景仅统计网络前向过程,未包含数据预处理、体素化与 BEV 特征提取等完整管线延迟,端到端延迟可能更高。同时论文报告的性能与现有方法持平而非超越,说明精度仍有提升空间,未来可能需要结合生成式先验以增强细粒度重建。