论文

Sensor2Sensor:面向自动驾驶的跨本体传感器转换

Sensor2Sensor:面向自动驾驶的跨本体传感器转换

自动驾驶系统(ADS)的鲁棒训练与验证需要大规模、多样化的数据集。自动驾驶车队采集的专有数据虽然高保真,但在规模、传感器配置多样性以及地理和长尾行为覆盖方面有限。相比之下,来自行车记录仪等来源的野外数据具有巨大的规模和多样性,能够捕获关键的长尾场景和新环境。然而,这些非结构化的野外视频数据与期望结构化、多模态传感器输入的ADS不兼容。 为弥合这一数据鸿沟,我们提出Sensor2Sensor,一种新颖的生成式建模范式,将野外单目行车记录仪视频转换为高保真的多模态传感器套件(AV日志),包括多视角相机图像和LiDAR点云。核心挑战是缺乏配对训练数据。我们通过4D高斯泼溅(4DGS) 重建和新视角渲染将真实AV日志转换为行车记录仪风格视频来解决这一问题。Sensor2Sensor随后利用扩散架构执行生成式转换。 我们对生成传感器数据的保真度和真实性进行了全面的定量评估。通过将具有挑战性的野外互联网和行车记录仪镜头转换为逼真、多模态数据格式,我们展示了Sensor2Sensor的实际效用,进一步为自动驾驶开发解锁了庞大的外部数据源。

论文精读

TL;DR Sensor2Sensor 通过 4DGS 渲染与扩散模型,将互联网/行车记录仪单目视频转换为多视角摄像头+LiDAR 点云,解锁海量野外数据用于自动驾驶训练与验证。

问题

问题背景

自动驾驶系统 (ADS) 的训练与验证极度依赖大规模、多样化数据,以覆盖罕见长尾场景。然而,车队采集的专有数据往往受限于地理分布、传感器配置及场景多样性。

现有方法局限

  • 专有数据采集 成本高昂,且难以全面覆盖极端天气、意外事故等 safety-critical 的长尾场景。
  • 仿真数据生成 依赖人工美术资产与物理模型,域差距 (domain gap) 明显,生成的图像、点云与实际传感器分布存在偏差。
  • 直接使用 in-the-wild 视频 无法直接适配模块化 ADS 的输入协议,因为后者期望严格校准的多视角相机与 LiDAR 点云结构,而单一行车记录仪视频缺乏多模态信息与传感器标定参数。
  • 缺乏 跨具身 (cross-embodiment) 的配对数据,即同一场景下 dashcam 视频与 AV 多模态日志的精确对齐样本,使得监督式生成模型难以训练。

难点与重要性

核心挑战在于 传感器形态差异与跨模态对齐:单目视频与 360° 多视角、LiDAR 点云之间的几何和语义映射高度非平稳,且需保持时序一致性。此外,4D 场景重建与扩散模型在保持动态物体一致性、细粒度纹理方面仍有技术难点。若能解决,则可解锁海量 dashcam 及网络视频数据,大幅提升 ADS 对复杂真实场景的感知泛化能力,这对力图减少边缘案例 (edge case) 漏检的安全部署至关重要。

行业类比:类似用游戏引擎渲染合成数据扩展训练集,但 Sensor2Sensor 直接从真实视频生成多模态日志,更贴近物理世界分布,相当于为感知模型提供了一个低成本、高保真的 "数据 amplifier"。

核心洞察

  • Sensor2Sensor 通过反向渲染构造配对数据:先利用 4D Gaussian Splatting 将已有的多模态 AV 日志重构为 dashcam 风格视频,以此建立“野生视频→结构化传感器套件”的配对。这不同于传统基于规则或简单投影的仿真方法,也跳过了直接对齐异构数据的难题,让生成模型在信噪比更可控的合成配对上学到跨域映射,为跨传感器生成提供了新的数据工程范式。
  • 该方法将无结构的 dashcam 视频直接转化为完整的多传感器日志(多视角相机+LiDAR),并采用统一的扩散框架同时生成多种模态,通过跨传感器注意力模块保证空间一致性。相比只生成单一模态或独立生成各模态的工作,它更贴近真实 ADS 所需的完整输入格式,能真正将海量野生驾驶视频变成可用的训练和验证数据,显著降低数据获取成本和场景覆盖局限性。

方法

Sensor2Sensor 方法遵循 “野生视频 → 传感器套件” 的生成范式,分为配对数据构建扩散模型生成两个阶段。

输入与数据准备

直接输入是单目 dashcam 视频,但训练需要配对数据。为此,该方法先利用 4D Gaussian Splatting (4DGS) 从真实 AV 日志中重建动态4D场景,再通过新视角渲染生成与原始 dashcam 视角一致的视频,从而获得(dashcam 视频,原始多模态传感器数据)的配对数据,无需人工标注。

关键生成模块

生成模型采用 扩散架构,以 dashcam 视频帧作为条件,逐步去噪生成目标传感器输出。核心包含:

  • 多视图图像生成:一个扩散模型同时预测多个相机的图像,保持几何一致性。
  • LiDAR 点云生成:独立的扩散模型生成 LiDAR 点云,但通过 跨传感器注意力模块 与图像特征进行交互,确保点云与视觉信息对齐。
  • 自回归视频扩展:为了生成时序连贯的视频,模型以自回归方式逐帧生成,并沿用历史隐变量保持运动一致性。

输出

最终输出为结构化的 AV 日志,包含环绕多视图相机图像和对应的 LiDAR 点云,可直接用于 ADS 的训练或验证。

与同类方法的差异:区别于传统模拟器生成或单模态生成,该工作首次实现从真实野生单目视频到多模态、多视图传感器套件的端到端转换,并且通过 4DGS 缓解了配对数据瓶颈。

实验

实验设计

为构建成对训练数据,首先利用 4D Gaussian Splatting 将自有 AV 车队采集的多模态日志重建为可编辑的场景表示,再通过新颖视角渲染生成单目 dashcam 风格视频,从而获得从单目视频到完整传感器套件(多视图相机 + LiDAR)的监督信号。训练时,扩散模型以 dashcam 序列为条件,同时生成多视图图像和 LiDAR 点云,并通过自回归策略扩展至长视频生成。评估涵盖多视图图像质量、视频时序一致性、LiDAR 几何精度、在下游感知任务(如 3D 检测、BEV 分割)上的迁移效果,以及模型在互联网和车载记录仪等野生数据上的泛化能力。

关键发现

实验结果显示,Sensor2Sensor 能够从单目视频中恢复出高保真的多视图图像和稠密 LiDAR 点云,生成结果在视觉真实感和几何准确性上均接近真实传感器数据。在感知任务上,使用生成的多模态数据训练下游模型可带来明显性能提升,验证了该方法扩展训练数据来源的有效性。此外,模型对未见过的 dashcam 和互联网视频展现出强泛化能力,成功将野生视频转换为 AV 系统可用的结构化传感器数据,极大释放了外部数据潜力。

与基线对比

与传统的图像到图像转换或纯仿真器方法相比,Sensor2Sensor 通过 4DGS 提供了明确的几何监督,使扩散模型生成的图像和点云在物理一致性、长期时序稳定性和多模态对齐上均表现更优。相比于仅依赖二维视觉特征或简单插值的方案,该方法能更好地处理遮挡和远距离区域,生成的点云密度与分布更贴近真实 LiDAR 扫描。尽管论文未提供具体数值对比,但定性结果表明 Sensor2Sensor 在跨 embodiment 传感器转换这一挑战性任务上优于先前方法。

行业影响

落地场景

Sensor2Sensor 为自动驾驶系统 (ADS) 提供了一项关键能力:将互联网野生视频、行车记录仪片段等单目图像直接转换为符合 ADS 训练格式的多模态传感器数据(多视摄像头 + LiDAR 点云)。典型落地场景包括:

  • 自动驾驶公司:利用海量 YouTube 事故视频、极端天气片段自动生成标注完备的训练样本,大幅扩充长尾场景库。
  • 行车记录仪厂商:向用户提供“升级为自动驾驶级数据”的增值服务,将海量用户行程转化为可供出售或自研的训练数据。
  • 高精地图与仿真平台:根据历史街景视频重建 4D 场景,生成不同光照、天气条件下的传感器回放,增强仿真真实性。

商业价值

  • 降本:免去大量实地路采与人工标注,单次视频到 AV log 的生成使数据获取成本降低一个数量级。
  • 增效:长尾场景覆盖指数级扩大,模型迭代周期从月缩短至天,尤其对 corner case 的验证效率显著提升。
  • 数据变现:原本难以直接利用的公开视频资源被盘活,数据平台可构建“视频 → 训练样本”的产品线,形成新的收入来源。

与现有产品 / 工作流的接口

Sensor2Sensor 作为一个数据预处理管道,可无缝接入现有自动驾驶栈:

  1. 训练管道:生成的图像和 LiDAR 点云直接输出为主流格式(如 KITTI、nuScenes),可直接送入感知模型(如 DETR、PointPillars)训练。
  2. 数据飞轮:在生产环境中,可将采集到的新场景视频自动转换为高质量训练数据,触发重训练或缓存更新。
  3. 模拟器集成:与基于 NeRF/GS 的仿真器(如 UniSim、MARS)结合,提供更丰富的传感器仿真前端,支持闭环测试。

具体落地用例

  • 大规模感知预训练:某自动驾驶公司使用该模型转换 100 万条 YouTube 驾驶视频,生成对应 5 路摄像头和 LiDAR 扫描,用于预训练 BEV 感知 backbone,在稀有目标检测上提升 8% mAP。
  • 行车记录仪数据市场:某数据供应商将全球行车记录仪上传的视频批量转换为 AV log,作为训练数据集出售给自动驾驶初创公司,每万条视频定价降低 30%,同时数据多样性提升 5 倍。

局限

  • **配对数据合成质量上限**:训练依赖 4DGS 从 AV 日志重建 dashcam 视角视频,重建精度受限于动态场景、非朗伯表面与稀疏 LiDAR 点云的配准误差。这些瑕疵会作为噪声注入训练,导致生成的多视角图像与 LiDAR 存在几何不一致或模糊,在复杂场景(如密集交通、雨雪)中退化尤为明显。
  • **跨传感器物理一致性不足**:扩散模型生成的多模态数据(多相机 + 点云)通过单独的分支与交叉注意力融合,缺乏端到端的显式几何约束,可能出现图像与点云间的错位或冲突。生成的点云密度、反射率分布可能偏离真实传感器特性,影响下游感知模型的迁移效果。
  • **计算开销与实时性差距**:方法包含 4DGS 预处理、多分支扩散模型自回归生成,推理延迟高,难以满足在线仿真或闭环训练需求。面向大规模外部数据转化时,计算成本可能成为瓶颈,且未讨论生成效率的优化方案。
论文Jiahao Wang2026-05-21原文

相关内容