DriveZero: 超越人类演示的端到端驾驶
多数 端到端自动驾驶 系统依靠模仿人类驾驶日志来学习,其行为因此被记录轨迹的质量与行为覆盖范围所限制。本报告提出 DriveZero,一个能够学习超越人类演示的驾驶行为的端到端系统。它把驾驶拆解为感知模型与动作模型,分别在最适配的范式下预训练,再合并为统一的端到端规划器。两类模型需要不同的学习配方: - 感知模型 必须理解世界,因而受益于海量、多样的视觉数据; - 动作模型 必须与世界交互,因而需要闭环反馈。 在动作侧,作者提出 DriveRL,一个混合智能体闭环 强化学习 框架。它把真实驾驶日志转换为可交互世界,在其中通过闭环 rollout 用 PPO 训练一个拥有特权信息的教师策略。在感知侧,DriveVFM 将 DINOv3、SigLIP2、SAM 与 Depth Anything V2 等多个冻结视觉基础模型整合为单一 backbone,仅依赖原始图像,无需任务特定标注。DriveZero 进而统一二者:一个纯相机规划器通过 rollout 轨迹蒸馏冻结的 DriveRL 教师。此外,该目标条件教师可在增强的驾驶意图下被查询,产生日志数据无法提供的多样且目标一致的监督信号。 在 nuPlan 上,DriveRL 配合值引导的测试时动作搜索,在 Val14、Test14-hard、Test14-random 三个社区划分上于非反应式与反应式两种模式下取得 93.57 的平均分,在全部三个划分上超过 Log-Replay 专家。DriveZero 在 NAVSIMv1、NAVSIMv2 以及闭环 HUGSIM 基准上取得 SOTA,且完全不依赖人类轨迹监督。
论文精读
TL;DR DriveZero 将视觉基础模型感知与闭环强化学习动作模型结合,不依赖人类轨迹监督,学习超越人类演示的端到端驾驶策略,在 NAVSIM、HUGSIM 等多个基准达到 SOTA。
问题
问题背景
端到端自动驾驶旨在从原始传感器输入直接映射到车辆控制,核心挑战是学习超越人类演示的驾驶行为。当前领域普遍采用模仿学习,利用人类驾驶日志训练模型。
现有方法局限
模仿学习范式 存在两个关键限制:其一,模型行为上限被人类轨迹质量与覆盖范围约束,难以处理长尾交互场景(如激进并线、非反应性交通参与者);其二,日志数据仅提供静态状态-动作对,无法提供闭环反馈,导致策略在部署时容易产生累积误差。一些工作引入 闭环强化学习,但受限于高维视觉输入的样本效率与稀疏奖励,通常需要复杂的特权信息或仿真环境。
为什么难/重要
该问题在工程中至关重要:感知模型 需要从海量多模态数据中提取通用表征,动作模型 则需要与环境交互获得反馈,两者学习范式差异大,如何在单一端到端系统中高效统一且不牺牲性能是公认难点。此外,真实驾驶环境复杂多变,单纯依赖人类日志无法覆盖所有安全关键场景,亟需能够生成多样化、目标一致的监督信号的方法。
行业类比
类似机器人操作中从人类远程操作演示向强化学习自主探索的演进,自动驾驶也正在从“演示上限”走向“闭环 RL 超越人类”。
核心洞察
- - **感知与动作分解**:DriveZero 将端到端驾驶拆分为感知模型(DriveVFM)和动作模型(DriveRL),分别采用视觉基础模型蒸馏和闭环强化学习预训练,最后蒸馏为统一相机输入 planner。 相比传统模仿学习直接从人类日志学习,或端到端 RL 难以稳定优化感知模块,DriveZero 利用视觉基础模型提供通用视觉表征,用闭环 RL 产生超越演示的交互数据,解决了感知泛化与行为覆盖的矛盾。
- - **目标条件 teacher 与目标增强**:DriveRL 训练的 goal-conditioned policy 可以在不同驾驶意图下查询,生成目标一致的轨迹,从而为 DriveZero 提供超越原始日志的行为多样性。 以往从 teacher 蒸馏通常使用 teacher 在训练分布下的 rollout,行为多样性受限于初始目标设定;DriveZero 通过 augment goals 让 teacher 产生更多样但合理的轨迹,学生模型因此学习到更广泛的安全驾驶策略,尤其在没有人类轨迹覆盖的场景中表现出色。
- - **价值引导的测试时动作搜索**:DriveRL 在推理时采用 value-guided test-time action search,结合策略提议的候选动作和短时闭环价值评估,保守选择最终动作。 与常见的测试时数据增强或模型集成不同,这种方法利用学习到的价值函数做在线决策优化,不增加训练成本但大幅提升 nuPlan 分数(93.57),甚至超过 Log-Replay expert,展示了 RL 在自动驾驶推理阶段的可扩展性。
方法
输入与感知管线
DriveZero 的输入仅为原始相机图像,不依赖人工标注轨迹。系统首先通过 DriveVFM 将多个冻结的视觉基础模型(DINOv3、SigLIP2、SAM、Depth Anything V2)蒸馏到一个统一骨干网络,输出兼顾语义、几何与分割能力的特征表示。该感知模块无需任务特定标注,从海量异构视觉数据中预训练得到。
关键模块:DriveRL 教师
在动作侧,DriveZero 引入 DriveRL 框架,将真实驾驶日志转化为可交互的混合智能体仿真环境,用PPO 从头训练一个具有特权结构化输入的目标条件教师策略。教师策略输出 Beta 动作分布,并通过闭环 rollout 优化累计奖励。推理时使用价值引导的测试时动作搜索——利用策略生成候选动作,通过短视界闭环评估与奖励一致性评分,保守地选择最终动作,提升可靠性与泛化性。
输出与端到端蒸馏
DriveZero 将 DriveVFM 感知骨干与蒸馏头结合,构成仅依赖相机的端到端规划器。监督信号来自冻结的 DriveRL 教师生成的闭环轨迹,并可通过目标增强——在推理时查询不同驾驶意图(如变道、跟车距离变化),产生多样且目标一致的训练样本,突破人类日志的行为覆盖限制。
与模仿学习类方法相比,DriveZero 通过闭环 RL 教师与目标增强蒸馏,显式地引入了超出人类示范的驾驶策略空间,而非单纯拟合已有轨迹。
实验
实验设计
- DriveRL 作为特权教师策略,在 nuPlan 的
Val14、Test14-hard、Test14-random三个社区划分上评估,同时覆盖非反应式与反应式模式,并引入价值引导的测试时动作搜索。 - DriveZero 作为仅摄像头输入的端到端学生模型,在 NAVSIMv1、NAVSIMv2(伪闭环)和 HUGSIM(真闭环)上评测,全程无人类轨迹监督。
- 消融实验验证视觉基础模型蒸馏、教师贡献、轨迹蒸馏与目标增强的有效性。
关键发现
- DriveRL 在 nuPlan 平均得分 93.57,超过 Log-Replay 专家,表明闭环 RL 可超越人类示范。
- DriveZero 在三个 benchmark 上取得 SOTA,证明教师蒸馏与多视觉基础模型融合的感知能力可支撑闭环驾驶。
- 目标增强与轨迹蒸馏显著提升学生模型泛化,DriveVFM 的特征表示可视化显示出对场景语义的强判别能力。
与基线对比
与模仿学习的 Log-Replay 基线相比,DriveZero 的核心差异在于闭环交互式学习替代被动模仿:教师通过 RL 与环境互动获取超越日志分布的驾驶策略,学生再通过蒸馏继承该能力。视觉基础模型蒸馏进一步降低对标注数据的依赖,使系统能够处理未见场景。这一路径表明端到端自动驾驶的上限不再受限于人类数据质量,而是由环境交互与感知泛化共同决定。
行业影响
落地场景
DriveZero 的 闭环强化学习教师 + 视觉基础模型蒸馏 范式可直接用于自动驾驶公司的端到端规划模块,覆盖 L2+ 领航辅助驾驶到 L4 Robotaxi 场景。具体 use case:
- 自动驾驶数据闭环:利用 DriveRL 将真实日志转为交互环境,产出超越人类示范的合成轨迹,用于扩充训练集或仿真测试。
- 端侧部署:DriveZero 的摄像头学生模型可在车规芯片上运行,替代传统感知-规划-控制流水线,降低系统复杂度。
商业价值
降本:不再依赖海量人工标注轨迹,RL 自博弈生成监督信号,可显著削减数据标注和采集成本;体验提升:nuPlan 93.57 分、NAVSIM/HUGSIM SOTA 表明规划策略更安全、更稳健,尤其在非反应性场景;增收:对自动驾驶解决方案供应商,更高水平的功能可提升产品溢价和量产竞争力。
与现有产品/工作流的接口
集成路径清晰:
- 感知层:DriveVFM 输出特征可直接替换现有 BEV/Occupancy 网络主干,无需任务特定标注,兼容多相机配置。
- 规划层:DriveZero 学生模型可部署为端到端规划器,或保留中间潜空间与经典 MPC/PID 融合,便于安全兜底。
- 仿真/训练平台:DriveRL 框架可对接 nuPlan、CARLA、HUGSIM 等仿真器,作为离线 RL 数据工厂。
另一 use case:在具身智能或机器人导航中,类似 RL 教师 + 视觉预训练蒸馏的框架可迁移到室内/室外移动机器人,快速产出超越遥操作数据的导航策略。
局限
- **训练数据依赖真实日志**:DriveRL 将真实驾驶日志转换为交互世界,但日志的覆盖范围和场景多样性会限制策略探索的上限。虽然论文称超越人类演示,但若原始日志缺乏罕见场景(如极端天气、突发事故),生成的交互环境也难以覆盖这些长尾情况,导致策略在真实世界中可能失效。相比纯模拟器自动生成场景的方法,该方法受限于日志的质量和数量。**工程启示**:实际部署时需结合场景增强或合成数据来稀释对真实日志的依赖。
- **多视觉基础模型集成带来计算开销**:DriveVFM 同时整合了 DINOv3、SigLIP2、SAM 和 Depth Anything V2 四个冻结基础模型,虽然不需要任务标注,但推理时需要同时运行四个大模型,显著增加了计算和内存成本,可能影响实时性。与端到端直接优化轻量骨干的方法(如 UniAD)相比,部署成本可能更高。**工程启示**:需要针对车载硬件做蒸馏或量化,在精度和速度之间权衡。
- **闭环 RL 训练的稳定性与 sim-to-real 差距**:DriveRL 使用 PPO 在闭环模拟中训练特权教师,但强化学习训练本身对超参数敏感,且模拟器动力学与真实车辆存在差异。论文虽然在 HUGSIM 等基准上取得 SOTA,但 HUGSIM 仍是模拟环境,真实道路验证可能有限。与模仿学习相比,RL 训练需要更多的交互样本和工程调优,训练成本更高。**工程启示**:在资源有限的情况下,可能需要先通过模仿学习初始化策略,再使用 RL 微调。