Qwen-Drive-1.0:迈向自动驾驶视觉语言基础模型的初步步骤
本文提出 Qwen-Drive-1.0,这是迈向自动驾驶视觉语言基础模型的初步尝试。模型保留预训练视觉语言模型(VLM)的架构,将 3D 感知、视觉问答与运动规划统一在同一框架内。 外部 BEV 感知头(bird's-eye-view perception head) 联合执行 3D 目标检测、语义占用预测与 BEV 地图分割,既作为探测共享表征中 3D 信息的探针,又为 3D 场景结构提供显式、可检查的接口。Planning Expert(规划专家) 则基于共享 VLM 表征生成未来自车轨迹。 采用分阶段训练策略:将驾驶专用监督与通用视觉语言数据相结合,在获取驾驶特定能力的同时,尽量保持广泛的视觉理解与指令跟随能力。实验表明,模型在 3D 感知与驾驶场景理解上性能强劲,同时大幅保留了通用视觉语言能力。在开环、伪闭环与闭环设置下的综合评估进一步展示了极具竞争力的运动规划性能。
论文精读
TL;DR Qwen-Drive-1.0 是面向自动驾驶的视觉语言基础模型,通过共享表征统一 3D 感知、视觉问答与运动规划,并采用分阶段训练保留通用视觉语言能力,在感知、理解与规划任务上表现优异。
问题
问题背景
自动驾驶正从模块化流水线走向端到端学习系统,业界关注用视觉语言模型统一感知、推理与规划。
现有方法局限
- 传统方案将检测、跟踪、预测、规划解耦,误差逐级累积,且缺乏自然语言交互与可解释性。
- 已有驾驶 VLM 多数只做高层问答或开环规划,3D 感知 与语言表征割裂,模型无法显式访问 BEV 几何结构,导致规划缺乏可验证的场景结构支撑。
- 多任务联合训练容易灾难性遗忘,通用视觉问答能力与驾驶专用任务难以平衡;数据配方和训练阶段缺失,使得统一的 vision-language foundation model 在驾驶场景中仍稀缺。
为什么难且重要
自动驾驶是安全关键系统,需要 3D 几何精度、语义理解与长时规划在同一表征下协同。异构数据(多视角图像、BEV 标签、自然语言指令、轨迹)难以对齐;模型既要保持通用指令跟随,又要习得驾驶特定能力。业界对 VLMs 能否安全嵌入驾驶栈高度关注,因为它可能同时解决环境理解、人机交互与端到端控制,但容错率极低。
行业类比
类似机器人操作中,视觉-语言-动作模型(VLA),需要同时理解场景、语言指令并输出动作序列;如果模型只做 VQA 或只做轨迹预测,就无法胜任真实部署。Qwen-Drive-1.0 试图在驾驶域提供类似 VLA 的统一框架,其 BEV 感知头 作为可审查的 3D 接口是一个关键差异。
核心洞察
- 将外部 BEV 感知头定位为 3D 信息探针而非主任务输出,强制共享 VLM 表征编码场景几何,同时避免 3D 任务主导优化导致通用视觉语言能力退化。与直接将 BEV 特征注入大语言模型或把检测结果序列化为文本 token 的同类工作相比,该探针仅作为辅助监督接口,提供显式、可检查的 3D 场景结构,使工程师能诊断模型是否真正理解几何关系,而不仅是文本对齐。
- 分阶段训练配方逐步注入驾驶监督:先预训练 BEV 感知头,再联合视觉问答,最后训练规划专家并强化学习,同时持续混入通用视觉语言数据。这与常见端到端微调 VLM 导致指令跟随能力显著下降不同,它在每个阶段保留通用数据流并控制任务权重,实现驾驶专项能力与通用对话能力的增量叠加,为多任务 VLM 适配提供了可复用的工程范式。
方法
输入与表示
- 多视角、多帧图像序列作为视觉输入,配合自然语言问题或指令。
- 共享的 VLM 骨干 保留预训练架构,输出统一多模态表示。
关键模块
- BEV 感知头:外部 head 联合执行 3D 目标检测、语义占用预测、BEV 地图分割;作为 3D 信息探针,提供可检查的 3D 场景结构接口。
- Planning Expert:条件于共享 VLM 表示,生成未来自车轨迹。
输出与训练
- 输出包括 3D 感知结果、VQA 文本回答、规划轨迹。
- 训练分四阶段:1) 感知头预训练;2) 感知与 VQA 联合训练;3) Planning Expert 预训练;4) 强化学习。
- 数据配方:感知数据标签统一与空间统一;视觉语言数据混合通用与驾驶数据;规划数据专门用于后两阶段。
与同类方法不同,Qwen-Drive-1.0 不是简单将 VLM 用于驾驶问答或端到端规划,而是通过显式 BEV 感知头将 3D 结构信息注入共享表示,并在分阶段训练中兼顾驾驶任务与通用视觉语言能力,形成可解释、多任务统一的自动驾驶基础模型。
实验
实验设计
Qwen-Drive-1.0 的评估覆盖三个维度:3D 感知、视觉问答(VQA) 与 运动规划。感知部分通过外部 BEV 感知头 联合执行 3D 目标检测、语义占用预测和 BEV 地图分割,该感知头作为共享表征中 3D 信息的探针。VQA 部分同时评测驾驶场景理解(如 LingoQA、PAI-AV-CoC、Ego3D-Bench、VLADBench)与通用视觉语言能力。规划部分则在开环、伪闭环和闭环三种设定下验证,其中闭环评估使用 NAVSIM 等模拟环境。
关键发现
- 模型在 3D 感知任务上表现强劲,说明共享 VLM 表征中保留了足够的 3D 几何与语义信息。
- 驾驶场景 VQA 性能优秀,能处理时序理解、因果推理、跨视角空间感知和交通道路识别等复杂问题。
- 通用视觉语言能力基本保留,分阶段训练未造成灾难性遗忘。
- 运动规划在开环、伪闭环、闭环设定中均达到高度竞争力,闭环验证了从感知到规划的端到端可行性。
基线对比解读
摘要未给出具体基线名称与数值,仅以 “highly competitive” 表述。结合文中提到的对比方法,推测基线可能包括 DriveLM、DriveVLM 等驾驶 VLM 或 UniAD 等端到端规划模型。深度解读需查阅原文表格,但闭环评估的设计本身已高于多数现有工作(仅开环或伪闭环),体现出对实际部署的重视。
行业影响
落地场景
Qwen-Drive-1.0 适用于乘用车辅助驾驶、Robotaxi、无人配送等产品的感知-规划一体化栈,也可用于自动驾驶数据闭环中的自动标注、场景检索与仿真评测。
商业价值
通过统一 VLM 架构替代分立感知、规划、VQA 模块,降低多模型集成与维护成本;BEV 感知头 输出的显式 3D 结构可减少人工质检与标注投入;保留通用 VLM 能力使系统能理解长尾场景(如施工、交通标志),提升 ODD 扩展效率与安全性,进而支撑更高阶自动驾驶功能的付费订阅或保险降费。
接口与集成
模型可插入现有自动驾驶软件栈:BEV 特征作为中间表示 对接下游规划控制模块,Planning Expert 可直接输出轨迹供 MPC/控制模块使用;VQA 通道可集成至数据挖掘平台、仿真闭环评测工具,提供自然语言查询与解释。分阶段训练策略允许复用企业已有感知标注与通用 VLM 权重。
具体用例
- 某自动驾驶公司开发城市 NOA 功能:用 Qwen-Drive-1.0 的 BEV 感知头替代原有多任务检测/分割网络,同时利用 VQA 对路测数据中的复杂场景(如临时路障、交警手势)进行自动归因与标签生成,加速数据闭环迭代。
- 仿真平台公司:将模型作为驾驶场景理解与规划生成器,输入多视角视频与语言指令,在闭环仿真中生成多样化、可解释的自车行为,用于评测其他规控算法。
局限
- - **推理延迟与实时性未充分验证**:论文集成了外部 BEV 感知头、Planning Expert 与 VLM 主干,但未报告端到端推理延迟或计算开销。自动驾驶对毫秒级响应要求苛刻,VLM 的 token 级轨迹生成及多帧多视图输入预处理可能成为工程落地的瓶颈。与专用感知模型和经典 planner 相比,该方法在资源受限的车载平台上是否具备实时性存疑,文中缺乏与现有部署方案的效率对比。
- - **闭环评估的真实性与泛化性受限**:闭环实验主要在仿真器中进行,且未明确说明场景多样性或里程碑密度。开放环与伪闭环指标无法完全覆盖真实驾驶中的动态交互与罕见事件。Planning Expert 依赖共享 VLM 表示,对上游感知误差的鲁棒性未做分析,误差传导可能导致高风险决策。显式 BEV 头虽提供可解释的 3D 结构接口,但也可能限制端到端策略的学习自由度,与纯隐式方法相比存在表达力权衡。
- - **数据配方与奖励设计的过拟合风险**:分阶段训练结合 RL 时,奖励定义分别针对 NAVSIM、WOD-E2E、PAI-AV 等基准定制,可能过度适配特定评测协议。通用 VLM 数据与驾驶数据的混合比例、RL 阶段的仿真交互均需大量人工调参,若缺乏真实世界反馈,模型容易学到仿真特异的策略,sim-to-real gap 未被充分验证。