北航清华等提出 DriveTeach-VLA,用图像轨迹提升自驾模型规划性能
这篇论文提出一种训练自驾 VLA 的新方法,通过视觉蒸馏和图像轨迹预测,让模型真正学会“看路开车”,性能刷新了 NAVSIM 榜单。
自动驾驶 VLA 模型(视觉-语言-动作模型,直接根据视觉输入输出驾驶动作)往往只学语言推理,却不知道开的时候该看哪。DriveTeach-VLA 用两招解决:先让模型关注车辆、行人等关键要素,再把未来轨迹画到图像上教它看路,在 NAVSIM 上取得 92.7 的 PDMS(驾驶性能指标),达到当前最好水平。
正文摘录
.jpg)  论文的团队来自于清华大学产业研究院(AIR),滴滴,北京航空航天大学。团队近年在自动驾驶与具身智能领域发表论文数十篇,并和国内外知名高校、科研机构广泛开展合作。 该论文的第一作者为杨予光,北京航空航天大学博士研究生,研究方向为自动驾驶与具身智能,提出首个 MLLM 原生自动驾驶模型 CuriousVLA,也是当前自动驾驶领先模型 CLOVER 的重要贡献者。迄今已在 ICLR、NeurIPS、CVPR、ICCV、ECCV 等顶级会议发表论文 7 篇,长期担任相关顶会审稿人,并获 CCF 中国计算机学会年度应用奖励。 本文主要介绍来自该团队的最新论文 Teaching Vision-Language-Action Models What to See and Where to Look,目前该论文已经被 ECCV 2026 正式接收,相关代码和模型已全部开源。 该工作聚焦于自动驾驶场景中的自回归型 VLA 模型的训练,主要的观点是现有 VLA 的交通相关数据在很大程度上依赖以文本为中心的视觉问答和思维链推理数据,这类数据更强调语言推理,而非基于动作的规划。为解决这一问题,该工作提出利用交通要素蒸馏的方式纠正 VLA 模型的关注要素,使其更加关注视觉要素;同时,该工作还提出了一种将 BEV 轨迹映射到图像像素空间进行学习的技术,这能够充分利用基模已有的视觉能力,使轨迹内在的空间含义对模型更加可理解。