论文

Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs

Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs

近期用于自动驾驶(AD)的视觉-语言-动作(VLA)模型越来越多地利用思维链(CoT)监督来增强其视觉-语言模型(VLM)组件的推理能力,然而现有标注流程通常会让教师模型接触到记录的真实(GT)未来轨迹。 我们通过实验表明,这会导致轨迹锚定偏差:教师模型会合理化已揭示的结果,而不是根据场景证据推断决策,从而产生因果性较弱的CoT,并显著加剧幻觉,尤其在因果挑战性场景中。移除GT轨迹可以消除这一捷径,但开放式的轨迹生成将高层决策与精确的几何合成和低层动力学纠缠在一起。为了在不要求开放式轨迹合成的情况下使轨迹级驾驶决策可验证,我们引入了自动驾驶多项选择题(AD-MCQ),将规划转化为在显式轨迹候选项中进行选择。更进一步,我们提出DEFT-RLVR(Deferred Exposure of Future Trajectories for RLVR),将未来轨迹从决策前锚点转化为决策后验证目标。 实验结果表明,DEFT-RLVR 在提升AD推理能力的同时,保持甚至增强了通用视觉能力。凭借仅VLM推理和通过候选构造实现的可控难度,AD-MCQ 为未来可验证AD推理研究提供了灵活、可扩展且可扩展的基础。

论文精读

TL;DR 在自动驾驶 VLM 中,将未来轨迹从决策前锚点转变为决策后验证信号(DEFT-RLVR),配合多选题式规划(AD-MCQ),消除了捷径偏差,提升了因果忠实推理,且不损害通用视觉能力。

问题

自动驾驶视觉语言模型 (VLM) 近期通过链式推理 (CoT) 提升决策可解释性与安全性,但如何训练出真正具备因果推理能力的模型仍是核心挑战。

现有 VLA 模型在训练时常将真实未来轨迹 (GT) 直接暴露给教师模型作为推理监督,这导致严重的 轨迹锚定偏差 (Trajectory Anchoring Bias) :模型倾向于为已知结果“编造”看似合理的推理过程,而非从场景证据出发进行推断。这种后见之明式的训练会降低推理的因果忠实度,并在复杂场景下引发更严重的幻觉。相反,若移除 GT 轨迹而要求模型直接生成未来轨迹,又会将高层决策与低层几何/动力学建模纠缠在一起,不仅生成难度陡增,更缺乏可靠的验证手段来衡量生成的轨迹是否与内在推理一致。

该问题的难点在于:自动驾驶对安全性要求极高,推理失误或幻觉可能直接导致灾难性后果;而传统监督信号无法区分“真推理”与“合理化捷径”。业界迫切需要一种既能避免锚定偏差,又能对模型推理过程进行可验证评估的框架,同时还要保证训练过程不会损害模型的通用视觉能力,这构成了一个多重约束下的基础性难题。

类似将大语言模型用于数学证明:若直接给出最终定理让模型“补写”中间步骤,模型极易生成看似正确实则因果断裂的解释;唯有要求模型独立推导且每一步可验证,才可能获得真正可信的推理。

核心洞察

  • **暴露未来轨迹会诱导“轨迹锚定偏见”,破坏推理的因果忠实性。** 现有 VLA 模型在 CoT 标注中直接将真值未来轨迹提供给教师模型,导致模型不是从场景证据中推导决策,而是被动地合理化已知结果。本文第一次通过对照实验量化这种偏见,证明它会显著加剧幻觉,且在因果挑战场景中尤为严重。这一发现提醒从业者:看似无害的监督信号可能引入难以察觉的捷径,使得推理过程形同虚设。
  • **通过将规划转化为选择题(AD-MCQ)并延迟暴露未来轨迹(DEFT-RLVR),首次实现可验证的驾驶推理优化。** 移除未来轨迹虽能消除锚定偏见,但开放式轨迹生成会耦合高层决策与低层几何合成,难以评估推理质量。DEFT-RLVR 将未来轨迹从决策前的“锚点”变为决策后的“验证目标”,结合结构化评分准则对推理链进行强化学习微调,在提升驾驶推理的同时不损害通用视觉能力。该方法为端到端自动驾驶提供了一种可扩展、易控难度的推理验证框架,避免了现有蒸馏方法因过度专业化而牺牲通用能力的通病。

方法

输入与任务构建

方法以 驾驶场景多模态数据(前视图像、历史状态、高层指令)和一组 离散轨迹候选 为输入。首先将原始连续轨迹空间通过向量量化构建为一个固定规模的 轨迹原型码本,每个原型代表一种典型行车意图与几何模式。针对每个训练场景,从码本中采样或检索出若干候选,包含一条正确的未来轨迹(来自记录)和若干难例干扰项,形成 AD-MCQ 选择题:模型需从候选集中选出最优轨迹,并输出相应的推理链。

关键模块:DEFT 与两阶段交互

核心设计是 DEFT(Deferred Exposure of Future Trajectories),其将未来轨迹从“预决策锚点”转变为“后决策验证目标”。具体流程分为两个阶段:

  • 推理与选择阶段:VLM 仅基于当前场景证据(不含未来 GT 轨迹)生成思维链,并从候选集中预测最佳轨迹。此时未来信息被完全隔离,迫使模型从因果关联中推导决策,而非反向合理化已知结果。
  • 验证与奖励阶段:将隐藏的未来轨迹暴露给一个冻结的验证模块,与模型预测的轨迹及推理过程进行对比。通过 结构化评分规则 计算奖励信号,包括:R_MCQ 评估轨迹选择是否正确,R_GEN 衡量推理质量(如是否避免幻觉、是否关注关键物体),以及候选级别的距离度量。

两阶段交互通过 RLVR(强化学习与可验证奖励)进行联合优化。模型参数以策略梯度方式更新,使推理-选择策略最大化期望奖励。这种后验验证避免了传统 CoT 监督中 GT 轨迹泄露导致的锚定偏差,同时所需信号仅为可自动计算的答案正确性与推理合理性,无需稠密人工标注。

输出与推理模式

最终模型仅需 VLM 一次前向推理即可输出 推理链 与 最终选择的轨迹候选。由于候选是预定义原型,输出可被直接解码为具体轨迹坐标,无需面临开放端轨迹生成的几何精度瓶颈。

与同类方法的差异

相较于直接回归或扩散生成连续轨迹的 VLA 模型,DEFT-RLVR 将高维轨迹生成转化为可验证的多选题决策,大幅降低学习难度并保留因果忠实性;相较于普通 CoT 微调,其通过延迟暴露消除捷径学习,使推理更具备场景证据依赖性与跨域泛化能力。

实验

实验设计

研究围绕 DEFT-RLVR 框架展开,在自行构建的 AD-MCQ 基准上进行。核心对比包括:(1) 预决策暴露未来轨迹 (JEFT) vs. 决策后延迟暴露 (DEFT);(2) 基于轨迹选择的 RLVR 与仅蒸馏的监督训练;(3) 不同奖励函数、候选构建方式及跨域泛化。评估同时覆盖 AD 推理精度与通用视觉能力,并设置 冷启动 SFT 和 蒸馏 基线。

关键发现

  • 消除锚定偏差:DEFT 将未来轨迹从预决策提示变为后决策验证信号,显著降低了模型对真值轨迹的“合理化”幻觉,尤其是在因果挑战场景中。
  • 推理-通用能力平衡:蒸馏虽提升 AD 专精度,但导致通用视觉能力下降;而 DEFT-RLVR 在改善 AD 推理的同时,保持甚至增强了通用能力(如 VQA 指标)。
  • 奖励设计影响:仅使用选择题奖励(R^MCQ)时,JEFT 因捷径优化而性能不佳;引入轨迹生成奖励(R^GEN)可进一步增强推理深度,且时间开销轻微。结构化的评分细则(rubric reward)有效减少了无意义的探索,加速收敛。
  • 候选基任务的泛化性:AD-MCQ 的离散候选集避免了开环轨迹生成带来的误差累积与通用能力退化,且该方法在不同候选构造策略下表现稳定,跨域(OOD 驾驶场景)依旧有效。

与基线对比的深入解读

相比直接暴露未来轨迹的 JEFT,DEFT 从根本上切断了模型“看答案再解释”的捷径,使得思维链更加忠实于场景证据。在训练范式上,蒸馏基线的局限性在于它仅模仿教师输出,无法探索更优决策空间;而 DEFT-RLVR 通过强化学习在大型候选集中进行可验证搜索,既保留了通用知识,又习得了可迁移的决策策略。这一发现对实际工程有显著启示:在设计 LLM/VLM 的推理训练时,将验证信号置于决策之后(而非之前),能有效避免逻辑跳步,同时结合结构化奖励与离散候选空间,可在不大幅牺牲基础能力的前提下获得稳健的任务性能。

行业影响

落地场景

该方法可直接用于自动驾驶感知-决策-规划管线中的 VLM 推理模块。凡是以视觉语言模型做高层决策或行为预测的产品(如 L3/L4 自动驾驶系统、端到端驾驶策略、智能座舱的驾驶解释)均可受益。AD-MCQ 将规划转化为显式轨迹候选的选择,使决策过程可审计、可调试,尤其适合安全关键场景(如复杂路口、交互博弈)中的因果推理。同时,候选轨迹构建的难度可控特性,可支撑从影子模式验证到量产部署的分级迭代。

商业价值

减少轨迹锚定偏差能直接降低误判和危险行为的概率,提升系统安全性,从而降低事故风险和保险成本。可验证的推理链有助于满足法规解释性要求,加速审计和认证流程,缩短上市周期。AD-MCQ 作为轻量、可扩展的基准,无需完整轨迹生成即可评测决策水平,节省合成数据与标注开支;DEFT-RLVR 在不大幅牺牲通用视觉能力的前提下增强 AD 推理,降低多任务部署时的模型膨胀和算力冗余。

与现有产品 / 工作流的接口

  • 数据侧:AD-MCQ 可作为现有 AD 日志系统的后处理组件,将轨迹库与场景抽取对齐,生成结构化的多选题数据集。
  • 训练侧:DEFT-RLVR 的推迟曝光机制可与现有模仿学习或 RLHF 流水线结合,只需在 Teacher 推理阶段屏蔽 GT 轨迹,在 Student 反馈阶段再提供,无需改动网络结构。
  • 推理侧:仅需 VLM 单模型推理,不依赖额外规划器,可插拔集成到 ROS / Apollo 等中间件中,通过候选集的动态生成适配不同 ODD。

典型用例

  1. L4 出行服务 (Robotaxi):在繁华人车混流路口,利用 DEFT-RLVR 微调的 VLM 对候选轨迹(如礼让、抢行)进行因果推理,输出可验证的决策链。这能快速定位因视觉幻觉导致的错误选择,提升安全员远程接管效率,并为事故复盘提供结构化解释。
  2. 高级辅助驾驶 (ADAS) 开发平台:在数据驱动开发中,用 AD-MCQ 作为模型选型的离线评测基准,仅需构造不同难度的干扰项即可评估规划器的因果忠实性,避免昂贵且危险的实车验证,加速 OTA 迭代。

局限

  • AD-MCQ 将规划简化为从候选轨迹中选择,虽然降低了生成难度并实现了可验证推理,但输出空间受限于预定义的轨迹集合(codebook),限制了模型在开放场景下生成全新轨迹的能力,可能无法覆盖长尾或罕见驾驶行为。候选集的代表性与覆盖率高度依赖人工设计或启发式构造,在真实部署中如何在线生成高质量候选仍是一个开放问题。
  • 实验主要基于 nuScenes 数据集及其变体,虽然包含了跨域(CARLA)泛化测试,但所有评估均在离线记录数据上进行,缺乏实车闭环验证。此外,RLVR 奖励函数中的结构化评分(rubric)依赖未来轨迹真值作为验证信号,这在实时推理中不可用,训练范式与在线部署之间存在 gap,实际应用时仍需额外的在线对齐策略。
  • 在对比实验中,DEFT-RLVR 主要与 SFT、Distillation 等基线比较,缺乏与主流端到端规划模型(如 UniAD、VAD 等)的直接对比,难以量化候选选择范式相对于连续轨迹回归的优劣势。尽管作者论证了候选 grounding 可避免轨迹生成误差累积,但未展示与之对应的完整规划性能指标(如 L2 误差、碰撞率等),使得该方法的竞争力不够透明。
论文Zixuan Huang2026-08-03原文

相关内容