论文

Fast-dDrive: 高效的块扩散VLM用于自动驾驶

Fast-dDrive: 高效的块扩散VLM用于自动驾驶

端到端自动驾驶通过视觉-语言-动作 (VLA) 模型,需要在高保真轨迹规划与高效推理之间取得微妙平衡。现有范式各有不足:自回归 (AR) VLA 在边缘硬件上受限于内存带宽,且易产生曝光偏差漂移;而全序列扩散模型无法复用 KV 缓存,并存在违反“感知-规划”因果性的逻辑泄漏问题。本文提出 Fast-dDrive,一种块扩散 VLA,它在语义单元内进行双向细化的同时,强制跨单元保持严格因果顺序。利用驾驶 VLA 常输出结构化 JSON 的特点,Fast-dDrive 将结构 token 冻结为节脚手架 (section scaffold),并采用节感知训练策略优先优化安全攸关的规划。我们还引入脚手架推测解码 (Scaffold Speculative Decoding),在显著提升吞吐量的同时保持 AR 级质量。最后,提出一种低开销的测试时扩展方案:通过从单个共享前缀 KV 缓存中分叉出 N 个随机轨迹 rollout 并取平均,以极小的计算代价有效抑制预测方差。 实验表明,Fast-dDrive 重新定义了驾驶智能体的速度-精度边界。在 WOD-E2E 测试集上,Fast-dDrive 在 ADE@3s 和 ADE@5s 上达到最先进水平,并在基于扩散的 VLA 中取得最高 RFS;在 nuScenes 上,平均 L2 误差 降至 0.32 米(提升 22%)。当集成 SGLang 时,我们的框架相比 AR 基线实现 12 倍吞吐量加速,弥合了高容量 VLA 与实时车载部署效率需求之间的差距。

论文精读

TL;DR Fast-dDrive 以块扩散 VLA 融合因果排序与双向细化,通过结构化 token 冻结、安全优先训练及推测解码,在自动驾驶轨迹规划中同时实现 SOTA 精度与 12 倍吞吐提升。

问题

问题背景

端到端自动驾驶正从模块化流水线转向 视觉-语言-行动(VLA)模型,直接由传感器输入生成轨迹规划,追求高保真预测与低延迟推理的极致平衡。

现有方法局限

当前两类主流范式各有严重瓶颈:

  • 自回归(AR) VLA 逐 token 解码,在边缘硬件上受限于内存带宽,KV缓存复用虽高效却遭 exposure bias 困扰(训练与推理时的分布偏移导致累积误差)。
  • 全序列扩散 VLA 对整个输出做非因果去噪,无法复用 KV 缓存,推理开销巨大;更致命的是存在逻辑泄漏——双向注意力让未来 token 信息反向影响过去,违背感知→推理→规划的因果链,产生不合常理的轨迹。

为何重要且困难

自动驾驶对实时性(>10 Hz)和安全性(厘米级误差)均有严苛要求,而边缘算力(如 Orin)又极度受限。上述方法要么精度因曝光偏差而退化,要么效率不达标,直接阻碍 VLA 从实验室走向量产。业界亟需一种严格维持因果序、又能复用 KV 缓存、同时通过并行扩散提升规划质量的新框架,这正是 Fast-dDrive 瞄准的无人区。

行业类比

与 LLM 在手机端部署时因自回归带宽瓶颈转向投机解码类似,车载 VLA 也需在因果约束下挖掘扩散的并行优势,但多了一层物理安全硬约束,使得效率与精度的权衡更具挑战。

核心洞察

  • **结构化 scaffold 扩散 + 安全优先训练** 直击感知–规划因果性泄露这一核心矛盾。 端到端 VLA 要么用自回归逐 token 生成,暴露偏差累积与推理带宽瓶颈;要么用全序列扩散,虽可双向去噪却破坏因果顺序,出现“先规划后感知”的逻辑泄漏。Fast-dDrive 利用驾驶 VLA 输出类似 JSON 的结构化特性,将结构 token 冻结为 **section scaffold**,强制跨区块的严格因果掩码,同时在区块内部保留双向精炼。 配合 **安全性优先训练**,模型在扩散损失中为关键规划 token 分配更高权重,确保安全相关输出优先收敛。 与 MDLM、BD3-LMs 等纯扩散框架相比,该设计首次将结构化先验与因果约束注入扩散 VLA,平衡了高保真轨迹规划与可部署效率。
  • **Scaffold Speculative Decoding + 共享前缀多轨迹 rollout** 构建了一套面向实时推理的低开销测试时缩放机制。 自回归 VLA 受限于逐 token 内存带宽,全序列扩散则无法复用 KV cache。Fast-dDrive 将冻结的 scaffold token 作为“草稿”序列,由验证模型并行校验生成其余 token,实现 **Scaffold 推测解码**,在保持 AR 等效质量下吞吐量大幅提升。 测试时,仅从共享前缀 KV cache 分叉出 N 条随机轨迹扩散 rollout 并进行简单平均,即能以极小额外计算量抑制预测方差,提升规划一致性。 该方法区别于需要完整独立去噪多条轨迹的传统扩散模型,将前缀计算最大程度共享,为在边缘设备上突破扩散 VLA 的效率壁垒提供了可工程化的路径。

方法

输入

Fast-dDrive 接收多模态传感器数据(环视图像、LiDAR 点云等),经视觉编码器转换为 视觉 token,与文本指令(如导航目标)拼接后作为模型输入。任务输出被约定为结构化 JSON 格式的轨迹规划结果,包含物体检测、自车位姿、未来路径点等语义区块。

关键模块

  1. 结构感知的 Scaffold 构建
    模型预先解析 JSON 模式,识别并冻结所有结构 token(如键名、括号、分隔符)构成 section scaffold,作为生成时的骨架约束。数据被切分为与语义区块对齐的 token 块,每块对应一个 JSON 区段。

  2. Block-Causal 掩码扩散训练
    每个区块内部采用双向掩码扩散(随机掩码并预测原 token),允许区块内 token 相互精炼;但区块间强制保持严格因果顺序,杜绝规划信息向感知区块逆向传播。训练损失由规划段的安全性优先加权,且同时优化自回归(AR)和扩散目标,增强模型在不同解码模式下的鲁棒性。

  3. Scaffold Speculative Decoding (SS)
    推理时,轻量 AR 模型根据 scaffold 和已生成上下文快速生成候选区块,主扩散模型对候选序列并行验证并重采样修正,实现 AR 等效质量却提升 12 倍吞吐量(集成 SGLang 时)。此过程可缓存共享前缀的 KV 状态。

  4. 测试时共享前缀多轨迹 Rollout
    从单个共享前缀 KV-cache 分叉出 N 条随机轨迹展开,对每条轨迹独立进行扩散去噪,最终对多条轨迹的路径点取平均。仅以少量额外计算有效抑制预测方差,提升稳定性。

输出

模型输出完整的结构化轨迹规划 JSON,字段包含未来 3~5 秒的自车路径点、速度曲线等,同时附带中间感知结果以支持调试。

与同类方法的差异点:Fast-dDrive 的区块因果扩散在语义区块粒度上强制感知-规划因果性,避免了全序列扩散可能出现的“逻辑泄露”;同时 scaffold 冻结和推测解码使得 KV 缓存可复用,达到接近 AR 模型的推理效率,而扩散质量在轨迹规划上更优。

实验

实验设计

Fast-dDrive 在两个主流端到端驾驶基准 WOD-E2EnuScenes 上进行评估,采用 ADE@3sADE@5sL2 误差 衡量轨迹规划精度,RFS 作为安全性指标。基线包括 自回归 VLA 和全序列扩散 VLA,并通过 SGLang 集成测试实际推理吞吐。消融研究验证块因果扩散、结构感知训练与 Scaffold Speculative Decoding 的独立贡献。

关键发现

  • 精度突破:在 WOD-E2E 上取得 ADE@3s、ADE@5s 的 SOTA 及扩散 VLA 中最高的 RFS;nuScenes 上平均 L2 误差降低 22% 至 0.32m。
  • 效率革命Scaffold Speculative Decoding 实现 12 倍 于 AR 基线的吞吐量,同时保持生成质量。
  • 结构设计有效性:冻结 JSON 结构 token 并限定扩散在语义块内,既保留因果顺序又允许块内双向精炼,解决 逻辑泄漏 问题。
  • 低开销测试时扩展:共享前缀 KV-cache 的多轨迹 rollout 与平均,以极少计算抑制预测方差,提升鲁棒性。

与基线的深度对比

相较于自回归 VLA 常受限于边缘硬件的内存带宽和 exposure bias,Fast-dDrive 的单次 KV-cache 共享及分块扩散机制大幅缓解了 token 生成串行瓶颈,吞吐优势显著。与全序列扩散 VLA 相比,Fast-dDrive 强制 感知-规划因果序,杜绝了未来信息泄露,同时支持 KV-cache 复用,这是纯扩散无法完成的。12 倍吞吐加速让高容量 VLA 的实时车载部署成为可能,将速度-精度前沿推至新境界。该方法对生成结构化输出的具身智能系统提供了一种通用的高效率范式。

行业影响

落地场景

Fast-dDrive 的块扩散 VLA 架构直接瞄准自动驾驶的端到端轨迹规划,适用于乘用车 L2+/L4 域控制器机器人配送平台。其核心卖点是:在边缘设备上将生成质量推向 AR 模型水平,同时通过 KV-cache 复用投机解码大幅提升吞吐,解决实时推理瓶颈。

  • 车载系统:用于下一代行车 / 泊车一体化模型,输出 JSON 结构化的决策指令(路径点、速度剖面)。
  • 云端仿真与数据闭环:在大量离线场景重仿真中,利用共享前缀多轨迹 rollout 低成本生成多样化候选,辅助安全验证与难例挖掘。

商业价值

价值主线是降本增效,而非单纯体验提升。

  • 硬件成本节省:12 倍吞吐提升意味着相同算力可支撑更多功能模块,或降低芯片规格需求,直接压缩 BOM 成本。
  • 安全收益间接变现:通过测试时缩放(test-time scaling)抑制预测方差,可减少接管率,降低保险与责任风险,这对商用自动驾驶车队是刚性需求。
  • 开发效率:section-aware 训练与结构化 token 冻结使模型训练更聚焦安全关键规划,缩短迭代周期。

与现有产品 / 工作流的接口

Fast-dDrive 可平滑融入现有端到端自动驾驶框架(如 UniAD、VAD 的演进版本),替代其中的轨迹解码头。

  • SGLang 等推理引擎集成,通过 Scaffold Speculative Decoding 在标准 Transformer 运行时上实现加速,无需定制硬件。
  • 输入侧兼容现有多模态感知栈(环视图像、激光雷达点云、导航地图);输出侧保持 JSON 架构,与规划控制模块耦合度低,便于现有车辆软件架构的渐进升级。

具体落地用例

  1. 自动驾驶出租车(Robotaxi):在城市复杂路口,Fast-dDrive 利用因果块扩散机制先感知周边动态,再规划安全轨迹,避免“逻辑泄露”。共享前缀缓存与轨迹平均可在不增加额外算力的情况下,生成并融合多个未来 rollout,提高对横穿行人等长尾场景的覆盖,直接降低运营事故率。
  2. 末端物流配送车:这类场景对成本极度敏感,通常搭载低算力芯片。Fast-dDrive 的块扩散范式允许在 8 TOPS 级别设备上运行 VLA 模型,且结构化 JSON 输出可直接对接车辆底盘控制协议,实现从视觉输入到方向盘 / 油门指令的纯端侧闭环。

局限

  • **对结构化输出的强依赖**:方法预设驾驶 VLA 输出为类似 JSON 的结构化文本,以便冻结结构 token 形成 scaffold 并实现高效训练与推测解码。但在需要自由形式推理(如复杂场景解释、多步条件规划)或开放词汇指令时,强制结构化会限制模型表达力,可能丢失上下文信息。scaffold 设计依赖领域专家定义安全关键段,泛化到新任务或新数据集需要重新标注,引入额外人工成本,且不同输出格式需调整块对齐方式,削弱了即插即用性。
  • **缺乏真实部署验证**:实验仅在 WOD-E2E 和 nuScenes 仿真数据进行开环评估,虽然指标 SOTA,但开环结果不能直接反映闭环安全性、时序稳定性及传感器噪声鲁棒性。论文未给出在车规芯片(如 Orin、Thor)上的端到端延迟与内存占用测量,仅报告相对吞吐加速。即便有 Scaffold Speculative Decoding,在资源极度受限的硬件上,块扩散的迭代去噪步骤仍可能成为实时决策瓶颈,实际部署可行性有待真车闭环测试。
  • **固定块划分的因果刚性**:块因果扩散将输出按语义分割为固定区块,保证了宏观因果顺序,但可能引入局部欠拟合:当复杂决策需要跨块上下文(如长期规划与即时避障交织)时,固定块边界会截断 token 间条件依赖,削弱交互。Section-aware 训练虽提升安全关键部分的预测精度,但可能牺牲非关键段的全局一致性。测试时共享前缀的多轨迹平均虽降低方差,但平均轨迹未必满足车辆动力学约束,需要额外后处理,且 N 次 rollouts 在极端实时场景下仍产生可观计算开销。
论文Kewei Zhang2026-05-25原文

相关内容