Corner case 有多 corner?面向高速公路场景生成的百分位控制
生成具有恰当对抗强度(adversity)的 corner-case 场景,是自动驾驶(AV)软件栈部署前安全测试的关键。现有场景生成方法虽能施加特定的行为、对抗性或可行性条件,但难以控制所生成场景相对于同一交通语境下合理未来的极端程度。 本研究将生成场景的对抗性表示为其在给定历史的条件风险分布中的百分位,从而为两个问题提供可校准的回答:生成的 corner-case 场景究竟有多 "corner",以及其 "cornerness" 如何被精细调节。 方法上,我们定义历史条件化的风险百分位请求,学习一个参考风险分布,将每个请求百分位映射为物理风险目标;随后使用百分位条件联合扩散模型并结合采样时风险引导生成多智能体未来轨迹,同时提出基于参考的百分位实现评估准则。 实验在 highD 数据集上以自车与周边车辆的最小后侵占时间(PET) 作为风险代理指标。在主评测集上,方法在 0.05 百分位容差内实现了 1,440 个请求中的 1,422 个(98.75%),平均百分位误差为 0.00673,PET 目标误差为 0.00991 秒。该接口通过统一的风险尺度,将语境相对的风险指定、物理实现与评估三者衔接起来。项目主页与生成场景视频见 https://hhj233.github.io/CornerPercentile/ 。
论文精读
TL;DR 论文将 corner case 的极端程度定义为给定历史下未来风险条件分布的百分位数,并学习参考风险分布映射到物理风险目标,用百分位数条件联合扩散模型生成多智能体未来,实现对场景“corner 程度”的精细控制,实验在 highD 上以 98.75% 请求在 0.05 百分位容差内实现。
问题
问题背景
自动驾驶仿真测试的核心需求是生成corner case场景,以在部署前评估车辆软件栈的安全性。当前领域关注如何在模拟环境中生成具有适当对抗性的场景,避免测试盲区。
现有方法局限
现有场景生成器通常只能约束特定行为、对抗性或可行性条件,例如基于规则注入危险行为或使用对抗优化放大风险,但缺乏对生成场景相对极端程度的精细控制。它们无法回答“这个场景有多 corner?”或“如何调整 corner 程度?”这类连续调节问题。更具体地说:
- 没有统一的尺度来量化场景相对于同一交通历史下可能未来的风险百分位;
- 无法将用户指定的百分位请求映射到物理风险目标(如 PET 秒数);
- 生成过程中难以保证多智能体未来能满足指定的风险百分位。
为什么难且重要
技术挑战在于需要建立一个上下文相关的风险参考分布,从历史交互中学习条件风险百分位,并将其作为生成条件。同时,使用扩散模型进行百分位数条件生成时,如何在采样路径中引导风险、校准分布,以及验证生成结果是否达到目标百分位,都非常困难。业界对 AV 安全验证的要求日益增高,需要可解释、连续可调的场景生成接口,以系统覆盖不同风险等级,避免只生成极端场景而忽略中等风险场景。
行业类比
类似于在扩散模型图像生成中用风格强度百分位控制输出,或是在推荐系统中用分位数调控样本的新颖度,为复杂系统提供连续调节旋钮。
核心洞察
- 将场景极端性定义为给定历史条件下未来风险分布的百分位数,而非绝对风险阈值或固定行为标签。这样每个生成场景的“corner 程度”可以直接量化并与其他场景比较,且同一风险值在不同交通情境下可映射到不同百分位,反映上下文相对严重性。同类工作通常生成满足特定行为规则或绝对风险值的场景,难以回答“有多 corner”或对合理未来进行精细分级。
- 通过解耦参考风险分布学习与条件扩散生成,实现可校准的百分位控制。方法先学习一个从请求百分位到物理风险目标(如 PET 秒)的参考映射,再用 percentile-conditioned joint diffusion 模型配合采样时 risk guidance 生成多智能体未来。与常用 classifier guidance 或离散条件标签不同,risk guidance 在采样路径上直接优化目标风险,不需要额外分类器或重新训练;同时 reference-based 评估准则保证了百分位实现的一致性。在 highD 上 1440 请求中 1422 个在 0.05 百分位容差内实现,PET 目标误差仅 0.00991 秒,证明了精确控制可行性。
方法
输入:观测到的多车历史轨迹(车辆位置、速度等),来自 highD 数据集。
关键模块:
- 历史条件风险百分位数请求:将 corner-case 的“极端程度”定义为给定观测历史下未来风险条件分布中的一个百分位数 p。学习一个参考风险分布网络,把每个 p 映射为一个物理风险目标值(如最小 post-encroachment time, PET)。
- 百分位数条件联合扩散模型:以历史状态和请求百分位数 p 为条件,生成多智能体未来轨迹。训练时建模多车联合分布;采样时在每个去噪步骤引入风险引导,根据当前轨迹的风险估计与目标风险的差异调整采样方向,使最终样本的物理风险逼近目标值。
- 基于参考的评估准则:将生成场景的 PET 值代回参考分布,计算其实际百分位并与请求 p 比较,以 0.05 百分位容差判定是否达标。
输出:满足百分位数请求的多车未来轨迹,风险程度可控,可直接注入仿真器用于 AV 安全测试。
与同类方法差异:现有生成器通常只能指定固定行为约束或对抗强度,本方法将 corner 程度统一到条件风险百分位数,提供从百分位到物理目标再到生成与评估的闭环标尺。
实验
实验设计
在 highD 数据集上,采用 minimum post-encroachment time (PET) 作为风险代理。构建历史条件下的风险百分位请求,学习参考风险分布,将请求映射为物理风险目标。随后使用 percentile-conditioned joint diffusion model 配合采样时风险引导生成多智能体未来,并通过基于参考的准则评估百分位实现。
关键发现
- 主评估集上,1,440 个请求中有 1,422 个在 0.05 百分位容差内实现,98.75% 的成功率。
- 平均百分位误差 0.00673,PET 目标误差 0.00991 秒。
- 说明生成场景的“corner”程度可以精确到百分位,且物理风险目标与请求高度一致。
与基线的对比解读
论文未给出其他生成器的直接数值对比,但其核心差异在于控制维度:现有自动驾驶场景生成器可施加行为、逆境或可行性约束,但缺乏对“极端程度”的定量控制。该方法将 adversity 定义为条件风险分布的百分位,连接了上下文相对风险规范、物理实现和评估,并可细粒度调节“cornerness”。这一框架为 AV 测试提供了统一的校准风险尺度。
行业影响
落地场景
该方法可直接集成到 自动驾驶仿真平台 (如 CARLA、NVIDIA DRIVE Sim、Waymo Carcraft)的场景生成模块,用于构建按风险百分位定制的 corner case 库。典型场景包括:高速公路 cut-in、急刹车、汇入冲突等,测试 AV 规划模块的安全性边界。另一个用例是 ADAS 合规测试——法规要求验证特定风险水平下的系统响应,该接口可精确指定 PET 或 TTC 的百分位阈值,生成可复现的测试用例。企业服务方面,第三方测试服务商可提供按百分位付费的场景生成 API。
商业价值
核心价值在降本与提效:传统 corner case 搜索依赖随机采样或专家设计,覆盖不均衡且成本高;该方法通过学习历史交互的条件分布,将“极端程度”映射到 0–1 百分位,可按需生成目标风险水平,减少无用极端场景的生成浪费。对自动驾驶企业,能大幅缩短安全验证周期,减少真实道路测试里程,加速产品认证。同时,可对外销售场景生成服务 或提供订阅制工具包,形成新的收入来源。体验提升方面,测试工程师获得可解释的风险标尺(百分位),沟通成本降低。
与现有产品/工作流的接口
该框架可作为场景生成服务 接入现有仿真流水线:输入历史观测和请求百分位,输出多智能体未来轨迹。建议封装为 gRPC/REST API,上游由场景描述语言(如 ASAM OpenSCENARIO 2.0)触发,下游将生成轨迹绑定到具体车辆模型。内部依赖 参考风险分布 的校准模型,可离线训练并定期更新。集成要点:
- 保留
percentile_request字段,允许调用方直接指定 0–1 之间的值; - 输出上,除轨迹外提供
PET/TTC估计及实现百分位,便于审计; - 与现有交通流仿真器(如 SUMO)对接时,可将生成的边缘案例作为初始状态注入。
局限
- - 论文主要使用单一风险代理指标 **PET**(minimum post-encroachment time)来定义 corner-case,尽管文中补充了 **TTC** 请求实验,但主评估仍聚焦于 PET;这限制了方法在多风险度量下的通用性。实验仅在 **highD** 高速公路自然驾驶数据集上验证,对城市道路、交叉口等更复杂场景的迁移性未知。百分位请求范围受参考分布覆盖的尾部分位数约束,极端百分位(如 > 99.9%)的生成精度可能下降。
- - 方法依赖从历史交互数据中学习参考风险分布,若训练数据中高风险情境稀疏,则尾部估计不可靠,进而影响百分位映射的准确性。扩散模型采样虽支持条件生成,但计算开销较大,难以满足在线测试或大规模仿真对实时性的要求。评估主要关注风险百分位误差和 PET 目标误差,对生成轨迹的物理合理性(如加速度、曲率约束)检查有限,且未与其他场景生成方法进行系统性对比。
- - 与现有场景生成器相比,本文提供的百分位数控制接口是一个独特贡献,但该接口的前提是能够明确定义条件风险分布并计算百分位。对于更复杂的多智能体交互或非高速场景,风险度量的选择与条件分布建模将更具挑战性。此外,方法隐含假设风险百分位与物理风险目标之间存在确定性映射,实际中可能存在非单调或多模态关系,导致实现偏差。