面向空中图像目标导航的不确定性感知World Model
空中图像目标导航要求无人机(UAV)到达由目标图像指定的目标位置。现有的基于世界模型的方法利用预测的未来对候选轨迹进行排序,但通常仅依赖一个或几个点预测,这对于具有大量未来状态不确定性的大规模室外环境而言是不够的。 为了解决这一限制,我们提出了不确定性感知导航世界模型(UA-NWM),一种用于空中图像目标导航的高效潜在世界模型,它将轨迹评分公式化为条件分布外检测。UA-NWM 使用不确定性子空间表示可能的未来,并将预测与目标之间的差异分解为不确定性可解释和不可解释两个部分。仅使用不可解释的残差进行评分,从而无需多个未来样本即可实现稳健的选择。 大量实验表明,UA-NWM 在保持低推理延迟的同时,始终优于现有的导航世界模型。真实无人机实验进一步验证了其实用性。
论文精读
TL;DR 提出 UA-NWM,将空中图像目标导航的轨迹评分建模为条件 OOD 检测,利用不确定性子空间分解预测-目标差异,仅用不可解释残差评分,无需多次采样即实现低延迟、鲁棒的选择。
问题
航空图像目标导航 要求无人机仅凭目标图像在大规模室外环境中自主抵达指定位置。当前主流方法采用世界模型对未来观测进行预测,并以此对候选轨迹评分。
现有基于世界模型的方法通常只生成一个或少数几个确定性预测,再利用预测图像与目标图像的差异进行轨迹排序。这种点估计策略忽略了大范围室外场景中普遍存在的未来状态不确定性(如视角剧烈变化、光照波动、动态物体遮挡),导致评分极易被预测噪声干扰,在复杂环境中频繁选错轨迹。
该问题的难点在于:室外导航的高度部分可观测性带来了不可约不确定性,直接与模型自身的认知不确定性耦合;若采用多步采样来逼近真实分布,又会引入难以承受的计算开销,与无人机的高实时性需求矛盾。因此,如何高效解耦并量化两种不确定性,仅用真正能反映任务进展的残差指导决策,成为提升导航鲁棒性的关键瓶颈。随着无人机在巡检、搜救等领域的广泛应用,业界对高可靠、低延迟的自主导航方案关注度持续上升。
这一挑战类似于自动驾驶中的轨迹规划:系统需要辨别当前预测误差究竟来自模型能力的局限,还是来自环境本身的随机性,以避免对不确定的未来做出过度自信或过度保守的决策。
核心洞察
- **将轨迹评分形式化为条件 OOD 检测,用不确定性子空间建模合理未来,仅凭不可解释残差完成评分,无需多步采样即可实现鲁棒选择。** 现有世界模型方法依赖单点或少量点预测来评估候选轨迹,但在大范围室外环境中,未来状态存在高度不确定性,有限的点预测极易引入偏差。UA-NWM 通过单次前向传播获得不确定性子空间,将预测-目标差异分解为可被不确定性解释的分量和不可解释的残差,并仅用残差打分。这种做法不仅避免了昂贵的多轨迹采样,还将评分与不相关的随机波动解耦,在推理延迟和导航成功率之间取得更好的平衡,对计算受限的无人机平台更具工程价值。
- **分层误差投影结构将预测-目标差异显式分解为正交的可解释与不可解释两个分量,使导航决策对无关随机扰动不敏感。** 传统方法通常直接使用整个预测误差作为评分依据,导致模型易受环境中高不确定性区域的噪声影响。UA-NWM 利用分层投影将误差归因:一部分可由学出的不确定性基底表征(如因动态光照、风扰引起的状态涨落),其余则构成影响任务成功的真实误差残差。该设计不仅提升了对抗环境干扰的鲁棒性,还通过可解释的分量提供了故障诊断线索,帮助工程师理解导航失败的原因,为安全性关键的应用提供了更透明的决策依据。
方法
输入与编码
UA-NWM 以 当前观测图 与 目标图像 为输入,首先通过冻结的 DINO 编码器将它们分别编码为视觉 token。同时,动态特征(如位姿、速度)由 Delta 编码器 映射为 latent 向量。所有 token 经 token 压缩器 降维后,与动作嵌入一起送入 动作条件因果 transformer,在隐空间中自回归式地预测未来状态的 token 序列。
不确定性子空间与轨迹评分
核心创新在于将轨迹选择建模为 条件分布外检测。UA-NWM 认为,在广域户外场景下,单一确定性预测无法覆盖未来的多种可能,但合理未来的分布应落在一个低维的 不确定性子空间 内。为此,模型学习一个由若干正交基张成的线性子空间,表示由动作与环境导致的 可解释不确定性;任何预测误差在该子空间上的投影被认为是“正常的”,而 子空间外的残差 才是不可解释的、应被惩罚的“意外”成分。
分级误差投影 (HEP)
为量化预测-目标差异中不可解释的部分,作者设计了 分级误差投影:
- 第一级:将总预测误差投影到不确定性子空间上,得到可解释成分。
- 第二级:原始误差减去该投影,得到 不可解释残差,其能量即为该轨迹的得分。
该得分仅反映“意外”程度,因此即使预测单一,只要落在合理区域内,得分就很低,从而避免了对多条未来采样的依赖。
训练策略
训练分三阶段:
- 表示学习:仅训练视觉编码器适配器与 token 压缩器,用重建损失对齐观测。
- 确定性预测:训练 transformer 主干,使未来 token 预测尽可能准确。
- HEP 训练:固定前两阶段参数,学习不确定性基向量,最大化真实未来在子空间内的投影能量,同时最小化随机负样本的投影能量。
输出与推理
推理时,对每条候选轨迹,UA-NWM 仅需一次前向传播,计算不可解释残差能量作为负得分,得分最低的轨迹被选中。整个过程无需 Monte Carlo 采样,保证低延迟。
与同类方法的差异: 现有导航世界模型多依赖单点或多点预测直接比较特征距离,忽略未来多模态性;而 UA-NWM 通过显式建模不确定性,将误差解耦为可解释与不可解释两部分,仅用后者驱动决策,在保持高效率的同时显著提升了户外大规模场景下的泛化能力。
实验
实验设计
本文在 AirGoal-10k 大规模航拍图像目标导航基准上评估 UA-NWM,任务包含离线轨迹排序和在线独立规划。离线设置将模型作为轨迹评分器,根据预测未来与目标图像的不匹配程度对候选路径进行排序;在线仿真则将评分器嵌入规划器,在未知环境中实时决策。此外,在真实无人机(UAV)平台进行了户外导航实验,验证方法的实际迁移能力。
关键发现
UA-NWM 的核心优势在于将 不确定性建模 引入世界模型:通过将预测-目标差异投影到 不确定性子空间,分解为可解释(由环境不确定性引发)和不可解释的残差,仅用残差评分,从而避免因未来状态不确定性导致的错误排名。实验表明:
- 离线轨迹排序准确率显著超越基于点预测的世界模型基线;
- 在线导航成功率提升明显,尤其在尺度大、外观变化剧烈的户外场景中;
- 推理延迟保持在较低水平(无需采样多条轨迹),满足实时需求。
与基线对比的深度解读
现有世界模型方法(如 NoD、ViNT 等)通常只预测单一或少数未来状态,对户外环境中由动态物体、光照、视角变化引起的未来不确定性高度敏感,极易将“可解释的未来变化”误判为目标未到达。UA-NWM 通过 层次误差投影(HEP) 显式分离不确定性,使得模型只惩罚那些确实无法由不确定性子空间解释的预测偏差。这意味着在候选路径评估时,它更鲁棒地排除假阳性——即使预测的未来与目标图像差异较大,只要该差异落在已学习的“正常变化”空间中,模型仍能正确判断方向一致。该设计为世界模型驱动的视觉导航提供了一种面向不确定性感知的新范式,有效缓解了点预测方法的脆弱性。
行业影响
落地场景
该工作直接服务于无人机视觉导航系统,可集成到以下产品中:
- 物流配送无人机:从高空航拍图(卫星或预采图像)定位客户投放点,无需依赖GPS或预铺设标记,在郊区、园区等场景实现全自主末端配送。
- 农业植保与巡检:大田作物监测、电力线路/管道巡检中,无人机可依据目标区域航拍图自主规划路径,提升作业覆盖率和复用性。
- 应急救援与安防:在灾后或陌生环境中,操作员仅需提供一张航拍目标图,无人机即可自主导航至目标,大幅降低遥控复杂度。
商业价值
- 降低硬件与部署成本:UA-NWM 仅需单目视觉,无需昂贵LiDAR或RTK定位,且推理延迟低(适合机载边缘计算),使导航方案可下沉至消费级或工业级低成本平台。
- 提升任务成功率与安全性:通过不确定性残差评分规避环境动态带来的错误轨迹选择,减少碰撞、迷航导致的坠机损耗,直接降低运维成本。
- 加速规模化复制:世界模型可在仿真中预训练,针对不同场景仅需少量微调,缩短集成周期,支撑无人机服务快速拓展至新区域。
与现有产品 / 工作流的接口
- 即插即用的导航后端:可替换现有视觉导航栈中的评分模块,输入为候选轨迹和航拍目标图,输出排序后的安全轨迹,与规划器松耦合。
- 与仿真系统配合:官方配套的 AirGoal-10k 基准与训练流程(项目主页)可直接复用,企业可利用自有场景数据对不确定性子空间进行适配。
- 兼容主流视觉骨干:基于DINOv2表示,便于与目标检测、SLAM等下游任务共享特征,融入已有感知框架。
具体落地用例
- 电商配送:某全球性电商的无人机配送服务在缺乏地标信标的乡村地区,依靠客户提供的屋顶航拍图作为目标,UA-NWM 让无人机在实时预测中量化“这片树林可能遮挡目标”的不确定性,仅追踪可靠残差,避免因单一预测误判而绕飞,保证投递时效。
- 能源巡检:风电场叶片检测中,运维人员远程上传待检叶片区域的航拍样本,无人机自主规划接近路径,UA-NWM 的层次误差投影区分“遮挡造成的不可解释误差”和“视角变化造成的可解释误差”,在狭窄空间中准确选择安全轨迹,减少人工干预频次。
局限
- **对预训练视觉编码器的依赖性较强**:UA-NWM 使用 DINO 编码器提取视觉特征,若输入域与预训练数据分布差异较大(例如低空视角、极端天气或非自然场景),潜在表示质量可能下降,从而影响轨迹评分的可靠性。虽然方法本身是模块化的,但论文未探讨更换编码器或微调的影响,实际部署时可能需要针对特定 UAV 相机重新适配,增加了工程成本。
- **不确定性子空间的假设可能过于简化**:HEP 将未来状态的多样性投影到低秩子空间,并假设不可解释的残差仅来自“非合理”的未来。然而,在高度非结构化或动态变化的室外环境中,多个合理未来可能并不位于同一线性子空间中,导致部分合理的候选轨迹被错误地惩罚。该假设在极端地形(如密集城区或林区)中的泛化能力仍需进一步验证。
- **训练流程较为复杂**:UA-NWM 的训练需分三个阶段(表征学习、确定性预测、HEP 训练),并涉及多个超参数(如压缩 token 数量、子空间秩、多步预测步长)。这种分阶段设计增加了调参负担,且在数据稀缺时可能难以稳定收敛。相比于端到端训练的导航策略,其工程落地门槛更高,实时在线更新的灵活性也受限制。