论文

空间中的自我:无人机具身智能中自我意识与空间认知的基准测试

空间中的自我:无人机具身智能中自我意识与空间认知的基准测试

自主无人机系统日益依赖多模态大语言模型 (MLLM) 在复杂真实环境中运行。此类具身场景不仅要求理解周围空间,还需维护对智能体自身的一致表征。然而,现有面向无人机的方法与基准大多以环境为中心,侧重空间理解任务,而智能体的自我意识仍是隐式。为填补这一空白,我们提出 SIS-Bench,一个在统一“空间中的自我”框架下评估无人机具身空间智能的基准。SIS-Bench 沿空间和自我两个互补维度,以及感知、记忆、推理三级层次组织评估。它包含 4,856 个问答对,涵盖 13 项任务,这些任务来自 1,646 个真实无人机视频,通过任务条件构建管道及专家验证得到。 广泛评估揭示,当前 MLLM 在建模动态和以智能体为中心的过程中存在根本性局限。尤其,我们观察到空间认知与自我意识之间存在明显不平衡,以及跨认知层级的渐进性能退化。受此启发,我们进一步探索一种运动感知表示,通过光流与视觉特征融合纳入与自我相关的动态。实验结果表明,对智能体运动进行建模持续提升感知与记忆性能,不仅在空间认知上,在自我意识上也是如此,并泛化至下游无人机决策任务。 我们的结果凸显了自我意识对于推进具身空间智能的重要性,并为运动感知的“空间中的自我”建模提供了新基准与实证证据。

论文精读

TL;DR SIS-Bench 首次将无人机具身智能中的自我意识与空间认知统一为“空间中的自我”评测框架,并验证运动感知建模可提升多模态大模型在感知、记忆上的表现。

问题

问题背景

具身智能在无人机领域的应用正推动多模态大语言模型(MLLM)从环境感知向自我感知延伸。当前基准主要评测空间理解,但无人机自主操作需同时建模周围空间与自身状态,形成统一的 self-in-space 表征。

现有方法局限

现有无人机评测(如 UrbanVideo-Bench,VisDrone)存在三大局限:

  • 环境中心视角:任务仅涉及空间目标检测、跟踪,忽略 agent 自身动态(位置、姿态、运动模式)对决策的影响。
  • 认知层次单一:多停留在感知阶段,缺乏对记忆(如历史轨迹追溯)和推理(如路径规划)的系统评测。
  • 自我意识隐式化:即便涉及 agent 行为,也仅作为上下文片段,未显式建模为独立评测维度,导致 MLLM 在动态场景下常混淆自我与环境信息。

技术挑战与重要性

自我意识空间认知的耦合是核心难点:

  1. 动态模型缺失:MLLM 擅长静态图文,但无人机视频包含连续运动流,模型需从光流等底层信号中提取自我运动表征,现有框架缺乏此类 motion-aware 设计。
  2. 认知层次退化:从感知、记忆到推理,性能急剧下降,揭示当前模型缺乏持久、一致的 agent 中心记忆。
  3. 平衡性难题:空间认知(如目标定位)与自我意识(如自身转向判断)常此消彼长,难以统一优化。 业界对具身智能的可靠性要求极高,该问题直接制约无人机在搜救、巡检等高风险场景的落地。

行业类比

如同自动驾驶中车辆自我定位环境感知缺一不可,无人机若仅“看懂环境”却“不知自身状态”,将无法完成导航、避障等核心任务,运动感知的缺失如同人类视觉但无前庭平衡觉。

核心洞察

  • **自我意识与空间认知的统一评估揭示了 MLLMs 的根本局限**:SIS-Bench 首次将无人机具身智能评估从环境中心转向 self-in-space 联合框架,显式量化 self-awareness 与 spatial cognition 在感知、记忆、推理三层次上的表现。与现有仅关注空间理解的基准不同,它暴露了当前模型在动态、代理中心建模上的严重不足,且自我维度的性能远弱于空间维度,为下一代具身模型的设计提供了明确短板诊断。
  • **运动感知表示是实现自我空间整合的关键突破**:SIS-Motion 框架通过融合光流等自相关动态特征,显式建模代理运动,在空间认知和自我意识任务上均实现感知与记忆性能的稳定提升,并能迁移提升下游无人机导航决策。这证明了运动通道是连接外部空间与内部自我表征的核心桥梁,而现有 MLLMs 普遍缺乏这一机制,为运动感知融合的技术路线提供了实证支撑与可复现的基准。

方法

SIS-Bench 构建流程

输入:来自 AirScapeUrbanVideo-BenchVisDrone 等数据集的 1,646 段真实无人机视频,覆盖多种场景与飞行模式。

关键模块

  1. 视频预处理与多样性增强
    • 通过 VisDrone 视频格式转换、AirScape 片段拼接、长视频保留以及乱序帧重组,丰富时序复杂度和空间变化类型。
    • 构建任务条件化生成流水线(Pipeline-A/B/C),自动抽取视觉上下文并为每种任务生成候选问答对。
  2. 双维度三层次任务设计
    • 将具身空间智能建模为 “空间—自我”双维度感知—记忆—推理三层级,共 13 类任务(如自我位置感知、运动轨迹预测、遮挡目标追踪、路径规划等)。
    • 每一任务都从纯空间视角或融入代理自身状态的视角出发,强制模型同时处理环境信息与自我动态。
  3. 专家验证与质量控制
    • 所有自动生成的 QA 对经双重专家审核修正,剔除歧义或非具身样本,最终保留 4,856 个高质量问答对,确保评测效度。

输出SIS-Bench 基准,提供标准化评测协议,支持 zero-shot 与 fine-tuning 评估。

SIS-Motion 运动感知探索

基于 SIS-Bench 揭示的自我意识弱于空间认知的失衡现象,进一步提出 SIS-Motion 框架

  • 输入:无人机视频帧序列。
  • 关键模块:提取 光流(optical flow) 作为代理自身运动的显式表示,与原始视觉特征通过融合模块结合,注入 MLLM 的视觉编码器。
  • 训练数据:构建 SIS-Motion-54K 数据集,包含 54K 由光流条件化生成的 MCQ/开放问答/描述样本,用于微调模型关注运动动态。

输出:运动感知表示,在感知和记忆任务中稳定提升空间认知与自我意识性能,并可迁移到下游无人机导航决策(如路径规划)。

与同类环境中心基准不同,SIS-Bench 首次将代理自我意识作为独立显式维度,并通过运动感知建模证明其对空间智能的增益,而非仅评估被动环境理解。

实验

实验设计

SIS-Bench 覆盖 1,646 段真实 UAV 视频,构造 4,856 个 QA 对,按空间认知 (Space)自我意识 (Self) 两个维度、感知 / 记忆 / 推理三个认知层次组织 13 项任务。基线评测了 GPT-4o、Gemini-1.5 Pro、LLaVA-OneVision、Qwen2-VL、InternVL2 等主流 MLLM;所有模型均采用零样本 / 少样本推理,部分开源模型进行指令微调对照。随后提出 SIS-Motion 框架,利用 光流 与视觉特征融合注入自运动信息,构建 SIS-Motion-54K 数据集,基于 LLaVA-1.5-7B 与 Qwen2-VL-2B 微调并迁移至 UAV 导航决策任务。

关键发现

  • 静态 MLLM 存在严重的自我意识短板:几乎所有模型在自我感知与记忆任务上的准确率显著低于空间认知,推理层性能进一步断崖式下跌,暴露出缺乏动态自我表征的局限。
  • 运动感知增益一致且显著:融合光流的 SIS-Motion 在空间认知与自我意识两个维度上均带来可见提升,尤其是感知和记忆层;与纯空间 baseline 相比,自我相关任务的增益更为突出。
  • 下游泛化能力:在 UAV 导航多选任务上,运动感知微调后的模型相比仅做标准视觉微调的模型,路径规划正确率明显提高,表明自我运动建模对真实世界决策有正向迁移

对比解读

现有 UAV 基准(如 VisDrone、UrbanVideo-Bench)几乎完全围绕外部环境理解,忽略无人机自身状态。SIS-Bench 首次将自我意识显式纳入评测体系,揭示 MLLM 在“我在何处、如何运动”方面的根本性缺陷。运动感知策略则证明:仅增加轻量光流分支即可弥补纯 RGB 表示中缺失的动态线索,且这一提升可泛化到多种模型架构,为具身视觉语言模型的下一步设计提供明确方向——从环境中心转向自我-空间协同建模

行业影响

落地场景

SIS-Bench自感知运动建模 主要赋能自主无人机系统,在产品层面可应用于:

  • 物流配送:无人机在复杂城市或仓储环境中飞行,需实时理解自身与动态障碍物的相对关系,提升安全避障与精准送达能力。
  • 基础设施巡检:如电力线路、油气管道巡检中,无人机需保持对自身姿态、距目标物的精确感知,避免碰撞并确保数据采集质量。
  • 农业监测与安防监控:在广阔、非结构化场景下,自我空间感知有助于无人机在无 GPS 或弱信号时稳定悬停与按计划航线飞行。

商业价值

当前 MLLM 驱控的无人机普遍缺乏以代理为中心的自我意识,导致在动态场景中决策鲁棒性差。SIS-Bench 揭示的空间认知与自感知失衡以及运动感知增强方法,可直接影响以下商业指标:

  • 降本:减少因自我定位失准导致的坠机或任务失败,降低硬件损耗和人工接管成本。
  • 增收:支持更复杂、高价值的自动化任务(如夜间巡检、恶劣天气配送),扩大无人机服务市场。
  • 体验提升:端到端自感知的提升使飞行更流畅,减少因“犹豫”或重规划造成的延迟,提升客户体验。

与现有工作流集成

SIS-Bench 和 SIS-Motion 框架可作为标准化评估与增强套件,集成到现有无人机软件栈(如 Auterion/MAVSDK、PX4 生态)中:

  • 评估阶段:在模型选型或微调后,用 SIS-Bench 测评 MLLM 的自我感知与空间认知水平,识别薄弱点。
  • 推理增强:将光流-视觉特征融合模块(类似 SIS-Motion 的流水线)作为预处理插件,嵌入到视频流 → MLLM 的管道中,输出带运动线索的表示。
  • 下游决策:在导航栈中,将增强后的 agent-centric 特征输入到规划器,或直接微调用于特定任务(如路径规划)。该模块可封装为 ROS 节点,与 SLAM 和轨迹规划模块松耦合。

具体落地场景示例

  1. 电商无人机配送:某全球电商平台的无人机配送服务,在城郊社区投递时,常面临树木、临时线缆等半静态障碍。引入自感知运动模型后,无人机可更早判断自身相对障碍的接近速度,动态调整航路,避免“视野内无物但突然碰撞”的感知滞后问题。
  2. 风电场叶片巡检:风电场通常地处偏远,气候多变。无人机在近叶片飞行时,需维持稳定的相对位置和朝向。自我感知增强能让无人机在阵风扰动下快速修正对自身漂移的认知,从而保持安全距离,提高巡检作业的连续性和数据一致性,减少复飞次数。

局限

  • 基准构建数据来源于 AirScape、UrbanVideo-Bench 和 VisDrone 等公开数据集,场景以城市街道和交通俯瞰为主,缺少夜间、大雾、强风等复杂天气条件以及室内、丛林等多样环境,视频中的无人机动作多为稳定飞行与简单转向,缺少翻滚、避障等动态交互行为,这导致 SIS-Bench 的“自我”感知任务偏重被动观察而非主动决策,对极端条件下的自感知与空间推理评估覆盖不足。
  • SIS-Motion 框架利用光流作为自运动线索,并通过简单的特征拼接与线性投影与视觉特征融合,但光流仅反映像素级运动,无法解耦摄像头自运动与场景物体运动,且未与无人机机身提供的 IMU、GPS 或位姿估计等物理状态信息结合,使自我动态的建模粒度较粗。此外,融合模块缺乏时序注意力机制,难以捕捉长程运动依赖,限制了在复杂动态场景中的感知与记忆表现。
  • 实验评估集中于开源 MLLMs 的冻结权重零样本测试,未对模型在 SIS-Bench 任务上进行指令微调,可能低估模型在领域数据上的潜力。下游导航迁移仅构建了多选形式的路径规划分类任务,未在仿真器或真实无人机闭环控制中验证,缺乏反应实时推理延迟、执行策略鲁棒性等工程指标,使得 SIS-Motion 在实际飞行系统中的收益并不明确。
论文Zhishan Zou2026-07-14原文

相关内容