论文

Evaluating Multimodal LLMs as Generalist Vision-Language-Action Agents for Drone Control: Commanding, Approaching, Track

Evaluating Multimodal LLMs as Generalist Vision-Language-Action Agents for Drone Control: Commanding, Approaching, Track

多模态大语言模型 (MLLMs) 是图像和视频的强感知器。我们探究这种能力延伸到行动领域的程度:直接将 MLLM 放入无人机控制回路,其全部动作空间仅由提示词声明。近期系统虽已尝试此设定,但逐渐收窄了模型的决策范围,我们则将其重新拓宽。 我们提出 DroneCATS-Agent 架构,其中 MLLM 是可替换组件,并构建 DroneCATS 基准,将模型视为独立变量。我们的智能体不仅飞向某个像素,还委托模型执行偏航与搜索、在不确定时斟酌决策、并自行声明到达——全程无需微调或函数调用模式。评估前沿与开源模型在四项核心能力(接近可见目标、跟踪移动目标、搜索初始视野外目标、指挥多无人机编队)上的表现,揭示即使最简单的具身设定也远未解决。关键的是,为定位最先失效的环节,我们的模型规模下探至 2B 参数。结果暴露鲜明悖论:失效的不是飞行本身。小型开源模型常比前沿模型更可靠地飞入成功半径,却因过早或不声明到达而输掉回合;多机指挥进一步放大分歧,小模型会盲目复制单一坐标到不同视角。 视为视觉-语言-动作智能体,模型的空间感知尚可,但动作协议不佳。区分可部署边缘模型与前沿模型的并非导航能力,而是维持所声明协议并发出正确终止动作的纪律。开放问题在于以机载计算代价弥合此差距——得到能持久规划并精确感知完成的快速模型——而 DroneCATS 正是为度量这一距离而生。

论文精读

TL;DR DroneCATS 将多模态大模型直接嵌入无人机控制回路,发现小型开源模型导航达标率不输前沿模型,却因过早或从不宣告到达而失败;关键差距是终止动作协议,而非飞行能力。

问题

问题背景

多模态大模型 (MLLMs) 在图像和视频感知上已经成熟,业界正探索将其作为 vision-language-action agents 直接嵌入无人机控制闭环。核心问题从“能否看见”转向“能否行动”,即模型能否仅凭 prompt 声明完整动作空间来操控无人机。

现有方法局限

近期系统虽尝试让 MLLM 参与无人机控制,却逐渐收窄决策空间:

  • 仅让模型输出目标像素或相对位移,剥夺其偏航搜索、不确定时 deliberate、自我宣告到达等高层能力;
  • 依赖 function-calling schema 或微调适配动作,模型无法作为独立变量被公平评估;
  • 缺乏统一基准,不同系统的任务设定和指标各异,难以定位边缘场景下的首要失效点。

为什么这个问题难/重要

挑战在于无人机任务要求模型同时具备空间感知、持续规划和协议纪律。DroneCATS 基准发现,小型开源模型(低至 2B 参数)往往能可靠导航进入成功半径,却因提前或完全不宣告终止而失败;多机指挥中,小模型会盲目复制单一坐标到不同视角。这说明瓶颈不在飞行控制,而在维持声明的 action protocol 与正确发出终止动作。业界对端侧低算力部署的模型有实际需求,缩小这一差距是开放问题。

行业类比

类似自动驾驶中感知模型输出可靠,但决策层因协议不一致导致接管失败——感知能力不等于可部署的闭环行动纪律。

核心洞察

  • 导航能力与动作协议纪律在 MLLM 中是可分离的评估维度:小模型经常比前沿模型更可靠地飞入成功半径,却因过早或缺失终止信号而失败。以往多智能体/具身基准通常只看整体成功率或假设更大模型更强,DroneCATS 把模型作为自变量后发现,空间感知(导航)与行动纪律(self-declare arrival)脱钩,小模型在纯飞行上反而更稳,其失败几乎全在协议遵守上。这提示工程上不应只追求更高参数,而应单独优化并测试模型的终止判定与协议一致性。
  • 正确终止动作是当前 MLLM 无人机控制的最关键瓶颈:模型常无法判断何时完成任务,导致整个 episode 无效。这挑战了把 MLLM 当作通用视觉-语言-行动智能体的隐含假设——感知和规划虽强,但缺少对任务完成条件的显式建模。与依赖 function-calling 或微调的系统不同,DroneCATS 要求模型仅从 prompt 声明整个动作空间并自发终止,暴露出模型在自我完成判定上的系统性缺陷,说明实用部署需要外部 verifier 或更明确的完成信号。
  • 多无人机指挥暴露出 MLLM 的视角混淆与对象恒常性缺失:小模型倾向于把单一坐标盲目复制到不同无人机视角,导致整体失败。这说明多智能体协调并非单智能体能力的简单叠加,模型必须理解不同视角下的空间参照关系。现有基准很少同时考察多机视角一致性与指令泛化,DroneCATS 的 multi-drone commanding 设置直接揭示了这种能力的不足,对未来多机协作的提示工程与架构设计有重要参考价值。

方法

输入

DroneCATS-Agent 的输入为图像/视频流与自然语言动作空间声明。动作空间在 prompt 中完整描述,包括 go、rotate、search、arrive 等原子动作,所有决策信息依赖 MLLM 的视觉感知与文本理解,无外部结构化函数调用。

关键模块

架构以 MLLM 作为可替换的策略核心(swappable policy),采用纯 prompt-based 控制循环:

  1. 感知:MLLM 直接接收当前无人机视角的图像或视频帧,同时获得任务指令与动作说明。
  2. 推理:模型被赋予完整决策自由度,可自主选择偏航搜索、接近目标、跟踪移动对象、多机指挥等高层行为,并允许在不确定时显式思考(think 机制)。
  3. 执行:模型输出自然语言动作命令,由执行层解析并映射为底层控制信号,包括移动、旋转、终止声明。终止动作由模型自我判断完成,而非由外部指标触发。

输出

模型输出为离散的高层动作序列,包含动作类型与参数(如目标坐标、搜索方向),以及任务完成声明(arrive)。执行层将声明终止的动作视为 episode 结束信号。整个系统无需 fine-tuning,不依赖 function-calling schema,验证 MLLM 作为零样本具身智能体的能力。

与同类方法的差异

与近期工作中逐步收窄模型决策权限(如仅允许飞向指定像素、预设动作模板)的做法相反,DroneCATS-Agent 将完整动作空间与决策责任交还模型,仅通过 prompt 声明协议,从而暴露模型在持续协议遵守与正确终止上的真实短板。

实验

实验设计

DroneCATS-Agent 将 MLLM 作为可替换组件,动作空间完全在提示词中声明,无微调或函数调用模式。DroneCATS benchmark 以模型为自变量,评估四个核心能力:接近可见目标、跟踪移动目标、搜索初始视野外、指挥多无人机编队。模型范围从 frontier 到 2B 参数的小型开源模型,所有模型直接在模拟环境控制回路中推理。

关键发现

  • 小模型常更可靠地进入成功半径,但因过早或不声明到达而失败。
  • 多无人机指挥中小模型盲目复制单一坐标到不同视角,加剧分歧。
  • 空间感知尚可,但行动协议纪律不足;区分可部署边缘模型与 frontier 模型的不是导航能力,而是持续遵守协议并发出正确终止动作的纪律。

与基线对比解读

并非飞行失败,而是协议失败。

该工作挑战了近期窄化模型决策的趋势,重新拓宽决策范围。工程启示在于:针对边缘部署的优化应聚焦动作纪律和终止条件,而非单纯提升感知精度。机载计算成本约束下缩小该差距是开放问题,DroneCATS 旨在测量该距离。

行业影响

落地场景

自主巡检 与 仓储物流 无人机是直接落地场景。例如电商仓储中,无人机可自主搜索货架、接近目标 SKU 并自报完成,替代人工盘点;电力线/管道巡检中,MLLM 直接接收机载摄像头图像,执行 yaw 搜索、go 接近、declare arrival 终止,无需每类任务单独训练视觉模型。多无人机协同 可应用于农业植保编队或安防巡逻,中央 MLLM 同时指挥多机搜索与跟踪。

商业价值

降低远程操作员人力成本:传统无人机需飞手持续遥控,MLLM 作为通用决策层可自主完成“接近-跟踪-搜索”闭环,减少人工干预。论文揭示小模型导航能力已达标但终止判断不可靠,这意味着部署时可在边缘算力上用 2B~7B 模型替代大模型,降低云端依赖与通信延迟,但需重点优化动作协议纪律——通过少量后训练或 test-time deliberation 就能显著提升任务成功率,从而控制总拥有成本。

与现有产品/工作流的接口

可直接集成到现有飞控栈(PX4、ArduPilot)之上:MLLM 接收图像与状态文本,输出高层次动作,由 back-projection 映射为底层姿态/速度指令,无需 function-calling schema。提示词即动作空间定义,便于业务方快速适配不同机型与任务。多机场景下,中央 MLLM 的分发指令需加入一致性校验,防止小模型盲抄同一坐标到不同视角。参考实现见 DroneCATS。

局限

  • **仿真到现实迁移未验证**:实验完全在模拟环境中进行,未部署到真实无人机。现实场景中的视觉噪声、风扰、通信延迟与边缘推理算力约束会显著影响 MLLM 的闭环决策质量,尤其对小模型影响更大。论文未提供任何 sim-to-real 的初步验证或明确的部署可行性讨论,这限制了结论在真实 UAV 任务中的外推性。
  • **动作协议设计与模型原生能力耦合过强**:将全部动作空间仅通过 prompt 声明,不使用 function-calling 或微调,虽然能公平衡量模型的原生遵从度,但也放弃了结构化输出约束等工程化缓解手段。论文未与采用 constrained decoding 或 function-calling 的同类系统做横向对比,因此无法判断协议失败在多大程度上源于模型自身,而非接口设计。
  • **基准规模和多样性有限**:四类任务(逼近、跟踪、搜索、多机指挥)虽然覆盖核心能力,但地图、障碍物、物体类别与环境纹理可能不足以代表真实 UAV 任务的复杂分布。评价指标仅采用二元的“成功半径 + 正确终止”,缺少轨迹平滑度、能耗、飞行效率等工程指标。模型名单以中小开源模型为主,缺乏更多闭源前沿模型在 API 调用模式下的系统对比。
论文Jaewoo Park2026-09-01原文

相关内容