论文

DRG-MAPPO: 用于协同空战的分层动态角色图多智能体强化学习

DRG-MAPPO: 用于协同空战的分层动态角色图多智能体强化学习

多智能体强化学习(MARL)已成为自主系统与空战复杂决策的关键范式。尽管 MARL 在空战中展现出显著潜力,但实现高水平的战术协同仍是一项非平凡的挑战,这主要归因于两点局限: 1. 缺乏结构化的关系建模,使智能体难以捕捉战场实体之间复杂且时变的交互; 2. 传统扁平架构往往无法显式建模战术角色,导致高度动态环境下的任务分配含糊不清。 针对上述挑战,我们提出 DRG-MAPPO(Hierarchical Dynamic Role-Graph Multi-Agent Proximal Policy Optimization),一个将基于图的关系建模与动态角色分配相结合的新型 MARL 框架。具体而言,DRG-MAPPO 构建战场交互的图表示,并利用图注意力机制提取我方、敌方与威胁之间的关键关系特征;随后由高层策略通过动态角色分配机制确定战术职责(如 leader 与 supporter)。低层策略以这些角色与编码后的图关系特征为条件执行离散机动动作,从而实现战术策略与协同执行的联合优化。此外,我们设计了目标优先级辅助任务,以促进集火(focus-fire)等行为的涌现。 实验结果表明,DRG-MAPPO 取得了 87% 的 state-of-the-art 胜率,说明该框架在协同空战中有效平衡了关系建模、可解释性与优化稳定性。

论文精读

TL;DR DRG-MAPPO 将图注意力关系建模与动态角色分配结合,让多智能体在空战中自主形成 leader/supporter 协同,并借目标优先级辅助任务实现集火,达到 87% 胜率。

问题

问题背景

多智能体强化学习(MARL)已成为自主系统与协同空战决策的核心范式,研究重点转向复杂动态环境下的战术协同、关系推理与任务分配。

现有方法局限

  • 关系建模缺失或静态:传统 MARL 方法如 MAPPO、QMIX 通常将其他智能体视为状态向量的一部分,缺乏显式的实体关系图,难以捕获敌我双方及威胁目标之间随战局演化的时变交互。
  • 扁平策略导致角色模糊:多数算法采用单一策略网络输出动作,未显式建模“leader / supporter”等战术角色,在高动态对抗中任务分配容易重叠或冲突,降低协同效率。
  • 角色分配固定或手工设计:少数层级强化学习(HRL)方法虽然引入高层策略,但角色集合或切换规则常依赖先验知识,无法根据实时战场态势自适应调整。
  • 优化不稳定:空战环境部分可观测、稀疏奖励,普通 MAPPO 在长期 horizon 下容易策略退化或收敛震荡。

为什么难且重要

空战是典型的 Dec-POMDP 场景:智能体仅拥有局部观测,对手策略非平稳,且实体间关系(如敌我距离、威胁等级、火力协同)随时间连续变化。要同时优化“战术角色分配”与“底层机动动作”,本质上是一个双层耦合优化问题——高层角色的离散选择必须为低层策略提供可辨识的条件信号,否则梯度信号会互相干扰。业界对可解释性与稳定性要求高:自主集群和无人系统需要角色-关系可追溯的决策,而不是黑箱输出。因此,如何将图神经网络的关系归纳偏置与层级策略有机融合,并保持训练稳定,是当前 MARL 落地的重要瓶颈。

行业类比

类似于多机器人仓储调度中,需要动态分配“搬运 / 充电 / 分拣”角色,并依据实时任务关系图协同避让与加速,单一扁平策略难以胜任。

核心洞察

  • DRG-MAPPO 的核心洞见是把空战协同拆成两个可学习层次:高层动态分配战术角色,低层在角色和图关系特征条件下输出机动动作。与现有 MARL 基线(如 MAPPO、QMIX 及其图扩展)不同,它显式建模战场实体(友方、敌方、威胁)的异构图并引入角色语义,而非把所有智能体当作同质节点或只做隐式注意力加权。这缓解了 flat 架构中任务分配模糊的问题,也让协作结构可解释。
  • 辅助 target-priority 任务是让集火行为自然涌现的关键:通过对目标优先级施加额外监督或奖励塑形,引导智能体在稀疏胜负奖励下更快形成集中火力。同类工作常用全局奖励共享或简单距离奖励,缺乏对协作模式的显式引导,导致训练不稳定或难以收敛到复杂战术。该设计以极低成本引入领域先验,显著提升胜率与行为可读性,是工程上可复用的技巧。

方法

输入:每个智能体获得局部观测,包含自身状态(位置、速度、姿态)、探测到的盟友/敌人/威胁实体属性(类型、相对位置、运动趋势等)。系统将所有实体建模为图节点,节点特征拼接实体类型与动态属性,边权重由相对距离、视线关系或攻击关联动态计算。

关键模块:

  1. 图注意力编码:使用图注意力网络对构造的实体关系图进行消息传递,每个节点聚合邻居信息,输出关系增强的实体表示,捕捉战场中时变交互。
  2. 分层策略:高层策略(角色分配网络)以全局图特征或各智能体池化特征为输入,输出离散角色概率分布(如 leader / supporter),实际角色通过采样或 argmax 确定;低层策略(动作网络)以角色 one-hot 与图编码特征拼接为条件,输出机动动作概率分布。
  3. 目标优先级辅助任务:共享图编码器后接一个预测头,输出每个敌方实体的优先级分数,通过辅助损失引导智能体区分威胁等级,促进集中火力等战术行为。
  4. 联合训练目标:主损失为 MAPPO 的 clipped surrogate objective,加入辅助任务交叉熵损失与策略熵正则,整体端到端优化。

输出:环境执行每个智能体选择的离散机动动作(如转向、加速、攻击),同时产生可解释的角色分配结果。

差异点:相较于传统 MAPPO 或仅使用 GNN 的关系型 MARL,DRG-MAPPO 显式引入动态角色分配层级,将战术分工从隐式策略中解耦,结合图注意力建模实体关系,既增强协同稳定性又保持可解释性。

实验

实验设计

  • 在协同空战仿真环境中训练与测试,对比 MAPPO 等主流 MARL 基线。
  • 开展消融实验,分别移除图关系建模、动态角色分配、目标优先级辅助任务,评估各模块贡献。
  • 进行对抗实验与战术行为可视化,分析角色分工(如 leader / supporter)与集火行为。

关键发现

  • DRG-MAPPO 达到 87% 胜率,取得 state-of-the-art 结果,表明分层角色分配与图注意力关系建模能有效提升协同战术。
  • 辅助任务促进**集火(focus-fire)**等战术行为涌现,低层动作策略在高层次角色条件下更稳定。

与基线对比解读

  • 相比扁平架构 MAPPO,DRG-MAPPO 显式建模动态角色与实体关系,避免了任务分配模糊问题。图注意力捕捉空战实体间的时变交互,提供可解释的战术依据。消融实验进一步证实各组件对最终胜率均有正向贡献,且框架在优化稳定性上优于基线。

行业影响

落地场景

DRG-MAPPO 的核心组件——动态角色分配与图注意力关系建模,可迁移至任何需要多智能体协同且实体关系时变的场景。典型包括:

  • 无人机编队巡检/物流:根据任务阶段动态分配 leader / supporter 角色,图建模无人机、障碍物与目标间关系。
  • 智能仓储多机器人拣选:机器人需根据货架位置、订单优先级动态分工,图注意力可捕捉实时依赖。

商业价值

  • 降本:减少人工调度与规则设计,动态角色分配让策略自动适应任务变化,降低运营人力成本。
  • 增效:协作效率提升(论文中 87% 胜率)可转化为更高吞吐量或任务完成率。
  • 可解释性:角色标签与图注意力权重提供决策依据,便于安全审计与调试。

相比传统固定角色或全共享策略,动态角色图减少冗余通信并提升收敛稳定性,工程上可降低多智能体系统的调试难度。

现有产品 / 工作流接口

框架可作为独立策略模块嵌入现有 MARL 训练管线:

  1. 输入:环境返回的实体列表(位置、速度、类型)构建图;
  2. 高层策略输出角色概率分布,低层策略输出离散动作;
  3. 与 MAPPO 兼容,可直接替换 actor-critic 网络结构,无需重构训练循环。

具体使用案例

  • 电商仓储多机器人调度:某电商仓库有 50+ AGV 搬运货架,通过 DRG-MAPPO 动态分配 取货、补货、避让 角色,图建模 AGV、货架、拣选站关系,预计减少 20% 碰撞与空驶里程。
  • 自动驾驶车队协同变道:在高速公路场景,车辆编队动态产生 头车 / 跟随车 角色,图注意力建模前后车距、速度差,提升变道安全性与通行效率。

局限

  • - **仿真保真度局限**:论文在自定义空战仿真环境中验证,该环境对气动、传感器、通信延迟等建模可能简化,未涉及真实平台或高保真模拟器。这导致 87% 的胜率可能无法直接外推到实际空战场景,特别是动态目标运动和复杂电子对抗条件下。需要在更高保真仿真或半实物环境中进一步验证。
  • - **图结构依赖先验知识**:图注意力机制中的关系图需要预定义实体类型(盟友/敌人/威胁)及其连接方式,这种静态或半静态图结构可能无法充分表达空战中时变的交互关系(如临时编队、威胁优先级动态变化)。若场景变化,需重新设计图构建规则,限制了框架在开放环境下的泛化能力。
  • - **层次策略的训练稳定性与对比不足**:动态角色分配通过高层策略输出离散角色,低层策略基于角色执行动作,这种层次结构可能引入额外的非平稳性和训练困难。论文未详细分析角色分配策略的收敛性,且实验主要与 MAPPO、QMIX 等扁平基线比较,缺少与现有层次 MARL 方法(如 RODE、HAPPO)的直接对比,难以证明角色机制带来的增益是否优于更简单的分层方案。
论文Junlin Liu2026-09-10原文

相关内容