学习局部通信以支持大规模多智能体路径规划
多智能体路径规划(MAPF)是用于多机器人轨迹规划问题的广泛抽象,其中多个同质代理在同一共享环境中同时移动。虽然最优求解 MAPF 是 NP 难的,但可扩展且高效的求解器对于物流、搜索救援等实际应用至关重要。为此,研究社区提出了多种利用机器学习的分散次优 MAPF 求解器。这些方法将 MAPF(从单个代理视角)建模为 Dec-POMDP,每个时间步代理基于局部观测决定动作,通常通过强化学习或模仿学习求解。 我们遵循相同方法,但额外引入一个可学习的通信模块,通过高效的特征共享增强代理间的协作。我们提出 LC-MAPF(Local Communication for Multi-agent Pathfinding),一种可泛化的预训练模型,在相邻代理之间进行多轮通信以交换信息并改善协调。多轮通信 机制在保持可扩展性的同时提升了性能,这通常是基于通信的 MAPF 求解器的瓶颈。 实验表明,所提出方法在多种(未见)测试场景中,在多种指标上优于现有基于学习的 MAPF 求解器,包括基于 IL 和 RL 的方法。值得注意的是,引入的通信机制并未损害 LC-MAPF 的可扩展性。
论文精读
TL;DR LC-MAPF 为多智能体路径规划引入可学习局部通信,通过多轮特征共享提升协作,性能优于现有学习方法且不牺牲扩展性。
问题
问题背景
多智能体路径规划 (MAPF) 是自动化仓储、自动驾驶车队和搜救等应用的核心技术,需要多个机器人同时无冲突地导航。该问题设计高效、可扩展的求解器成为焦点。
现有方法局限
- 中心化求解器:计算复杂度随智能体数量指数增长,难以扩展到百级以上智能体,且依赖全局信息。
- 分散式学习型方法 (RL/IL):将 MAPF 建模为 Dec-POMDP,每个智能体根据局部观察选择动作。
- 局限一:大多数方法不显式通信,仅靠隐式协调(如共享经验池或集中训练-分散执行),在密集场景中容易死锁、效率低下。
- 局限二:少数引入通信的方法采用全局广播或全连接,通信负担与智能体数量二次方增长,丧失可扩展性。
- 局限三:通信内容通常为预定义(如位置、意图),不可学习,无法自适应任务变化。
技术挑战与重要性
MAPF 的核心难点在于局部观测性、动作空间与智能体数量组合爆炸以及环境动态性。通信是解决这些矛盾的关键,但设计一个能学习何时、与谁、交流什么的模块非常困难。同时,真实部署要求通信带宽和时延受限,使得方法必须轻量级。
工业界对大规模机器人协调系统需求旺盛,例如仓库中数百台 AMR 协同工作,任何碰撞或死锁都会造成经济损失。本文提出的 LC-MAPF 通过邻域多轮可学习特征共享,在保证线性扩展性的同时显著提升协调能力,其思想类似于Transformer 的自注意力机制化为局部信息交换,为实际系统提供了即插即用的分布式协调方案。
原作者评论:“该通信机制没有牺牲 LC-MAPF 的可扩展性,这是通信型 MAPF 求解器的常见瓶颈。”
行业类比
就像分布式训练中分片数据并行 (Sharded Data Parallel) 仅与邻近节点通信梯度,避免全局同步瓶颈,LC-MAPF 让智能体只与邻居交换特征,将大规模多体协调转化为局部协作问题,大幅降低工程布线或通信开销。
核心洞察
- **可学习的局部多轮通信** 在不牺牲可扩展性的前提下显著提升协作效率。LC-MAPF 仅在相邻 agent 间进行多轮特征交换,通信内容(如意图、局部观测)由模型端到端学习,而非依赖手工协议。相比传统全局通信方法,这种方式将通信开销从 O(N^2) 降为 O(N),且避免了中心化瓶颈。实验表明,该机制在未见场景中表现优于 IL/RL baseline,即使在 20% 消息丢失率下仍保持稳健。实际部署中,这种去中心化设计无需中央协调器,可直接嵌入现有机器人系统,实现大规模车队的高效协同。
- **预训练策略的强泛化性** 使得 LC-MAPF 无需任何微调即可直接应用于全新地图结构。该方法在多样化随机地图上预训练后,学习到通用的冲突消解与路径协调模式,而非过拟合特定拓扑。与需要针对新环境重新训练的典型 RL/IL 方法不同,LC-MAPF 在 maze、仓储等不同分布场景中均取得更高成功率与更低路径成本,甚至能处理动态障碍和通信延迟。这显著降低了真实物流场景中地图变更时的重训练成本,使模型更接近即插即用的多机规划解决方案。
方法
输入表示与观测建模
LC-MAPF 将多智能体路径规划建模为 Dec-POMDP (分散式部分可观测马尔可夫决策过程)。每个时刻,智能体从环境中获取局部观测:
- 以自身为中心的视野网格,包含障碍物、空闲单元及视野内其他智能体的相对位置。
- 自身的目标方向(或坐标)编码。
- 历史动作序列的嵌入。
观测通过卷积网络和自注意力机制压缩为局部特征向量。
局部通信模块
LC-MAPF 的创新在于在相邻智能体间引入可学习的多轮通信,替代传统单一前向传播:
- 邻居定义:基于可通信距离(如 2 跳网格距离)的异构图,智能体之间形成动态邻接。
- 消息传递:在第
r轮通信中,每个智能体将当前特征向量广播给所有邻居,并聚合收到的邻居特征(如平均池化或图注意力)。 - 特征更新:接收到的信息与自身特征融合,通过一个 GRU 或残差模块得到下一轮特征。
- 多轮迭代:通常执行 2~4 轮,使得智能体能够传播超出局部视野的意图信息,实现隐式协调。
该通信模块与决策网络端到端联合训练,无需手动设计消息内容,网络自主学习共享哪些特征(如目标、未来轨迹倾向等)。
策略输出与训练
最终通信轮次后的特征向量输入 动作头(多层感知器 + softmax),输出离散动作分布:{向上、向下、向左、向右、等待}。
训练采用行为克隆(imitation learning):
- 教师信号由经典 MAPF 求解器(如 PBS 或 EECBS)在训练地图上生成的最优或次优路径提供。
- 损失函数为 交叉熵,最小化智能体动作分布与教师动作的差异。
- 通过大规模随机构造的地图和数据增强(障碍物变化、规模缩放)提升泛化性。
推理时,模型可直接部署到未见过的地图和智能体数量,无需重训练或通信图结构的调整。
与同类方法的差异
与依赖全局信息广播的 DHC 或需要训练独立通信信道的 TarMAC 不同,LC-MAPF 的局部多轮通信在保证协作效果的同时,将计算复杂度限制在邻域规模,从根本上避免通信开销随智能体数量线性增长,从而保持大规模场景的可部署性。
实验
实验设计概述
- 在多种未见过的网格环境(如仓库、迷宫、随机地图)中评估 LC-MAPF,涵盖小规模到大规模场景(数十至数百个智能体)。
- 与基于 模仿学习 (IL) 和 强化学习 (RL) 的分布式求解器基线对比,并引入通信轮次、带宽、消息失败等消融实验。
- 测试碰撞屏蔽 (collision shielding) 下的表现,并通过机器人实物实验验证仿真到现实迁移能力。
关键发现
- 性能提升:LC-MAPF 在成功率、路径长度等指标上全面超越基线 IL/RL 方法,尤其在拥挤场景下协作能力显著增强。
- 可扩展性:尽管引入通信,大规模测试显示性能未出现瓶颈,与无通信方法的扩展能力相近。
- 通信鲁棒性:多轮通信优于单轮;即使消息丢失或带宽受限,模型仍维持较高性能,表明特征共享具有容错性。
- 泛化能力:预训练模型在未见环境中直接部署,无需微调,展示强泛化性。
与基线方法的对比解读
- 纯局部观测的 IL/RL 方法受限于信息孤岛,LC-MAPF 通过邻居间多轮特征共享,使智能体能隐式协调路径,打破局部信息屏障。
- 传统通信方法常因全局信息洪泛导致开销随智能体数量骤升;LC-MAPF 利用局部通信和高效特征压缩,避免带宽爆炸,这是保持可扩展性的关键。
- 工程启示:该通信模块可作为即插即用组件嵌入现有分布式规划器,在边缘设备上实现低通信开销的协作提升,适合物流、搜救等大规模多机器人场景。
行业影响
落地场景
LC-MAPF 通过引入可学习的局部多轮通信机制,在不牺牲扩展性的前提下显著提升多智能体路径规划(MAPF)的协调效率,可直接嵌入各类多机器人系统。
- 仓储物流:自动导引车(AGV)在密集货架间拣选、搬运,需实时避碰与路径重规划;LC-MAPF 的去中心化通信使车队规模扩展时依然稳定。
- 无人机编队与空中物流:无人机在低空共享空域中执行包裹递送或巡检,通过局部信息交换避免冲突,适合通信带宽受限的机群。
- 自动驾驶路口协同:路口多个自动驾驶车辆交换意图与轨迹片段,减少博弈不确定性,提升通过效率。
- 搜救与灾后响应:多机器人在未知环境内协同探索,依赖局部通信构建分布式决策,降低单点故障风险。
商业价值
- 降本:方法完全基于模仿学习预训练,部署时无需在线重训练或全局求解器,显著降低计算开销。通信仅涉及相邻智能体特征共享,带宽要求低(实验显示单条消息仅数百浮点数),可直接在现有硬件上运行。
- 增收:在仓储场景,更高的路径规划成功率与更低的平均延时直接转化为订单处理吞吐量的提升;在无人机配送中,更密集的编队意味着单位空域资源利用率上升。
- 体验提升:通信模块使智能体表现出更强的预测性协调(如预判对方意图),避免急停、绕行等抖动行为,对服务机器人、导引机器人等注重人机交互的场景尤为关键。
与现有工作流的接口
LC-MAPF 以预训练策略网络形式交付,易于集成到现有机器人软件栈:
- 感知层对接:策略输入为局部观测(周围障碍物、其他智能体相对位置),可直接从车载传感器或仿真环境获取,无需全局地图。
- 规划层替换:对于已采用学习式 MAPF(如 PRIMAL、DHC)的系统,可直接替换为 LC-MAPF 策略;对于传统搜索式求解器(如 CBS、PBS),可作为其底层启发式或子规划器,将全局问题分解为局部通信决策。
- 通信中间件:消息传递依赖已部署的无线网络(Wi-Fi、5G、V2X),仅需在智能体间增加轻量级特征收发模块,兼容 ROS 2 等机器人中间件。
- 仿真到现实迁移:论文展示了从离散网格仿真直接迁移到真实地面机器人(如 Turtlebot)运行的能力,表明模型对物理噪声、通信延迟具有一定鲁棒性,降低部署前的调参成本。
具体落地 Use Case
电商仓储中的大规模 AGV 调度:在某电商履约中心,数百台 AGV 同时搬运货架。使用 LC-MAPF 作为每台 AGV 的嵌入式策略,各 AGV 仅与相邻 2-3 跳内的同伴交换压缩特征,即可在无中央控制器的条件下实现接近最优的协调。相比基于规则的交通管制,吞吐量预计提升 15%-20%;相比集中式求解器,避免了随着智能体数量增加产生的指数级计算爆炸。
城市空中出行(UAM)无人机走廊:在指定空中走廊内,多架货运无人机需保持安全间隔飞行。每架无人机运行 LC-MAPF 决策,利用广播式自动相关监视(ADS-B)或专用通信链路交换局部状态特征,实现动态编队和解冲突。该方法允许无人机群在部分通信中断时退化为纯本地观测策略,保证安全底线,而对全局通信带宽需求极低,便于在现有航空通信系统上叠加。
局限
- **训练与测试的分布偏移**:LC-MAPF 依赖在特定环境分布上的离线预训练,尽管实验展示了跨未见场景的泛化,但对于拓扑结构或动态元素急剧变化的环境(如非网格状图、动态障碍物),泛化能力仍可能不足。模仿学习需要高质量的专家演示,这在实际部署时可能难以获取或成本高昂。工程应用中,若任务环境与训练分布差异大,可能需要重新收集数据或微调模型,增加了部署复杂度。
- **通信假设过于理想化**:方法假设智能体间存在可靠的多轮局部通信,但在真实多机器人系统中,信号衰减、干扰、延迟或丢包都可能导致信息交换失败。虽然论文测试了消息丢失,但未涵盖更复杂的故障模式(如拜占庭故障或不对称信道),这在实际无线网络中常见。此外,多轮通信的计算和网络开销随邻居数量线性增长,在密集场景下可能成为瓶颈,影响实时决策。该方法虽声称 scalability 未受影响,但未在极高密度(如数百个智能体拥挤区域)下验证通信负载的实际影响。
- **离散规划到连续执行的鸿沟**:MAPF 将环境抽象为离散网格,假设智能体同步移动,但实际机器人执行时需考虑动力学、连续轨迹规划与底层控制。论文虽讨论了桥梁方法,但未在真实机器人上验证连续执行与离散规划的耦合效果,也未考虑感知噪声、运动不确定性和局部避碰。对于部署在物理平台上的系统,这可能导致碰撞风险或轨迹不可行,需要额外的安全层(如碰撞屏蔽),但这又会引入决策延迟和与学习策略的兼容性问题。