PRIMAL3:借助 LaCAM3 的强化学习与模仿学习多智能体寻路
原标题:PRIMAL3: Pathfinding via Reinforcement and Imitation Multi-Agent Learning - Leveraging LaCAM3
我们提出了 PRIMAL3,这是一种面向多智能体路径规划(MAPF)的超大规模学习框架,集成了强化学习、拓扑感知通信、LaCAM3 引导训练以及基于 PIBT 的动作优化。PRIMAL3 针对拓扑关键状态下的失败问题,在这些状态中,智能体必须围绕瓶颈、死胡同和持续性冲突进行果断协同。每个智能体均使用由割点、死胡同区域、最短路径距离和阻塞估计等信息提取的特征进行表示。两个互补图用于捕捉智能体之间的交互:同向跟随图沿兼容路径传播多跳上下文信息,而异向冲突图则通过掩码注意力和相对特征,区分争夺共享空间的智能体。训练过程中,我们提出利用策略熵识别不确定智能体,并由 LaCAM3 为这些智能体提供由置信度触发的动作干预以及带标签平滑的模仿学习目标。在执行过程中,优先级感知的 PIBT 模块结合持续性优先级、学习得到的优先级和距离感知优先级,以及策略感知的回退偏好,对提出的联合动作进行优化,同时保持无碰撞执行。最终形成的框架将学习式探索与结构化专家指导相结合,而无需在推理时使用 LaCAM3。实验表明,PRIMAL3 显著优于当前最先进的基于学习的方法基线,并可扩展至拥有多达城市级规模 100,000 个智能体的超大型实例。真实世界实验进一步证明了将 PRIMAL3 部署到实体机器人系统上的可行性,消融实验也验证了我们所提出各组件的独立贡献。项目主页:https://marmotlab.github.io/PRIMAL3/
为什么值得读
MAPF 正从数百智能体走向城市级规模,PRIMAL3 展示了如何把学习策略与结构化规划器结合,值得立即关注其可复现实验与部署成本。