Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

阅读原文
arXiv 预印本·Fatemeh Saberi Khomami·2026年9月4日 15:49

协作式多智能体强化学习的在线突变点检测方法 PPR

原标题:Online Change-point Detection for Cooperative Multi-Agent Reinforcement Learning

论文68

合作式多智能体强化学习(MARL)系统依赖过往经验来学习协同行为,但如果在训练过程中环境或任务目标发生改变,这些经验可能会变得不可靠。在这种情况下,智能体在决定如何适应之前,首先需要一种方法来识别情况已经发生变化。本文研究了利用基于奖励的信号在合作式 MARL 中进行在线变点检测。我们提出了“过往奖励模式”(Patterns of Past Rewards,PPR),这是一种轻量级且与算法无关的检测器,它对智能体的回报流进行平滑处理,突出近期的变化,并应用统计漂移检测器来标记显著转变。我们在基于多智能体粒子环境(Multi-Agent Particle Environment)定制的“说话者-聆听者”(Speaker-Listener)环境中,针对两种受控的非平稳场景对 PPR 进行了评估。实验结果表明,检测速度与告警稳定性之间存在权衡:平滑回报基线检测得更早,但会产生大量重复告警;相比之下,直接将检测器应用于原始回报往往会漏检转变。PPR 则通过限制冗余检测并保持对受控转变的识别能力,提供了一种更为均衡的方案。这些研究结果表明,PPR 是一种轻量级且基于奖励的监控工具,能够使合作式 MARL 系统在训练过程中可靠地识别重大变化。

为什么值得读

为多智能体强化学习中的非平稳环境监测提供了一种低开销且与模型解耦的实用方案,有助于及时触发适应策略。

标签

MARLReinforcement LearningChange-point DetectionNon-stationarityMulti-AgentOnline Detection

评分依据

  • 新颖性68
  • 影响力65
  • 实践价值72
  • 可信度70
  • 时效性68