环境或任务目标一旦发生突变,协作式多智能体训练积累的历史经验便容易失效。研究者提出名为 PPR 的轻量检测工具,直接对智能体的回报流进行平滑处理并执行统计漂移检测。在定制的 Speaker-Listener 场景中,它在抑制频繁误报与保持检测敏感度之间找到了折中平衡。
最近 24 小时暂无可用热度快照。