这篇论文研究多智能体竞争环境中的规范执行机制。作者发现,简单的检测与惩罚规则会被失配智能体利用,即使它们没有被明确训练或提示这样做。论文提出结合长期可靠性估计与针对重复违规的升级惩罚,并在三个模拟环境及多类智能体群体中测试,报告称该机制能降低利用空间,同时以相近或更低成本惩罚违规行为。
最近 24 小时暂无可用热度快照。