论文研究有限马尔可夫决策过程中的共安全线性时序逻辑(sc-LTL)目标,将其通过乘积构造转化为最大可达性问题。作者指出,TD、Q-learning 等直接自举方法可能因 Bellman 方程非压缩及解不唯一而无法收敛到最优策略,并提出先用折扣代理识别钳制集合、再执行无折扣策略评估与贪心改进的两步方法,证明其几乎必然收敛且有限步终止于最优策略。
最近 24 小时暂无可用热度快照。