arXiv 预印本Zetong Xuan论文86
面向共安全 LTL 规划的精确无模型策略迭代
原标题:Exact Model-Free Policy Iteration for Co-safe LTL Planning
本研究针对有限马尔可夫决策过程中无模型强化学习的协安全线性时序逻辑(sc-LTL)目标展开研究。通过标准的乘积构造,该问题可以归约为最大可达性目标。对于这一问题,直接基于样本的自举方法(例如时序差分学习或 Q 学习)可能无法收敛到最优策略,这是由于贝尔曼方程具有非压缩性,且其解并不唯一。我们提出了一种新的两步无模型强化学习方法:首先利用折扣替代目标确定一个钳制集合,以消除这种非唯一性;随后进行无折扣策略评估,并结合贪心策略改进,在理论上保证找到最优解。我们证明了策略评估步骤几乎必然收敛,并证明策略迭代算法能够在有限步内终止于最优策略。我们还通过随机网格世界上的数值实验验证了这些理论结果。
为什么值得读
当前值得阅读,因为它针对时序逻辑强化学习中“无模型可用但 Bellman 解不唯一”的核心收敛障碍,给出带有限终止保证的策略迭代方案。
标签
强化学习sc-LTL策略迭代无模型学习最大可达性形式化规划收敛性