ORCAID提出一种从深度强化学习策略中提取可解释规则的方法,面向混合连续—离散状态及连续动作环境。算法以斜决策树划分状态空间,并在叶节点拟合局部线性模型,通过随机初始化、局部优化、反向消除和相邻叶合并生成精简规则;论文称其在多个环境中保持较强性能,甚至可提升原策略表现。
最近 24 小时暂无可用热度快照。