论文提出神经符号强化学习算法 KGRL,面向每次决策同时包含符号动作与数值参数的 PAMDP。算法利用 Datalog 知识库筛除不适用动作、约束可行参数,并通过梯度迭代细化参数估计,从而提升探索与训练样本效率,同时记录触发规则,为决策提供局部过程解释。
最近 24 小时暂无可用热度快照。