论文在部分可观测强化学习中,系统交叉比较情景探索奖励与多种神经记忆架构,发现同一探索奖励会因记忆内容获取方式产生三种交互:放大架构差异、将架构拉平至共同上限,或完全无效。作者进一步用奖励机器区分结构稀疏与潜在稀疏,说明探索负责暴露经验,记忆负责将经验转化为回报。
最近 24 小时暂无可用热度快照。