阅读原文
arXiv 预印本Jai Malegaonkar论文91

奖励结构如何塑造强化学习中的探索与神经记忆交互

原标题:Reward Structure Shapes the Interaction Between Episodic Exploration and Neural Memory in Reinforcement Learning

在部分可观测强化学习中,智能体面临双重瓶颈:它们必须进行探索以遇到有奖励的状态,并将这些经历保留在记忆中,以优化策略。传统上,探索奖励与记忆架构是分开评估的,二者之间的交互作用因而未得到衡量;而标准的稀疏奖励概念则将时间信号密度与奖励实际监督的内容混为一谈。我们开展了一项受控研究,将情景探索奖励与多种神经记忆架构结合起来,在三个环境中进行交叉比较,这些环境在记忆内容的获取方式上各不相同。相同的奖励信号产生了三种截然不同的交互模式:当记忆内容必须通过主动发现并以无监督方式保留时,它会放大架构容量差异;当记忆内容一旦被主动寻找出来,就只是一个由奖励直接监督的单一线索时,它会将不同架构的表现拉平到共同的上限;而当观测流完全按预定计划生成时,它则不起作用。受控的奖励操纵实验表明,这些模式反映的是奖励结构而非奖励密度:只有当稠密奖励直接监督所需的潜在记忆时,它才会抵消探索奖励;而在探索动作上施加一个很小且可避免的惩罚(不改变最优解)会使策略收敛到次优的静态状态,这两种奖励中的任一种都能解决这一问题。随后,我们利用以观测为锚点的奖励自动机形式化奖励稀疏性,将结构性稀疏(自动机无需任务所要求的历史信息即可复现回报)与潜在稀疏(单步奖励错误评估了局部探索动作的价值)区分开来;由此得到的术语体系按照每项任务所暴露出的记忆保留负担,对这三种情形进行了组织。总体而言,这些结果表明,探索与记忆是互补的,而非相互替代:奖励信号促成接触,而只有记忆才能将接触转化为回报。

为什么值得读

它重新定义了“稀疏奖励”问题,说明探索奖励是否有效取决于奖励监督的内容与记忆保留负担,而非奖励出现频率本身。

标签

强化学习部分可观测探索奖励神经记忆奖励机器稀疏奖励