论文研究上下文马尔可夫决策过程中离线强化学习的泛化问题,指出过度悲观并不必然损害最优泛化;关键在于悲观价值函数是否尊重最优解的对称性。作者进一步认为,数据增强应主要通过策略提取阶段的一致性损失实现,并在旋转对称的 reacher 环境中用 IQL 与 CQL 进行了验证。
最近 24 小时暂无可用热度快照。