论文提出一种面向视觉强化学习的自监督掩码预测辅助任务,不重建原始图像,而是利用智能体采集的序列及上下文,在潜在空间预测被掩码信息。结合Transformer后,所得压缩表征可输入强化学习模型,并在多个连续与离散控制基准上提升样本效率,摘要称其超过现有方法。
最近 24 小时暂无可用热度快照。