论文提出相对价值学习(RV),用满足反对称性的函数Δ(s_i,s_j)=V(s_i)-V(s_j)直接估计状态间价值差异,而非分别学习绝对价值。作者给出成对Bellman算子及其γ-压缩性证明,构造1步、n步和λ回报,并从差异重建GAE,形成无偏策略梯度估计器R-GAE。将RV集成PPO后,在49个Atari ALE游戏上取得与标准PPO有竞争力的表现。
最近 24 小时暂无可用热度快照。