该论文提出DPBAC,将行为优势校正策略评估(BAC-PE)与扩散策略结合,用行为策略的Q函数校正学习策略的Q函数,以缓解离线强化学习中的分布偏移、悲观保守和过估计偏差。方法同时进行行为与学习策略的分布匹配,并引入Q值引导;作者报告其在多个D4RL任务上优于现有方法,但摘要未给出具体分数。
最近 24 小时暂无可用热度快照。