Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

观察中研究观察中0 家独立报道0

结合行为优势校正的离线强化学习扩散策略

首次出现 · 2026/8/3 22:52最近活动 · 2026/8/3 22:52

该论文提出DPBAC,将行为优势校正策略评估(BAC-PE)与扩散策略结合,用行为策略的Q函数校正学习策略的Q函数,以缓解离线强化学习中的分布偏移、悲观保守和过估计偏差。方法同时进行行为与学习策略的分布匹配,并引入Q值引导;作者报告其在多个D4RL任务上优于现有方法,但摘要未给出具体分数。

最近 24 小时事件热度

最近 24 小时暂无可用热度快照。

最近 24 小时暂无可用热度快照。

报道时间线

  1. 聚合入口arXiv 预印本8/3 22:52非独立信源代表报道
    结合行为优势校正的离线强化学习扩散策略