论文针对专家示范存在未观测混杂、专家与模仿者观测不匹配,以及长时域连续控制难题,提出因果 Soft Q 模仿学习(Causal SQIL)与因果逆 Soft-Q 学习(Causal IQ-Learn)。方法用滑动窗口近似序贯 π-backdoor 调整,并在混杂环境中测试。
最近 24 小时暂无可用热度快照。