论文研究强化学习中的在线动力学适配:源域拥有充足训练数据,目标域仅允许有限交互。DADiff利用源、目标域生成轨迹在扩散生成下一状态时的差异估计动力学偏移,并通过奖励修改或数据选择适配策略。作者还给出性能差异与生成轨迹偏差之间的理论界,并报告在多种环境偏移下优于现有方法。
最近 24 小时暂无可用热度快照。