论文提出反事实 Shapley 信用分配框架,用因果理论和 Counterfactual Shapley Value(φ-value)将强化学习奖励归因于策略行为,而非环境随机性。作者进一步给出一致估计器,并结合 φ-PPO 与优先轨迹回放,在稀疏因果、高随机性和延迟奖励环境中提升时间信用分配与样本效率。
最近 24 小时暂无可用热度快照。