论文从三个条件重新解释贝尔曼方程的来源:动力学可通过充分统计量分解、回报可递归分解,以及不确定性的聚合同时兼容二者。三者在同一状态上成立时,最优价值函数自然满足贝尔曼递推;若有条件失效,可通过扩充状态,或变形回报与动力学恢复可处理性。论文进一步将概率与回报、回报与聚合、聚合与概率之间的三种对偶性统一到同一构造中。
最近 24 小时暂无可用热度快照。