论文提出一种统一、无偏好的强化学习内在奖励,将参数信息增益作为核心信号:在未解析动力学区域鼓励探索,在动力学已解析区域自然衰减,并结合伪计数、探针式不可约噪声惩罚和短视界门控,避免显式训练下一状态预测器。作者还通过窗口冻结奖励对象,建立平稳贝尔曼算子、学习目标界限及有条件的一致性结果。
最近 24 小时暂无可用热度快照。