论文指出,基于评分标准的强化学习不仅会因无人满足某些标准而缺乏探索信号,还会因标量奖励聚合抑制已有行为。作者将后者定义为 Suppressed Criteria,并报告训练中超过57%的样本出现该问题,平均每个样本有1.8个受抑标准。CriPO通过在策略内进行自蒸馏,同时处理未探索和受抑标准,在医学与科学基准上以约一半优化步数取得更强结果。
最近 24 小时暂无可用热度快照。