论文提出蒸馏强化学习(Distilled RL),将教师模型监督直接融入强化学习目标,以比结果级奖励更细粒度地完成知识迁移。方法包含反向重要性采样与裁剪、负样本重置、序列级几何归一化,并在同家族与跨家族蒸馏中比较RL和OPD。
最近 24 小时暂无可用热度快照。