论文提出持久一致性自蒸馏(PCSD),依据教师偏好信号在局部范围内的持续性,为每个 token 生成连续蒸馏权重,并与 GRPO 联合训练。摘要称其无需推理时技能,在两个骨干模型上的 ALFWorld Overall 均优于基线,较 GRPO 分别提升 15.6 和 13.3 分,未见分割上提升 15.8 分。
最近 24 小时暂无可用热度快照。