论文重新评估在策略自蒸馏在持续后训练中的稳定作用。基于SDPO的实验显示,它能在教师信号稳定且匹配良好的域内加速专门化,却更难泛化;持续训练中遗忘更强,甚至可能崩溃。相比之下,GRPO更保守,较能保留既有能力。密集蒸馏还会放大参数、响应漂移及格式伪影。
最近 24 小时暂无可用热度快照。