该研究系统分析大语言模型在策略蒸馏(OPD)中的训练动力学,指出OPD主要充当探索催化剂,通过密集的逐Token指导引导学生模型发现正确推理路径,却不会提升能力上限。论文识别出学生—教师失配和长度利用两类病理,并以优势裁剪、对数压缩调节信号,在七项基准上改善蒸馏稳定性。
最近 24 小时暂无可用热度快照。