论文提出 On-Policy Delta Distillation(OPD²),不再直接模仿教师模型的完整输出分布,而是利用指令调优教师模型与其基础模型之间的差分作为 token 级蒸馏奖励。作者称,该信号更直接地刻画推理调优带来的变化,并在数学、科学和代码推理基准上持续优于传统在线蒸馏,短周期后训练即可获得较强表现。
最近 24 小时暂无可用热度快照。