论文研究在英语、韩语和日语数学推理中使用在策略蒸馏(OPD)及其改进方法 OPD²。OPD²以微调教师模型与基础模型之间的概率差作为学习信号,在 Qwen3 实验中持续优于原始 OPD,尤其提升韩语和日语表现,并通常缩小英语与韩语之间的性能差距。研究还发现,英语数据进行 OPD 可能迁移到其他语言,但会使回答偏向英语。
最近 24 小时暂无可用热度快照。