HuggingFace 每日论文Byeongho Heo
面向多语言数学推理的在策略差分蒸馏
原标题:On-Policy Delta Distillation for Multilingual Math Reasoning
论文84
论文研究在英语、韩语和日语数学推理中使用在策略蒸馏(OPD)及其改进方法 OPD²。OPD²以微调教师模型与基础模型之间的概率差作为学习信号,在 Qwen3 实验中持续优于原始 OPD,尤其提升韩语和日语表现,并通常缩小英语与韩语之间的性能差距。研究还发现,英语数据进行 OPD 可能迁移到其他语言,但会使回答偏向英语。
为什么值得读
多语言推理后训练正从“能力迁移”转向“语言保持”,该结果为韩语、日语场景选择蒸馏信号和数据配比提供了直接依据。
标签
OPDOPD²多语言推理数学推理Qwen3知识蒸馏韩语日语