Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

阅读原文
HuggingFace 每日论文·Byeongho Heo·2026年8月5日 20:00

面向多语言数学推理的在策略差分蒸馏

原标题:On-Policy Delta Distillation for Multilingual Math Reasoning

论文84

论文研究在英语、韩语和日语数学推理中使用在策略蒸馏(OPD)及其改进方法 OPD²。OPD²以微调教师模型与基础模型之间的概率差作为学习信号,在 Qwen3 实验中持续优于原始 OPD,尤其提升韩语和日语表现,并通常缩小英语与韩语之间的性能差距。研究还发现,英语数据进行 OPD 可能迁移到其他语言,但会使回答偏向英语。

为什么值得读

多语言推理后训练正从“能力迁移”转向“语言保持”,该结果为韩语、日语场景选择蒸馏信号和数据配比提供了直接依据。

标签

OPDOPD²多语言推理数学推理Qwen3知识蒸馏韩语日语

评分依据

  • 新颖性86
  • 影响力83
  • 实践价值82
  • 可信度78
  • 时效性85