arXiv 预印本Mehrnaz Mofakhami
Tiny Aya L2-Thinker:通过数据配比实现多语言母语化推理
原标题:Building Multilingual Bridges: Data Mixing as the Pillar of Generalization for In-Language Reasoning
论文82
推理语言模型在各类复杂任务上取得了显著进展,但其能力仍压倒性地以英语为中心:无论输入的提示词使用何种语言,模型通常都主要使用英语进行推理。这不仅给非英语使用者带来了使用门槛,还存在丢失原始问题意图的风险,并错失了那些在目标语言中更容易表达的知识。在这项工作中,我们推进了 L2 推理(L2 reasoning)——即模型能够始终使用用户提示词所用的语言进行推理的能力,从而在提示词与答案之间搭建起语内桥梁。我们从以数据为中心的视角切入该问题,探究如何在监督微调(SFT)中优化数据配比与调度以实现推理能力的泛化。
我们在 3.35B 参数规模上构建了 Tiny Aya L2-Thinker,在涵盖数学、常识推理、指令遵循、开放式生成和文化推理的 6 项基准测试中,跨 60 种语言取得了超过 93% 的 L2 推理率,同时保持了强劲的性能表现。我们指出,将 L2 推理泛化至未见语言的路径依赖于:更广泛的语言覆盖面、现成可用的多语言非推理数据,以及足够强大的英语推理主干。这些发现表明,推理是一种与语言无关的行为,通过精心设计的数据混合,便可在语言类型各异的语言之间迁移,而无需在每种目标语言中都提供推理监督。我们开源了模型权重和多语言推理数据,以支持对无障碍、同语言推理的进一步研究。
为什么值得读
揭示了语言模型母语推理的跨语种迁移机制,证明无需为每种语言构建昂贵的思维链数据,仅靠精细的数据配比即可打破英语中心化推理。
标签
Multilingual NLPReasoning ModelsTiny AyaSFTData MixingLanguage ModelsOpen Source