阅读原文
HuggingFace 每日论文Dasol Choi论文88

NOLLI:用于诊断英韩性能差距的难度校准谜题基准

原标题:NOLLI: A Difficulty-Calibrated Puzzle Benchmark for Diagnosing the English-Korean Performance Gap

NOLLI是一个可程序生成、可由种子复现的英韩谜题基准,包含15类谜题、25项任务和7,500个样本。研究发现,匹配翻译任务的英韩总体准确率大体等价,但涉及韩文辅音元音字母(jamo)的任务差距更明显;韩文密码任务最高落后68.7个百分点,而同样使用jamo的算术任务没有系统性惩罚。

为什么值得读

它把“韩语能力较弱”拆解为语言呈现、韩文文字系统和规则执行三类变量,能直接影响多语言模型评测与诊断设计。

标签

multilingualKoreanbenchmarksreasoningjamoevaluationpuzzles