arXiv 预印本Ayoub Kirouane论文85
教会 Nemotron 希腊语:面向专业领域现代希腊语的语料挖掘、检索适配与生成 grounding
原标题:Teaching Nemotron Greek: Mining a Corpus, Adapting Retrieval, and Grounding Generation for Modern Greek across Specialist Domains
现代希腊语在 NVIDIA 的 Nemotron 检索模型和主流多语言检索基准中均处于缺失状态,尽管它对于法律、能源、金融和医疗应用中的检索增强生成(RAG)十分重要。我们提出了一套面向现代希腊语的 Nemotron 检索技术栈端到端适配方案,涵盖语料库挖掘、合成监督数据生成、检索模型训练、重排序器适配、阅读器微调,以及名为 HERA 的新基准。研究表明,在专业领域希腊语语料库上,无需参数训练的 BM25 基线优于多种开箱即用的多语言稠密检索模型。在使用 65,773 个希腊语检索样本对进行微调后,Nemotron 1B 嵌入模型的 nDCG@10 从 0.362 提升至 0.835,显著优于未经适配的原始模型。模型习得的语言能力可迁移至通用领域希腊语,但其相对于 BM25 的优势仍取决于具体领域。我们还对交叉编码器重排序器进行了适配,并证明其在多个专业领域均能带来稳定提升。最后,我们使用 LoRA 对 Nemotron 30B-A3B 混合专家阅读器进行基于依据生成的微调,使经评判的答案正确率从 29.4% 提升至 66.9%,同时显著改善了忠实度和引用质量。我们还推出了首个面向检索增强生成的大规模希腊语基准 HERA,并公开适配后的模型和基准,以支持未来对希腊语 RAG 系统的研究。
为什么值得读
现代希腊语在主流检索评测中长期缺席,而该工作给出从语料到生成的完整适配链,并报告了可复现实验增益。
标签
Modern GreekNemotronRAGretrievalrerankingLoRAHERAmultilingual AI