论文提出GigaAM Multilingual,一个基于Conformer的多语言语音识别基础模型,使用HuBERT式目标在200万小时音频上预训练,覆盖哈萨克语、吉尔吉斯语和乌兹别克语。研究引入簇级数据均衡与领域感知采样,降低头部语言主导,在目标语言尤其是自发语音上超过Whisper Large v3和Omnilingual-1B,并发布编码器与ASR模型。
最近 24 小时暂无可用热度快照。