论文提出一种语音情感极性分类框架:先用自动语音识别生成转录,再自动翻译成多种语言,通过级联跨模态Transformer逐步融合音频与多语文本。多模态教师模型的知识随后蒸馏至纯音频学生模型,在不增加推理计算的情况下提升性能。摘要称,自动转录和翻译均带来显著收益。
最近 24 小时暂无可用热度快照。