该论文提出基于自监督语音模型的音系激活映射SPAM,将每帧表示转换为浊音、鼻音等音系特征激活,并在其上构建无需梯度下降的轻量级识别头与分段头。方法仅需不到一分钟的音标转写,还能泛化到训练中未出现的音素,同时兼顾分段与识别任务。
最近 24 小时暂无可用热度快照。