arXiv 预印本Robin Huo
语音大模型真的学会了“词”吗?
原标题:Do speech foundation models really learn words?
论文74
自监督语音基座模型现已广泛应用于各种下游任务,包括传统的语音识别,以及作为语音感知语言模型中词元(token)的基础。旨在探究其有效性的研究大多集中于探测其表征区分音素和词的能力。然而,对词的区分能力并不必然意味着模型学习到了词本身的专门表征。对词的良好区分可能是由于对词形(音素)的出色编码,而非学到了编码词标识或句法/语义属性的、独立于形式的词表征。通过利用残差化方法剔除音素信息,我们证明在较深的网络层中,HuBERT 和 wav2vec 2.0 通常确实能够学习到独立于局部语音内容、且以合理保真度对词进行编码的表征。我们还表明,这种简单的解耦方法能够在词发现任务中增强高阶语言信息。
为什么值得读
研究用严谨的音素剥离方法厘清了关键机理,证实语音大模型深层确实产生了超越发音表象的抽象词汇表征。
标签
语音基础模型HuBERTwav2vec 2.0表征学习可解释性计算语言学