论文指出,流式目标说话人提取中的质量—可懂度冲突主要源于错误的优化锚点,而非流式架构本身。作者扩大Conformer卷积核,并以WavLM余弦相似度构造DPO偏好对。在560毫秒分块下,词错误率由0.138降至0.123,相对可懂度提升10.9%,音质与说话人相似度也略有改善。
最近 24 小时暂无可用热度快照。