论文提出面向流匹配语音生成的统一引导框架:通过异构增强实现数据引导,促使模型分离语言内容与声学残留;同时结合轨迹校正和内在引导目标改进模型引导,将条件知识蒸馏进网络参数并拉直推理路径。摘要称,该方法无需分类器自由引导开销,推理速度接近提升3倍,并改善说话人相似度。
最近 24 小时暂无可用热度快照。