论文提出人脸到语音(F2S)框架,仅凭静态人脸图像预测并合成具有身份一致性的声音。方法使用轻量Face Adapter和人脸编码器上层软调优,将视觉特征映射到冻结的StyleTTS 2风格空间。在LRS3未见身份上,UTMOS达到3.7至4.0,并展示了跨英语训练到西班牙语生成的能力。
最近 24 小时暂无可用热度快照。