Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

观察中研究观察中0 家独立报道0

通过风格扩散TTS潜空间适配实现零样本人脸到语音合成

首次出现 · 2026/7/29 18:33最近活动 · 2026/7/29 18:33

论文提出人脸到语音(F2S)框架,仅凭静态人脸图像预测并合成具有身份一致性的声音。方法使用轻量Face Adapter和人脸编码器上层软调优,将视觉特征映射到冻结的StyleTTS 2风格空间。在LRS3未见身份上,UTMOS达到3.7至4.0,并展示了跨英语训练到西班牙语生成的能力。

最近 24 小时事件热度

最近 24 小时暂无可用热度快照。

最近 24 小时暂无可用热度快照。

报道时间线

  1. 聚合入口arXiv 预印本7/29 18:33非独立信源代表报道
    通过风格扩散TTS潜空间适配实现零样本人脸到语音合成