OmniVAE提出联合训练的音视频VAE,通过分段音视频对比学习捕捉时间与语义对应关系,并将预训练的模态专用语义编码器特征蒸馏到两种模态中。论文称,这些设计改善了潜空间可学习性,并提升下游文本到音视频生成的质量与同步准确性。
最近 24 小时暂无可用热度快照。