VideoRAE利用冻结的V-JEPA 2、VideoMAEv2等视频基础模型的多尺度层级特征,通过轻量级1D自注意力投影器压缩为适合生成的视频潜变量,同时支持连续潜变量与多码本离散token。在UCF-101上,AR与DiT生成器分别取得40和93的class-to-video gFVD,并据称比竞品自编码器快约5倍收敛;替换LTX-VAE后,2B规模文生视频实验也更快收敛。
最近 24 小时暂无可用热度快照。