HyperVAttention提出一种无需训练的视频扩散稀疏注意力框架,联合采用3D局部窗口聚类、锚点步完整聚类与中间步子集更新,以及面向GPU CTA执行成本的硬件感知聚类合并。论文称,该方法在文本生成视频实验中将端到端延迟最高降低2.13倍,并优于既有无需训练的稀疏注意力基线。
最近 24 小时暂无可用热度快照。