arXiv 预印本Meimingwei Li
Logit Refiner:通过尺度内依赖建模修正视觉自回归生成缺陷
原标题:Logit Refiner: Improving Visual Autoregressive Models via Intra-Scale Dependency Modeling
论文82
视觉自回归模型(VAR)通过下一尺度预测来生成图像,并在每个尺度内并行生成所有 token。我们证明,这种并行解码构成了一种平均场式(mean-field-style)近似,它忽略了同尺度 token 之间的空间依赖性,无论主干网络容量有多大,都会导致局部不连贯的样本——这是该解码规则本身所固有的一种局限性。针对这一局限,我们提出了 Logit Refiner,这是一个轻量级的自回归模块,通过以冻结的主干网络特征为条件进行序列采样,从而恢复尺度内依赖性。该模块仅增加了约 10% 的参数量和不到基础模型 5% 的训练计算量,无需重新训练即可即插即用到任何预训练 VAR 检查点中。受控消融实验表明,尺度内联合采样才是关键要素,而非额外的模型容量或训练。在类别条件 ImageNet 256x256 任务上,针对参数量从 3.1 亿(310M)到 20 亿(2B)的主干网络,该精炼器均持续提升了生成质量,使 11 亿(1.1B)参数模型的表现超越了参数量为其两倍的模型。该方法还能进一步推广至文本生成图像(text-to-image)任务,证实了平均场瓶颈在各种 VAR 变体中普遍存在,并且能够通过我们的方法得到有效缓解。项目主页:https://compvis.github.io/logit-refiner/
为什么值得读
明确指出了视觉自回归模型中并行解码带来的结构性瓶颈,以极低微调代价换取了越级参数缩放的画质收益。
标签
VARAutoregressive ModelsImage GenerationCompVisSamplingComputer Vision