Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

阅读原文
arXiv 预印本·Meimingwei Li·2026年9月10日 16:57

Logit Refiner:通过尺度内依赖建模修正视觉自回归生成缺陷

原标题:Logit Refiner: Improving Visual Autoregressive Models via Intra-Scale Dependency Modeling

论文82

视觉自回归模型(VAR)通过下一尺度预测来生成图像,并在每个尺度内并行生成所有 token。我们证明,这种并行解码构成了一种平均场式(mean-field-style)近似,它忽略了同尺度 token 之间的空间依赖性,无论主干网络容量有多大,都会导致局部不连贯的样本——这是该解码规则本身所固有的一种局限性。针对这一局限,我们提出了 Logit Refiner,这是一个轻量级的自回归模块,通过以冻结的主干网络特征为条件进行序列采样,从而恢复尺度内依赖性。该模块仅增加了约 10% 的参数量和不到基础模型 5% 的训练计算量,无需重新训练即可即插即用到任何预训练 VAR 检查点中。受控消融实验表明,尺度内联合采样才是关键要素,而非额外的模型容量或训练。在类别条件 ImageNet 256x256 任务上,针对参数量从 3.1 亿(310M)到 20 亿(2B)的主干网络,该精炼器均持续提升了生成质量,使 11 亿(1.1B)参数模型的表现超越了参数量为其两倍的模型。该方法还能进一步推广至文本生成图像(text-to-image)任务,证实了平均场瓶颈在各种 VAR 变体中普遍存在,并且能够通过我们的方法得到有效缓解。项目主页:https://compvis.github.io/logit-refiner/

为什么值得读

明确指出了视觉自回归模型中并行解码带来的结构性瓶颈,以极低微调代价换取了越级参数缩放的画质收益。

标签

VARAutoregressive ModelsImage GenerationCompVisSamplingComputer Vision

评分依据

  • 新颖性82
  • 影响力80
  • 实践价值86
  • 可信度85
  • 时效性80