MEPA针对视觉自回归模型在多尺度表示学习中的优化冲突与误差累积问题,引入按尺度路由的混合专家架构,并利用外部自监督特征增强早期语义建模。论文称,在ImageNet 256×256上,相比稠密基线可用更少参数和约一半训练轮数取得更优FID,但摘要未披露具体数值。
最近 24 小时暂无可用热度快照。