论文研究多模态掩码扩散模型中的生成顺序优化,指出仅依靠模型logits难以为文本到图像生成和多模态理解确定最优顺序。作者引入通过GRPO训练的可学习控制模块,在GenEval上相对提升4.08%,并在VLMEvalKit上提升4.85%。
最近 24 小时暂无可用热度快照。