论文指出,传统逐样本强化学习奖励容易诱发奖励投机、模式坍缩和视觉异常,提出面向生成样本分布的奖励框架。方法通过subset-replace策略降低分布奖励估计成本,并用强化学习优化模型合并系数。在SiT和EDM2上,FID-50K分别从8.30降至5.77、从3.74降至3.52,同时保持样本多样性。
最近 24 小时暂无可用热度快照。