D2PO将低步数扩散采样器优化重新表述为偏好对齐问题,利用能量模型把样本比较转化为可处理的能量差,并直接从预训练得分网络构造能量函数。其动态偏好机制会随着策略改进持续生成更强的偏好信号,旨在缓解学生采样器模仿高步数教师时纹理细节损失的问题。
最近 24 小时暂无可用热度快照。