论文提出潜在奖励寄存器:在冻结的扩散 Transformer 前加入可学习、无位置编码的寄存器 token,直接从中间噪声潜变量预测终局偏好,形成稠密可微奖励。基于该读出,RG-OPD 用在策略轨迹蒸馏奖励梯度,据称最高节省 33 倍 GPU 时;RGS 则无需更新参数即可在采样时引导生成。
最近 24 小时暂无可用热度快照。