阅读原文
arxivpapers86

用于扩散模型偏好对齐的潜在奖励寄存器

原标题:Latent Reward Registers for Diffusion Preference Alignment

AI 导读

论文提出潜在奖励寄存器:在冻结的扩散 Transformer 前加入可学习、无位置编码的寄存器 token,直接从中间噪声潜变量预测终局偏好,形成稠密可微奖励。基于该读出,RG-OPD 用在策略轨迹蒸馏奖励梯度,据称最高节省 33 倍 GPU 时;RGS 则无需更新参数即可在采样时引导生成。

为什么值得读

它把扩散对齐的终局稀疏奖励转化为逐步可用的潜变量信号,并同时给出训练与免训练路径,值得关注其 33 倍算力降幅能否复现。

深度解读

1. 发生了什么

**原始事实:**论文提出 Latent Reward Registers(潜在奖励寄存器),目标是缓解扩散模型偏好对齐中的时间信用分配问题。方法从去噪过程的中间噪声潜变量估计最终样本的偏好奖励,而不只在生成结束后获得一次稀疏奖励。

2. 核心技术

**原始事实:**作者在冻结的 Diffusion Transformer(DiT)输入序列前加入可学习、无位置编码的寄存器 token,将其作为独立奖励读出器。论文称该机制不会改变生成器的隐藏状态或速度场。由此得到的稠密、可微奖励被用于两种策略:训练阶段的 Reward-Gradient On-Policy Distillation(RG-OPD),以及推理阶段无需参数更新的 Reward-Guided Sampling(RGS)。RGS 使用与生成更新幅度匹配的奖励梯度引导轨迹。

3. 关键证据与数字

**原始事实:**摘要报告,在高噑声水平 u = 0.8 时,寄存器在所评估的潜在奖励模型中取得最高成对准确率。RG-OPD 据称优于在线强化学习基线,并将 GPU 小时最多降低 33x;RGS 据称在所比较的免训练方法中达到新的最佳结果,同时改善对齐和感知指标。摘要未提供具体数据集、绝对分数、方差、硬件配置或统计显著性。

4. 为什么重要

**分析:**扩散生成需要多步去噪,而终局偏好分数难以判断每一步应承担多少贡献。若中间潜变量确实能稳定预测终局偏好,训练就可能避免大量完整轨迹 rollout,推理也可在不微调模型的情况下施加偏好引导。这使同一奖励读出机制同时覆盖训练和部署阶段。

5. 实际影响

**分析:**RG-OPD 可能降低扩散模型在线偏好优化的计算门槛,适用于已有冻结 DiT、但完整强化学习成本过高的团队。RGS 更适合不能修改基础模型权重、需要按请求调整生成偏好的场景。代码和权重公开,为复现潜变量奖励精度、GPU 成本及感知质量权衡提供了基础。

6. 局限与不确定性

**原始事实:**当前信息来自论文摘要,核心结果均为作者报告。**不确定性:**尚无法从所给材料判断比较是否覆盖强基线、33x 是否在等质量或等预算条件下测得,以及高噪声奖励准确率能否跨数据集和偏好维度泛化。RGS 同时提升对齐与感知指标的“严格改善”也需核对完整实验、消融和人工评测。来源元数据标注发布日期为 2026-08-04;若当前抓取时间早于该日期,应核查 arXiv 编号和发布日期。

7. 原始来源

标签

diffusion modelspreference alignmentDiffusion Transformerlatent rewardreward modelingRG-OPDReward-Guided Samplingon-policy distillationtraining-free guidancehuman preferences