论文指出,PPO及DPPO中的方向判据主要依赖采样 token 的重要性比率,可能与行为策略和训练策略之间实际散度变化的方向不一致。作者提出预测性散度掩码,直接预测下一次策略梯度更新是否会扩大同一信赖域散度,并为生产 rollout 引擎的截断 top-K 词表设计两种轻量估计器。摘要称该方法在不同模型规模和精度设置下改善了强化学习训练。
最近 24 小时暂无可用热度快照。