论文提出无界正向非对称优化(UP),针对大语言模型强化学习中重要性采样带来的探索不足与训练不稳定问题,在正优势样本上取消裁剪、释放探索梯度,在负优势样本上保留标准裁剪。作者称该方法可插拔地兼容GRPO、DAPO与GSPO,并在稠密模型、MoE及视觉语言模型上验证。
最近 24 小时暂无可用热度快照。