论文指出,GRPO、Dr. GRPO 与 DAPO 的关键差异可统一为对组内奖励标准差的不同处理:GRPO进行除法归一化,Dr. GRPO取消除法,DAPO丢弃标准差为零的组。对于对错奖励,标准差直接决定更新强度,答案分歧最大的题目获得最大训练信号;Big-Math 数据集与受控训练实验支持这一解释。
最近 24 小时暂无可用热度快照。