论文指出,GRPO 在强化语言模型推理时会过度集中于基础模型本已高概率生成的回答,导致推理路径覆盖率下降,并可能损害大 k 值下的 Pass@k。ReCo 分别在回答级和 token 级重加权:校正组内重复采样造成的梯度偏置,并用基于方差的比率替代重要性比率。在 Qwen2.5-Math-1.5B/7B 与 Llama-3.1-8B-Instruct 的五个数学推理基准上,ReCo 提升了大 k 值 Pass@k,同时在小 k 值上接近 GRPO。
最近 24 小时暂无可用热度快照。