论文指出,PPO-Clip以欧氏度量衡量策略差异,与策略黎曼流形的内在几何不一致,导致低概率区域更新过度保守、高概率区域更新过激,最终造成探索坍缩。作者提出RIPO,通过黎曼等距策略更新平衡探索与利用,并报告其在七个竞赛级基准上超过现有LLM强化学习方法,在AIME24上较GRPO最高提升60%。
最近 24 小时暂无可用热度快照。