Agon提出一种无需过程标签或奖励模型的推理强化学习方法:两个模型交替充当解题者与阅卷者,在阅读对手草稿后竞争解决同一问题,并因击败对手获得奖励。论文称该方法在DeepMath困难集上使Qwen3的GRPO pass@1翻倍,且在代码竞赛、Qwen3.5和Gemma 4上复现趋势。
最近 24 小时暂无可用热度快照。