SVR-R1提出一种面向视觉语言模型的多轮强化学习框架:模型先生成答案,再用同一套权重输出二元自验证结果;若判定为“No”,便触发第二次思考,最终依据结果奖励训练策略。该方法结合GRPO与异步多轮采样,无需外部监督或额外评论家,并据摘要称在多项视觉语言推理基准上显著优于标准GRPO。
最近 24 小时暂无可用热度快照。