论文提出RLSVR,通过把开放式任务转换为可验证的代理环境,绕开人工偏好、奖励模型和LLM裁判的偏差与成本。其实现SpyRL借鉴“谁是卧底”,利用非对称信息、多智能体自博弈及预设卧底身份产生可验证奖励,并在摘要、创意写作和数学推理实验中报告了自我改进效果。
最近 24 小时暂无可用热度快照。