EviBack针对Agentic RAG强化学习中“整组rollout均失败”时缺乏比较信号的问题,引入受证据约束的Teacher backoff,为这些样本提供辅助监督,同时保留可验证的Actor奖励。该方法分离证据评估与答案修正,并通过GPT-5.5辅助的自动化APE流程生成门控两阶段Teacher。在7个开放域问答基准和3种Qwen3规模上,论文报告其相较Search-R1提升F1及单跳、多跳宏平均F1,同时减少搜索、重复查询和强制终止。
最近 24 小时暂无可用热度快照。