论文指出,现有搜索增强LLM的结果奖励主要鼓励答对,却未充分惩罚检索失败后的编造,从而可能放大幻觉。作者提出拒答感知强化学习AWA-RL,根据问题先验能力与持续的在线训练观测动态调整拒答奖励,并提出RA-F1衡量能力与可靠性的权衡。报告显示,相比不拒答基线,精确率最高提升10.3个百分点,RA-F1提升2.9%,原始准确率仅小幅下降;代码、数据和模型权重已公开。
最近 24 小时暂无可用热度快照。