GRASP提出一种强化学习框架,让智能体在多步推理中协调语义搜索、关键词搜索和段落阅读,并按需控制上下文粒度。其奖励同时考虑答案准确率、基于证据的阅读、互补搜索与交互轮数。论文称,在多跳推理基准上,该方法提升了检索召回率和问答表现,并形成了可解释的探索、核验与实体定位行为。
最近 24 小时暂无可用热度快照。