ABSeeker:用答案回溯信用分配训练长时程搜索智能体
原标题:ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment
长时程搜索代理必须执行多个连续动作(步骤),以进行搜索、检索、验证和整合证据,从而得出最终答案。然而,现有训练这类代理的方法通常在监督微调(SFT)和强化学习(RL)过程中对轨迹中的所有步骤一视同仁,未能区分有用动作与错误或冗余动作。本文提出答案回溯式信用分配(Answer-Backtracked Credit Assignment,ABC),这是一种用于训练长时程搜索代理的细粒度信用分配框架,通过将稀疏的轨迹级结果转换为密集的步骤级监督,奖励有用动作(即使这些动作出现在失败轨迹中),同时抑制错误或冗余动作。具体而言,给定一个可能较为晦涩的查询及其对应的真实答案,ABC 首先执行答案回溯式线索恢复,从答案出发反向追踪,恢复解决问题所需的中间线索。随后,ABC 应用线索锚定式步骤评分,根据这些线索评估每个搜索步骤,将稀疏的二元结果监督转换为密集的步骤级奖励。基于这些奖励,我们提出 ABC-SFT,对每一轮的损失重新加权;并提出 ABC-GRPO,在 GRPO 中将步骤级分数用作奖励。在此框架基础上,我们仅使用 8.5k 个样本,基于 Qwen3.5-4B 训练了 ABSeeker。ABSeeker 在 BrowseComp 和 BrowseComp-ZH 上分别达到 37.3% 和 39.1%。结合上下文管理后,得分进一步提升至 55.3% 和 52.9%,显著超过同等规模(4B)的代理,甚至达到更大规模代理(约 30B)的性能。这些结果证明了答案回溯式步骤级信用分配在训练长时程搜索代理方面的有效性。
为什么值得读
长程搜索训练正从“整条轨迹记分”转向“逐步判断贡献”,这项工作给出了小模型用少量数据提升复杂检索能力的具体路径。