论文提出答案回溯信用分配框架ABC,从正确答案反向恢复中间线索,再按搜索步骤与线索的对应关系生成密集奖励,分别用于ABC-SFT和ABC-GRPO。基于8.5k样本训练的Qwen3.5-4B模型,在BrowseComp和BrowseComp-ZH上取得37.3%与39.1%;加入上下文管理后升至55.3%与52.9%,达到部分约30B智能体的水平。
最近 24 小时暂无可用热度快照。