论文提出SESA,让挑战者生成问题、求解器检索技能,并将信息性失败蒸馏后写回技能记忆。记忆变化会影响求解轨迹、策略学习和后续出题分布。在七个开放域及多跳问答基准上,SESA相较SSP提升1.2–3.2个百分点,相较SkillRL提升0.9个百分点;Qwen3上的无记忆部署仍保留1.8–2.2个百分点收益。
最近 24 小时暂无可用热度快照。