论文提出CAST,将游戏求解器状态价值的变化转换为逐回合solver advantage,并注入带可验证奖励的强化学习,以缓解仅依赖最终成败信号造成的信用分配稀疏问题。在Sokoban、Minesweeper和Rush Hour上,作者报告其优于所有训练基线,并在ALFWorld与WebShop取得最高平均零样本表现。
最近 24 小时暂无可用热度快照。