论文提出 DASH(Drift Aware advantage SHaping),利用推理轨迹中的中间答案承诺与真实答案比较,无需额外步骤标注即可判断后续反思是否有效,并据此分配片段级信用。在竞赛数学基准上,DASH 平均准确率为 59.45%,高于 Dr.GRPO 的 58.1% 和 GRPO 的 56.95%,同时减少无效反思行为。
最近 24 小时暂无可用热度快照。