H^2SD 面向带可验证奖励的强化学习,将同一模型在特权信息下构造的教师策略按轨迹成败区别使用:成功轨迹仅调节更新幅度,失败轨迹则借助包含关键步骤和答案的提示,通过反向 KL 提供纠正方向。论文摘要称其在多个推理基准上优于 RLVR、OPSD 和 RLSD,并保持较稳定优化与较高生成效率,但未给出具体实验数字。
最近 24 小时暂无可用热度快照。