论文提出 ReflectRL,将更强专家模型在难题上的失败过程视为“黄金负轨迹”,不直接模仿,而是先引导模型识别并反思其中错误,再把反思式推理迁移回直接推理。摘要称,该方法在9个基准、4种大模型骨干和4种在线策略训练方法上持续提升推理表现,且额外开销较小,但未披露具体增益。
最近 24 小时暂无可用热度快照。