该论文提出群体反思式自蒸馏(GRSD),利用策略自身在同一提示下产生的成功与失败轨迹,构造能力匹配、结果可区分的指导信号,并细化逐轮信用分配。方法通过停止梯度快照对比反思内容,在保留验证器奖励学习方向的同时调节优势,据摘要称在多种智能体环境、模型规模及未见任务上优于基线。
最近 24 小时暂无可用热度快照。