论文提出RSTG,用自适应教师指导修复GRPO在负向零方差组上的梯度缺失。方法在样本层筛选此类提示并按教师置信度加权,在词元层仅蒸馏高学生熵或师生分歧大的位置,同时用教师生成的正确轨迹进行SFT。摘要称其相较朴素GRPO+OPD,在数学和代码任务上分别提升4.02%和3.05%。
最近 24 小时暂无可用热度快照。