论文提出 CANON,一种无需标签的自蒸馏方法。它从多次采样中提取多数答案,并让冻结模型基于达成该共识的解生成逐 token 教师信号,再监督模型自身 rollout。数学与科学推理实验显示,pass@1 最高提升 12 个百分点,以约七分之一计算量超过无标签强化学习 6 个百分点。
最近 24 小时暂无可用热度快照。