论文研究一种常见的推理蒸馏补救方法:向生成器展示标准答案,再要求其生成抵达该答案的思维链。受控实验显示,这些链条会从答案反向合理化,而非独立推导;即使通过最终答案正确性筛选,训练后模型在最难竞赛题上的可验证推理准确率仍最多下降约27个百分点。损害可在训练前从无标签生成中识别,并跨教师家族迁移。
最近 24 小时暂无可用热度快照。