论文提出 Replayed-Prefix On-Policy Distillation(ReOPD),利用预先收集的教师轨迹作为回放前缀,让学生在选定步骤接受教师的逐步监督,无需训练期间反复调用环境或工具。作者指出多轮蒸馏存在“前缀陷阱”:更贴近学生分布的历史可能降低教师目标可靠性。ReOPD 通过步数递减采样优先早期前缀,在数学推理、Python 和搜索环境中保持或提升 OPD 准确率,并宣称每次 rollout 至少快 4 倍。
最近 24 小时暂无可用热度快照。