论文提出 Trust Region Policy Distillation(TOP-D),通过动态构造近端教师,将高方差、易不稳定的 On-Policy Distillation(OPD)转化为更稳定的训练范式。作者声称其理论上可控制梯度方差,并给出全局收敛分析与单调改进界;数学推理实验显示训练稳定性、样本效率和最终性能提升,且无额外计算开销。
最近 24 小时暂无可用热度快照。