论文指出,面向长程智能体的传统在策略蒸馏存在两类低效:完整轨迹的尾部回合可能产生弱且噪声较大的监督,轨迹级KL损失又偏重浅层token。TurnOPD通过自适应 rollout 深度预算与渐进式回合归一化损失预算,将训练资源和监督逐步转向更深层决策回合,并在 ALFWorld、WebShop 和 Multi-Hop Search 上报告了优于 vanilla OPD 的时间—准确率表现。
最近 24 小时暂无可用热度快照。