arXiv 预印本Rohit Kumar Salla论文88
学习何时停止:面向连续控制的前缀最优动态扩散策略
原标题:Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control
扩散策略是连续控制中一种强大的策略类别,但其迭代去噪过程会带来显著的计算瓶颈。要降低这一成本,需要根据每个动作的难度调整去噪步数,同时保持任务性能。我们提出前缀最优生成策略(Prefix-Optimal Generative Policies,POGP),这是一种通过在去噪链上进行类似贝尔曼递归的方式,在每个中间去噪步骤学习前缀价值函数的框架。前缀价值函数具有两个作用:它提供辅助训练目标,促使中间输出逐渐成为高质量动作;同时,它支持测试时的停止规则,在额外步骤不太可能带来明显改进时终止去噪。在四个 MuJoCo 环境中,并与 12 个基线方法进行比较,POGP 将所需的去噪迭代次数减少了约 2.7 倍,同时保持了接近完整的任务性能。与最先进的动态扩散基线相比,前缀训练还将最终任务性能提升了约 3.5%。这些结果表明,对中间去噪步骤进行监督不仅有助于实现自适应提前停止,还可以作为辅助目标来改进所学习的策略。
为什么值得读
扩散策略的推理成本是连续控制落地的关键瓶颈,这项工作同时报告了约2.7倍加速和性能保持,值得及时关注其方法与实验边界。
标签
diffusion policycontinuous controlroboticsearly stoppingMuJoCoreinforcement learningadaptive inference