论文提出前缀最优生成策略(POGP),在扩散策略的每个中间去噪步骤学习前缀价值函数,并用其训练中间动作、支持测试时自适应提前停止。在4个MuJoCo环境和12个基线比较中,去噪迭代次数约减少2.7倍,同时保持接近完整性能;相较动态扩散基线,最终任务性能提升约3.5%。
最近 24 小时暂无可用热度快照。