阅读原文
HuggingFace 每日论文Bohai Gu论文86

WorldCycle:面向长时程视频世界模型的可自验证强化学习

原标题:WorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World Models

WorldCycle提出利用可逆动作循环验证长时程视频世界模型:动作序列与其逆序组合后应回到初始状态,无需人工标注即可提供监督信号。方法结合空间闭合奖励与时间一致性奖励,并发布CycleBench评估复杂动作结构下的状态回归能力。论文报告状态回归漂移最多降低44%,复合动作准确率接近基线的4倍。

为什么值得读

长时程世界模型缺少可验证的未来状态,这项工作把可逆动作转化为无标注奖励信号,直接回应训练与评测瓶颈。

标签

世界模型强化学习视频生成长时程规划可验证学习CycleBench