MemLearner针对视频世界模型长时生成中的场景不一致问题,提出基于查询token的自适应上下文检索方法。它利用视频生成模型自身的视觉先验处理遮挡和动态物体,并结合长视频数据集、相机位姿标注及有监督与无监督混合训练,在场景一致性和记忆能力上优于既有方法。
最近 24 小时暂无可用热度快照。