论文针对条件视频生成在长时自回归渲染中的重访不一致问题,提出无需再训练的闭环记忆机制:利用3D引擎提供的位姿与深度对应关系,将历史潜变量块重新写入KV缓存,并通过几何重投影引导注意力。作者在TartanAir和TartanGround的闭环轨迹上报告,其方法优于现有免训练基线,同时保持整体视频质量。
最近 24 小时暂无可用热度快照。