HuggingFace 每日论文Chenxi Song
World in World:免训练世界模型交互探索接口
原标题:World in World: Explore the World with World Models
论文78
自回归视频世界模型向新视角漫游时,常面临画面失步与未见区域补全的断裂。World in World 无需额外训练,将多视角投影、几何先验与历史检索状态统一编码为视觉条件,借由原生自注意力机制输入冻结的主干网络。同一套接口下,视角重渲染与长程场景回访得以在保持动态同步中完成。
为什么值得读
它避开了昂贵的模型微调,展示了利用几何先验与原生自注意力让冻结因果视频模型实现精准相机控制与长程回访的可行路径。
标签
World ModelsVideo GenerationCamera ControlTraining-FreeNovel View SynthesisInference