WorldDirector提出一种可控视频世界模型框架,将语义运动编排与视觉生成解耦:由LLM协调物体三维轨迹和相机运动,再把轨迹作为视频生成控制信号。论文称该方法能维持动态实体的物理逻辑与外观身份,即使实体长时间离开视野后重新出现,也能保持一致,并支持复杂、长时段事件和自由视角探索。
最近 24 小时暂无可用热度快照。