arXiv 预印本Zheng-Hui Huang
可编程世界模型:解耦显式状态维护与视频渲染
原标题:Programmable World Model
论文84
近期的视频世界模型能够生成越来越逼真且具交互性的视觉体验,但在长程交互中仍缺乏维持持久世界状态以及执行可编程规则的可靠机制。我们提出了可编程世界模型(Programmable World Model),这是一个将世界状态演化与视觉观测生成解耦的框架。智能体将自然语言指令转化为可执行程序,用于指定实体状态和状态转移规则,从而实现对单个实体及其交互的直接控制。一个轻量级引擎执行这些程序,以更新并维护显式、持久的全局世界状态,包括画外实体和非视觉属性。为了将世界状态与视觉生成相结合,我们引入了状态增强的三维定向包围盒(OBB)作为中间表征。该表征与目标相机轨迹相结合,被确定性地编译为像素对齐的时空条件信号,提供给充当生成式渲染器的预训练视频模型。这种设计使用户能够创建具备预设机制、支持对单个实体进行直接控制并在整个游玩过程中保持持久世界状态的可玩游戏。此外,我们还推出了 CombatStateBench,这是一个用于评估可编程世界模型的基准。在 CombatStateBench 上,我们的方法实现了 94% 的计数准确率和 98% 的状态准确率,大幅超越现有的交互式视频世界模型,同时支持连贯的长时程生成。这些结果证明了将显式状态演化与生成式渲染相分离对于构建持久、可编程世界的有效性。
为什么值得读
它直面了视频世界模型因缺乏持久状态而频发幻觉的痛点,将扩散模型降级为受控渲染器,为可交互生成环境提供了清晰的工程架构。
标签
World ModelsVideo GenerationGame AIComputer VisionSymbolic AIInteractive Simulation