DynaVieW提出一种面向视频和多图序列的动态模式引导世界模型,将视觉场景状态与分层动态转移交错建模,并通过混合专家、跨专家选择性注意力和模式令牌重加权损失联合训练转移预测与状态模拟。论文称该方法可提升视觉叙事生成和世界模拟的一致性、可控性与指令遵循。
最近 24 小时暂无可用热度快照。