论文提出 Wan-Streamer v0.3,将视频建模为持续存在的“世界”与随时间变化的“事件流”,并以此开展通用视频预训练。模型面向全双工音视频交互,可根据视觉、语言和用户行为生成语音及行为动作;在 640×368、25 FPS、160 ms 流式单元下,模型侧延迟约 200 ms,总交互延迟约 550 ms。
最近 24 小时暂无可用热度快照。