FlowMimic提出像素对时间扭曲流场,可从图像编辑样本实时生成对应的视频编辑数据,减少对象掩码、I2V合成、ControlNet式引导和VLM筛选等流程。模型通过模态模仿损失对齐图像与视频能力,并加入指代表达分割、区域感知潜变量损失及注意力损失,使模型学习编辑区域定位与局部修改。
最近 24 小时暂无可用热度快照。