DreamTraj提出一种无需视频、深度或CAD模型的方法:给定单张RGB图像和细粒度任务指令,从冻结的图像到视频扩散模型在早期去噪阶段的内部表示中读取运动信息,并由轻量级流匹配Reader解码相对6自由度位姿轨迹。论文同时发布MOVE数据集,包含5,038条带自然语言指令的物体中心第一视角轨迹。
最近 24 小时暂无可用热度快照。