论文提出 GenCeption:将预训练文本到视频扩散骨干改造成由文本指令控制的前馈视觉模型,统一完成深度、表面法线、相机位姿、指代表情分割和 3D 关键点预测。摘要称其在多项任务达到或超过专用模型,并以少 7 至 500 倍训练数据取得相近性能;仅用合成人类视频训练时,还能泛化到真实视频及动物、机器人等分布外类别。
最近 24 小时暂无可用热度快照。