HOMIE针对人和物体中心的视频个性化,统一处理跨主体与主体内参考输入。方法通过自注意力中的全局多模态引导,将多模态大语言模型语义特征与VAE token对齐,并用模态参考嵌入区分不同token、关联OCR和多视角图像。论文称其在多项任务上达到当前最佳表现。
最近 24 小时暂无可用热度快照。