论文提出FoCo,用于零样本组合图像检索(ZS-CIR)。它将图像与文本修改的组合拆为两个阶段:由局部文本语义引导视觉内容聚焦,再结合剩余场景上下文完成目标语义,并通过跨实例对比学习提升语义多样性、抑制捷径。作者称其在四个ZS-CIR基准上达到当前最佳性能并改善泛化。
最近 24 小时暂无可用热度快照。