arXiv 预印本Shengcao Cao论文88
CoCo-IR:面向多轮上下文的组合图像检索
原标题:CoCo-IR: Contextual Composed Image Retrieval
当前基于指令的图像检索系统功能强大,但仅限于单轮交互,无法捕捉复杂现实世界视觉搜索的迭代特性。为克服这一局限,我们提出了上下文组合图像检索(Contextual Composed Image Retrieval,CoCo-IR),这是一项新任务,使用户能够通过交互逐步优化搜索结果。针对这一新任务,我们提出了一种基于大型多模态模型(Large Multimodal Model,LMM)的新模型,作为 CoCo-IR 的上下文感知推理器。我们的模型解析完整的交互历史,生成可变换图像嵌入(Transformable Image Embeddings,TIE),并使其随着交互轮次不断演化。为在无需昂贵人工标注的情况下推动模型训练,我们开发了一个完全自主且可扩展的数据引擎:利用 LMM 生成高质量的上下文检索数据,并通过模型引导的验证挖掘具有挑战性的困难负样本。大量实验表明,我们的方法达到了新的最先进性能:在具有挑战性的单轮基准 CIRCO 上取得了 39.4 的 mAP@5;此外,在我们提出的 CoCo-IR 新基准上,模型在 4 轮对话中仍保持稳健性能,R@1 达到 44.1,显著优于现有方法(4 轮 R@1 为 28.2),后者无法处理多轮上下文。项目主页:https://CoCo-IR.github.io】【。
为什么值得读
多轮视觉搜索正从概念走向可评测任务,这项工作同时给出数据构造、模型设计和四轮对话结果,适合现在评估检索系统的上下文能力。
标签
图像检索多模态模型多轮对话组合检索视觉语言模型硬负例CIRCO