论文提出SaMer,一种面向多向量视觉语言检索的对象感知令牌合并方法。它仅在训练阶段使用对象标注作为合并先验,推理时无需检测器或边界框,并冻结视觉与语言骨干网络、只适配共享投影层。K=64时可移除超过93%的图像令牌,将ColPali存储降低16.09倍,同时在Flickr30K和MSCOCO上提升R@1。
最近 24 小时暂无可用热度快照。