论文提出CRAG-MM-Diagnostics诊断基准,将知识密集型视觉问答拆分为语言驱动的视觉定位、目标识别、知识检索与推理三个阶段,并提供目标区域、实体名称和视觉复杂度等标注。实验显示知识检索与推理是主要瓶颈;加入先定位裁剪、再进行图像检索的双模态RAG后,GPT-5和Qwen准确率分别提升13.3和8.5个百分点。
最近 24 小时暂无可用热度快照。