论文指出,多模态大模型在多轮视觉推理中常因定位不准而反复裁剪、延长轨迹。PixelEyes将“看什么”的决策交给推理器,将“在哪里”的定位交给专用指代表达分割模型,并结合语义区域广度优先搜索。作者构建PixelEyes-6K数据集和无提示定位基准Pinpoint-Bench,以区分定位与推理失败;代码和模型已开源。
最近 24 小时暂无可用热度快照。