论文指出,多模态大语言模型会将过多注意力分配给语义信息有限的视觉令牌,即 register 或视觉注意力汇,导致视觉证据被语言先验稀释并诱发幻觉。作者提出无需训练、可即插即用的 SPAR,通过显著性引导的净化与自适应重分配恢复视觉 grounding,并声称在多项幻觉基准上有效且计算开销很低。
最近 24 小时暂无可用热度快照。