论文区分多模态模型的视觉感知与视觉证据使用能力,提出图像重建和WhatIfVis两个诊断范式。研究称,空间时间、颜色、数量、大小和重量等粗粒度属性仍可从冻结模型的末层图像 token 重建,但模型回答可能仍受语言先验支配,说明失败点或在感知之后。
最近 24 小时暂无可用热度快照。