PerceptionBench针对多模态大模型的底层视觉感知进行独立评估。研究者分析16个前沿模型在42个既有基准中的失败点,建立包含10项原子感知能力的误差分类,并构造3000道经过验证、答案简短明确的问题。结果显示,没有模型准确率达到60%,与感知相关的幻觉平均表现最弱,整体分数相近的模型也呈现出明显不同的能力剖面。
最近 24 小时暂无可用热度快照。