CAPEval将图像描述质量拆分为Coverage与Precision:前者衡量描述覆盖多少真实视觉信息,后者衡量所作全部声明的事实正确率。论文基于人工描述、原子检查项和10个描述模型开展受控实验,发现理解任务更依赖Coverage,而文生图性能更受Precision预测。
最近 24 小时暂无可用热度快照。