CLBench-V是一个评估多模态上下文学习能力的新基准,覆盖上下文落地、新信息应用和新知识学习三个维度,包含科学、金融、长文档、空间推理及网页视觉问答等场景。基于3443个实例和6个多模态模型,最佳总体得分仅为0.2847,显示该能力仍远未饱和。
最近 24 小时暂无可用热度快照。