Kimi 发布 PerceptionBench,用于评估多模态大模型对基础视觉事实的原子级感知能力。现有视觉问答和综合基准往往混合感知、推理与语言生成,难以定位模型究竟在哪个视觉环节出错。当前提供的信息未包含数据规模、任务构成、模型结果或论文编号,需进一步阅读原文确认。
最近 24 小时暂无可用热度快照。