Blind-Spots-Bench 从 AI 课程学生提交的问题中整理出 235 个样本,覆盖字符串操作、异常绘图等人类看似简单但模型容易失败的任务,并建立自动评分流程评测语言、视觉语言和图像生成模型。结果显示,闭源前沿模型较开放权重模型约领先 10%,但没有模型在所有任务类型上占优,部分任务对所有模型仍然困难。
最近 24 小时暂无可用热度快照。