该论文提出数据集中心的元评测框架,从认知与知识需求、语言与内容质量、任务属性、上下文、伦理安全与公平五个潜在维度审计单个样本。作者将MMLU、ARC、WinoGrande、HellaSwag和TruthfulQA纳入分析,指出聚合准确率掩盖了基准内部的显著异质性,并据此编排面向特定能力的复合评测子集。
最近 24 小时暂无可用热度快照。