论文把全概率定律引入语言模型评估:用二叉树递归划分人群,分别提示模型估计子群体分布,再按先验聚合并与直接总体估计比较。跨任务和前沿模型的结果显示,模型普遍违反统计自洽性;人格提示中还出现“宏观谬误”,细粒度估计聚合后反而更接近人类参考数据。
最近 24 小时暂无可用热度快照。