阅读原文
arXiv 预印本Joshua Fonseca Rivera论文89

用于人工智能安全评估的项目反应理论

原标题:Item Response Theory for AI Safety

语言模型在行为安全性方面存在差异,而这些差异通过安全基准进行衡量。然而,汇总后的基准分数很难令人信服并加以解读,因为不同基准之间存在重复、相关性很强,而且模型在检测到评估时可能会故意降低表现。为解决这些问题,我们借鉴项目反应理论(Item Response Theory,IRT),这是一套统计工具,能够根据模型在具有推断心理测量学属性的题目上的表现来衡量这些潜在特征。我们针对 192 个语言模型在八项安全基准上的表现拟合 IRT 模型,开展了迄今为止规模最大的 LLM 安全评估心理测量学分析,并得出三项结果。第一,我们发现,拒答严格程度、真实性和情境危害这三个可解释因素,能够解释不同模型在各项基准之间的大部分差异。第二,经过心理测量学选择的题目,在样本量相同的情况下,比随机子集以更低的误差还原完整基准分数;对于若干单独的基准,大约十道自适应选择的题目就已足够,从而将评估成本降低 97% 至 99%。第三,IRT 支持对单个模型进行审计,表明它可以用于检测朴素的故意降低表现行为,以及识别 API 背后的模型变化。总体而言,我们展示了 IRT 是一套现成的工具,可用于解读、精简和审计安全基准,并建议前沿实验室和评估人员采用这一方法。

为什么值得读

安全基准正面临重复、相关性和沙箱规避问题;这项工作给出了可压缩评测并审计模型变化的统计方法。

标签

AI safetyIRTbenchmarkingsandbaggingadaptive evaluationpsychometrics