论文将项目反应理论(IRT)引入大语言模型安全评估,分析8个安全基准和192个模型。研究发现,拒答严格度、真实性与情境危害三项因素解释了大部分差异;经心理测量学选择的少量题目可近似完整基准分数,并用于发现朴素沙箱规避及API背后的模型变化。
最近 24 小时暂无可用热度快照。