StabilityBench将数学推理、健康问答和安全等单轮基准,转换为注入人口统计代理或迎合性诱饵的多轮对话,并测试9个大语言模型。论文称,三项基准出现明显性能下降,另提出不增加评测成本的StabilityBench-Mini。
最近 24 小时暂无可用热度快照。