论文提出BioSecBench-Refusal,用于同时评估AI代理处理生物研究任务的能力与安全拒答行为。基准包含61项合法Routine任务和46项隐藏生物安全风险的Red-Team任务,覆盖16种模型-代理配置;拒答率显示,系统可能同样甚至更频繁地拒绝正常工作,却放过伪装风险任务。
最近 24 小时暂无可用热度快照。