论文提出一个包含21个场景的代理安全基准,让自主攻击模型根据防御者前序响应进行最多15轮调整。固定池攻击的成功率仅为0–1%,自适应攻击升至5.4–14.0%;三名攻击模型联合还能发现比单一攻击者多1.4–2.2倍的独特成功攻击。
最近 24 小时暂无可用热度快照。