论文提出 StealthBench,用于评估自主攻击型安全智能体在六类 OPSEC 维度上的行动隐蔽性。作者从真实漏洞赏金与红队轨迹中提取 11 起人工核验事件,扩展为 14 个 Docker 化场景,并以三模型评审、多数投票计算安全成功率、Stealth@Solve 与鲁莽成功率;摘要称没有模型的安全成功率超过 54%。
最近 24 小时暂无可用热度快照。