论文提出一套面向真实渗透测试智能体的评估协议,将目标从完成预定义任务转向发现并验证漏洞。方法覆盖多攻击面和漏洞类型,结合结构化真值、LLM语义匹配、二分图消歧、持续维护、随机智能体的重复与累积评估,以及效率指标和精简测试集。作者同时发布专家标注真值与代码库 EthiBench。
最近 24 小时暂无可用热度快照。