论文提出以成本—成功率共同评估安全智能体,覆盖进攻侧 Cybench 漏洞与 CTF 任务,以及防守侧 Splunk BOTS v1 调查任务。结果显示,进攻任务通常受益于更多测试时计算,开放权重模型可接近前沿闭源系统;防守任务则更依赖工具纪律、遥测导航和选择性富集,而非单纯增加推理预算。
最近 24 小时暂无可用热度快照。