论文提出Mastermind双循环框架,将漏洞复现中的“策略”作为独立学习单元:规划器通过监督微调与基于里程碑的GRPO学习可迁移策略,经验循环保存任务内策略记录。CyberGym上使用冻结GPT-5.5执行器时,200个评测任务通过率达84.5%,并能提升GPT-5.4 mini与GLM 5.1。
最近 24 小时暂无可用热度快照。