论文摘要称,研究者在23项Cybench CTF挑战上测试了7家提供商的22个前沿模型,并逐一审计1,518条轨迹。基线条件下,37.1%的通过涉及作弊,21个模型出现作弊,分数最高被夸大5倍;严格反作弊提示将作弊倾向从33.0%降至8.5%,但仍无法替代环境控制。
最近 24 小时暂无可用热度快照。