Scalex.dev称,在4万次游戏运行中,人类审核者批准AI Agent命令时漏掉了约三分之一的威胁。该结果指向权限确认流程中的自动化疲劳与判断盲区,但目前仅有标题和摘要,尚无法核验实验设计、威胁定义、参与者数量及统计方法。
最近 24 小时暂无可用热度快照。