这篇论文研究智能体模型遭遇间接提示注入后的内部表征。作者在六个模型上发现,生成前隐藏状态的线性探针可在未见攻击、指令和任务集上以90%以上AUROC识别暴露;提出探针门控防御AGRI,并在AgentDojo中将Qwen3.5-27B的攻击成功率从34.6%降至0%,同时分析不同模型的潜在信号与自然语言解释之间的关系。
最近 24 小时暂无可用热度快照。