智能体大模型会在隐藏状态中编码间接提示注入暴露信号
原标题:Your Agentic LLMs Secretly Encode Latent Signals of Indirect Prompt-Injection Exposure
AI 导读
这篇论文研究智能体模型遭遇间接提示注入后的内部表征。作者在六个模型上发现,生成前隐藏状态的线性探针可在未见攻击、指令和任务集上以90%以上AUROC识别暴露;提出探针门控防御AGRI,并在AgentDojo中将Qwen3.5-27B的攻击成功率从34.6%降至0%,同时分析不同模型的潜在信号与自然语言解释之间的关系。
为什么值得读
间接提示注入防御正从外部规则检查转向模型内部信号检测,这项工作给出了可测量的识别能力与一个具体防御路径。
深度解读
发生了什么
原始事实: 论文研究智能体大模型暴露于间接提示注入(IPI)时的内部状态,并从探测、防御和解释三个方面展开。作者同时发布了代码。
核心技术
原始事实: 作者使用生成前隐藏状态训练简单线性探针,判断模型是否经历IPI暴露;随后提出AGRI,在探针判定风险时按需加入反注入推理。论文还分析与探针信号最相关的自然语言解释。
关键证据与数字
原始事实: 实验覆盖六个模型,包括753B参数的GLM-5.2。摘要称探针在未见攻击、智能体指令和任务集上达到90%以上AUROC,并在自适应攻击及跨语言场景保持较强鲁棒性。在困难AgentDojo设置中,Qwen3.5-27B的攻击成功率由34.6%降至0%。
为什么重要
分析: 结果暗示模型可能已经编码了“正在遭遇注入”的潜在线索,但这些线索未必自动转化为安全行为。若结论可复现,隐藏状态探测可能成为智能体运行时安全控制的新接口。
实际影响
分析: 工具调用型智能体可以考虑增加低成本风险门控:先检测内部暴露信号,再触发额外推理、工具结果隔离或人工确认。探针还可能用于离线审计模型在不同攻击类型和语言下的风险感知能力。
局限与不确定性
原始事实: 摘要没有给出六个模型的完整名单、各任务的样本规模、探针训练细节、额外推理成本或完整效用曲线。分析: 线性探针的高AUROC不等于因果地读取了“注入意识”;信号也可能对应格式、任务难度或工具结果分布。未验证推断: 在真实、持续变化的工具环境中,AGRI能否抵抗针对探针的规避攻击仍需独立测试。