阅读原文
HuggingFace 每日论文Yanting Wang论文88

Agent Against Agent:用于自动提示注入红队测试的智能体系统

原标题:Agent Against Agent: An Agentic System for Automatic Prompt Injection Red Teaming

论文提出PIMiner,通过在不同数据集与目标模型序列上训练,从零构建可迁移的攻击策略库;测试时无需针对新模型再训练,每个样本仅需约10次查询。在IPIArena和AgentDojo上,PIMiner对Gemini-2.5-Pro、GPT-5.1及Claude-Sonnet-4.5取得40.0%至86.7%的攻击成功率。

为什么值得读

新模型上线后,攻击策略能否跨模型复用是红队测试的关键;该工作用较少查询量报告了针对多种前沿模型的可迁移攻击结果。

标签

prompt-injectionred-teamingLLM-agentsPIMinertransferabilityAgentDojoIPIArena