SkillJack:自进化智能体中的持久技能后门
原标题:SkillJack: Persistent Skill Backdoors in Self-Evolving Agents
AI 导读
论文提出 SkillJack,利用自进化智能体的“经验转技能”流程,将投毒轨迹转化为可复用且持久的恶意技能。作者在 SkillX 与 Anything2Skill 上评估 150 条轨迹:技能提取后,SkillX 的安全检测率由 98.5% 降至 11.4%,两系统攻击成功率分别为 56.2% 和 89.2%;删除原始投毒记录后,80.0% 的技能攻击仍然存在。
为什么值得读
智能体开始长期积累和复用技能,而该研究表明删除投毒记忆并不足以清除已晋升为技能的后门,直接影响技能库的安全设计。
深度解读
1. 发生了什么
原始事实: 论文提出 SkillJack,攻击自进化智能体将历史交互提炼为可复用技能的流程。与仅在检索到投毒记录时生效的记忆或检索投毒不同,该方法试图让智能体自行把恶意经验转化为持久行为组件。作者称其为首个针对“经验到技能”管线的攻击;这是作者主张,尚未在此独立核验。
2. 核心技术
原始事实: 作者归纳了三种机制:其一是“净化漂白”,技能提取过程掩盖原始恶意意图;其二是“跨层晋升”,短暂经验被提升为持久能力;其三是“持久性隔离”,生成的恶意技能与原始投毒记录脱钩,因此源记录删除后仍可能生效。
3. 关键证据与数字
原始事实: 实验覆盖 SkillX 和 Anything2Skill,共使用 150 条轨迹及四类策略风险。摘要报告称,SkillX 中安全检测率从投毒轨迹阶段的 98.5% 降至提取技能阶段的 11.4%;两套系统的攻击成功率分别为 56.2% 和 89.2%。删除原始投毒记录后,80.0% 的技能介导攻击仍持续存在。Anything2Skill 也出现检测能力下降,但摘要未给出对应的完整检测率数字。
4. 为什么重要
分析: 风险边界从“智能体当前读取了什么上下文”扩展到“智能体过去生成并保留了什么能力”。如果实验能够复现,仅扫描记忆库、提示词或检索结果将无法覆盖已固化到技能层的攻击,安全审计必须追踪经验、技能及执行行为之间的来源关系。
5. 实际影响
分析: 构建技能学习型智能体的团队应为技能生成、更新、调用和删除建立完整生命周期控制,包括来源标记、生成前后双重安全检查、权限隔离、异常触发测试、版本回滚,以及删除源记录时对派生技能进行级联复查。论文提到部分技能会在良性查询上意外激活,这也提示需要测试非预期触发范围。
6. 局限与不确定性
原始事实: 摘要只报告两个代表性系统、150 条轨迹和四类风险,未提供完整基线、置信区间、统计显著性、攻击者能力边界或跨模型迁移结果。不确定性: 所给发布日期为 2026-08-03,属于未来日期元数据;本文内容、代码状态及结果尚未在此独立复现,也不能据此确认已经同行评审。其对其他智能体框架和真实生产环境的泛化能力仍待验证。