当智能体学会成为你:Persona Skill 中的隐私泄漏、冒充风险与防御基准
原标题:When Agents Learn to Be You: Benchmarking Privacy Leakage, Impersonation Risk, and Defenses in Persona Skills
AI 导读
论文提出 AntiSkillBench,用于端到端评估 Persona Skill 流程中的隐私泄漏、属性披露和行为冒充风险。基准包含来自 50 个行为丰富用户画像的 7,500 条对话轨迹,覆盖三种技能蒸馏策略、三类风险及四种在线和事后防御配置。对三种前沿智能体的实验显示,风险跨模型和蒸馏协议持续存在,现有防御效果有限且依赖具体蒸馏方式。
为什么值得读
Persona Skill 正从个性化机制变成可复用资产,这项基准及时揭示了传统记录级隐私防御在技能蒸馏和行为冒充场景中的缺口。
深度解读
发生了什么
原始事实: 论文提出 AntiSkillBench,用于评估 Persona Skill 从交互历史到可执行技能产物的完整安全流程。基准覆盖技能级隐私泄漏、智能体级属性披露与行为冒充,以及相应防御措施。
核心技术
原始事实: 数据集包含 50 个行为丰富的用户画像和 7,500 条基于画像的对话轨迹;评估覆盖三种技能蒸馏策略,并比较四种在线或事后防御配置,包括主动风险抑制和被动来源保护。分析: 这使评估对象从单条记录或检索记忆扩展到被压缩、复用和执行的技能资产。
关键证据与数字
原始事实: 实验涉及三种前沿智能体。论文摘要称,风险跨不同智能体骨干和蒸馏协议持续存在,并从显式属性扩展到交流风格和人格特征;现有防御的效果有限,并依赖具体蒸馏策略。未核实推断: 摘要未提供各项指标、置信区间、模型名称或防御配置的逐项结果,因此不能据此比较方法优劣。
为什么重要
分析: Persona Skill 将分散的个人信号集中为可携带、可重复调用的行为程序。一旦技能被共享、复制或部署到不同代理,隐私风险可能不再表现为“泄露一条事实”,而是重建一个人的表达习惯、偏好和决策模式。行为冒充因此成为独立于传统属性泄露的安全问题。
实际影响
分析: 开发者应把技能导出、共享和调用视为新的隐私边界,分别测试显式信息、隐含属性、风格特征和行为一致性。基准中的多种蒸馏和防御配置也提示,单一的提示过滤、事后审计或来源标记可能不足以覆盖整个生命周期。
局限与不确定性
原始事实: 摘要没有说明 50 个画像的构建方式、对话轨迹是否包含真实用户数据、三种蒸馏策略与四种防御的具体定义,也未给出完整指标和基线。分析: 合成画像与真实长期交互之间可能存在分布差异,三种智能体也未必代表所有代理架构。论文全文、代码和数据许可状态需要进一步核验。
原始来源
- arXiv 摘要页
- 论文标识:arXiv:2608.03700
- 来源:hf-papers;发布时间:2026-08-03T20:00:00.000Z