论文提出 AntiSkillBench,用于端到端评估 Persona Skill 流程中的隐私泄漏、属性披露和行为冒充风险。基准包含来自 50 个行为丰富用户画像的 7,500 条对话轨迹,覆盖三种技能蒸馏策略、三类风险及四种在线和事后防御配置。对三种前沿智能体的实验显示,风险跨模型和蒸馏协议持续存在,现有防御效果有限且依赖具体蒸馏方式。
最近 24 小时暂无可用热度快照。