HuggingFace 每日论文Yushi Sun论文88
个性化幻觉:LLM如何编造用户画像,以及为何自我监控会误导
原标题:The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads
这篇论文研究持久记忆个性化LLM的“过度推断”(OI):模型在证据不足时编造用户属性。MirageBench评测12个模型、143,616条判断声明,发现各模型有35%—49%的声明过度推断,平均41.6%;模型自评OI与外部评审结果反向相关,说明自我报告并不适合用于模型比较。
为什么值得读
持久记忆正进入主流产品,而这项评测显示模型可能持续编造用户画像,且模型自评越可靠的信号反而可能越弱。
标签
个性化LLM用户画像模型记忆事实性评测基准AI安全MirageBench