阅读原文
HuggingFace 每日论文Yushi Sun论文88

个性化幻觉:LLM如何编造用户画像,以及为何自我监控会误导

原标题:The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads

这篇论文研究持久记忆个性化LLM的“过度推断”(OI):模型在证据不足时编造用户属性。MirageBench评测12个模型、143,616条判断声明,发现各模型有35%—49%的声明过度推断,平均41.6%;模型自评OI与外部评审结果反向相关,说明自我报告并不适合用于模型比较。

为什么值得读

持久记忆正进入主流产品,而这项评测显示模型可能持续编造用户画像,且模型自评越可靠的信号反而可能越弱。

标签

个性化LLM用户画像模型记忆事实性评测基准AI安全MirageBench