论文提出 InMind 基准,覆盖十个生活领域的 125 个专家验证任务,其中 113 个有可引用公开来源,用配对对照区分记忆未存储、模型缺乏桥接知识与记忆未被检索。结果显示,记忆置于上下文时模型可答对 84.0% 的间接查询,但交给六种向量、图和智能体记忆系统检索时最高仅 14.4%;即使嵌入维度扩大八倍,盲区仍基本存在。
最近 24 小时暂无可用热度快照。