Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

阅读原文
arXiv 预印本·Ankit Goyal·2026年9月4日 16:44

模型升级之后,智能体的旧记忆何去何从:记忆可迁移性实证研究

原标题:Does Your Agent's Memory Survive a Model Upgrade? A Controlled Study of Memory Portability

论文86

模型升级已成常规,记忆迁移却并非如此。智能体即使保留相同的记忆存储也依然会发生“遗忘”:新模型对旧笔记的解读可能有所不同,混合的嵌入版本可能会破坏检索,而在缺乏原始证据的情况下,修复也可能会失败。我们对比了同一历史记录在四种记忆形式下的表现:逐字保留用于长上下文阅读(LC-RAW)、分块用于检索增强生成(RAG)、由模型压缩为自然语言笔记(NOTES),以及规范化为固定模式的知识图谱(KG-fixed)。该研究采用了 48 个带有随机答案代码的合成历史记录、精确评分机制,以及两个参数量在 100 亿以下的开源权重模型。我们的测量结果表明,固定模式结构的迁移表现十分可靠,在更换写入模型后,KG-fixed 的准确率仅变化了 $+0.0004 \pm 0.0020$。相反,压缩后的 NOTES 表现出高度的模型耦合性,准确率根据具体的迁移方向出现非对称性偏移,变化幅度达 $+9.91$ 或 $-13.28$ 个百分点。在 RAG 系统中,采用 50/50 混合索引的部分嵌入迁移仅获得了 4.96 个百分点的准确率提升,损失了完全重新嵌入所带来的 11.90 个百分点提升中的绝大部分。诊断分解分析表明,NOTES 准确率缺陷的 80%($0.467 \pm 0.014$)归因于初始构建过程中的信息丢失,而检索失败则导致了 RAG 缺陷的 81%($0.364 \pm 0.012$)。最后,仅针对存储本身的 NOTES 修复在全部 48 个测试用例中均未能达到 90% 的性能恢复目标;而在其中一个测试方向上,保留原始源历史记录使得 48 个用例中的 34 个成功实现了恢复。这些发现凸显了进行特定方向迁移测试、严格隔离嵌入空间以及为记忆修复保留源历史记录的必要性。

为什么值得读

在智能体频繁替换底模的当下,这项研究用量化实验戳破了跨模型复用自然语言笔记的幻想,直接关系到长期记忆系统的数据留存与选型策略。

标签

Agent MemoryModel UpgradeRAGKnowledge GraphPortabilityAI AgentsLLM Evaluation

评分依据

  • 新颖性82
  • 影响力84
  • 实践价值90
  • 可信度85
  • 时效性88