这项工作将 Memory Decoder 的参数规模扩展到 69 亿,并用 3000 亿 token 进行预训练。作者构建分布式 Faiss 索引与检索流程,并通过稀疏、批量加载 kNN 分布降低规模化成本。在 17 个基准上,6.9B 通用记忆配合 Pythia-410M 将平均分从 29.86 提升到 37.34,超过 Pythia-12B 的 37.24,同时总参数少 39%。
最近 24 小时暂无可用热度快照。