论文提出Sparse Delta Memory(SDM),在Gated DeltaNet基础上,以稀疏读写替代稠密键值外积,将线性RNN的显式记忆扩展到更高容量。作者声称,在相同参数量和isoFLOP约束下,更大的状态记忆可改善上下文学习与长上下文检索;学习初始状态后,还能增强常识与推理任务表现。
最近 24 小时暂无可用热度快照。