SeKV提出一种分辨率自适应的语义KV缓存:将上下文按熵划分为语义跨度,在GPU保存轻量摘要向量,并把低秩SVD基存于CPU,解码时通过训练的zoom-in机制按需重建相关跨度的 token 级细节。在128K上下文下,相比完整KV缓存降低53.3% GPU内存,并较最强语义压缩基线平均提升5.9%,仅增加少于0.05%的可训练参数。
最近 24 小时暂无可用热度快照。