KVpop提出一种面向固定预算的学习式KV缓存淘汰策略,直接监督每个键值对的保留或丢弃决策,并以无需构造稠密注意力图的未来注意力目标训练评分器。其延迟记忆评分器利用近未来上下文,在Qwen3-4B数学推理中压缩75%和88%缓存时,分别保留98%和97%的全注意力性能。
最近 24 小时暂无可用热度快照。