论文提出HOLA,将线性注意力的压缩状态与有界精确KV缓存结合:状态负责可压缩结构,缓存保留不应被覆盖的关联。缓存依据β×||e||写入,并通过解耦RMSNorm-γ读取。在340M参数、15B SlimPajama训练下,WikiText困惑度由27.32降至22.92,并在最长32k上下文的RULER针回忆任务中优于其他线性模型与新近缓存基线。
最近 24 小时暂无可用热度快照。