论文提出 ELSAA,在不分解 Transformer 学到的投影或输出矩阵的前提下,直接近似注意力分数算子。方法以稀疏分支捕获高相似度交互,以低秩分支概括弥散的全局交互,并通过分母感知融合校准两者不同的注意力质量,目标是在不构造完整 N×N 矩阵的情况下支持更长上下文训练。
最近 24 小时暂无可用热度快照。