论文提出可插拔的 Self-Gating Attention(SGA),用共享可学习矩阵表示稳定的注意力模式,再叠加输入相关残差,避免标准自注意力中的查询、键投影,将长序列上的时间与分数矩阵内存复杂度降为线性。作者在涵盖电力、金融、天气、医疗等领域的9个公开数据集上评估,报告称其效率提升且预测性能保持竞争力,但摘要未给出具体数值。
最近 24 小时暂无可用热度快照。