论文提出层次地标稀疏注意力(HiLS),让模型在语言建模损失下端到端学习区块选择,并将每个查询对检索区块的独立注意力结果按检索分数融合。实验显示,HiLS在域内长度上可接近甚至超过全注意力,并能外推至训练上下文长度的64倍以上,同时保持约90%的检索准确率;现有全注意力模型也可通过轻量持续预训练转换。
最近 24 小时暂无可用热度快照。