论文将 Transformer 转换为混合注意力模型的问题形式化为预算约束下的层子集优化,并提出 FlashMorph。该方法冻结模型权重,在合成长上下文检索数据上联合学习层级门控,再按全注意力预算离散化配置,结合 logits 蒸馏与长上下文微调,以降低层选择成本并保持召回和通用基准表现。
最近 24 小时暂无可用热度快照。