论文介绍归一化 Transformer(nGPT)的实用训练方法,将参数向量与激活向量约束在单位超球面上,并加入 Logit Gradient Preconditioning、对数学习率衰减、GatedAdamW、角度更新控制及可选探索机制。在现代 Mamba-2--Transformer 混合 MoE 上,14B 总参数 nGPT 达到相同验证损失约需一半训练 token。
最近 24 小时暂无可用热度快照。