论文系统比较去除前馈网络后的注意力独占解码器Transformer,并分别控制参数量、训练FLOPs和深度。结果显示,直接删除前馈层会造成明显损失,但将预算转移到注意力深度后,匹配参数量时差距仅0.006 nat;残余差距主要来自参数化记忆,而非上下文理解。
最近 24 小时暂无可用热度快照。