论文提出,Transformer 的同一前向计算流同时承担下一词预测与未来预测所需状态存储,可能造成职责冲突。作者设计双计算流架构分离两种功能,并在多种规模开展预训练;摘要称其提升验证损失与数据、算力效率,并在下游任务上平均领先标准 Transformer 2—3 个百分点。
最近 24 小时暂无可用热度快照。