论文统一比较 Softmax Attention、DeltaNet、Gated DeltaNet、Kimi Delta Attention 与 Gated DeltaNet-2 的循环记忆机制,并在 350M 参数、150亿 token 训练中评估损失、吞吐、优化器和混合堆叠。结果显示,Muon 配合 Kimi Delta Attention 的最终验证损失最低,纯 Gated DeltaNet 配合 AdamW 吞吐最高;提出的跨层值路由 CLVR 在匹配实验中改善了 DeltaNet 与 Gated DeltaNet 的验证损失,但论文未提供实证推理速度基准。
最近 24 小时暂无可用热度快照。