Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

阅读原文
arXiv 预印本·Atindra Jha·2026年9月10日 17:57

稀疏性与数据枯竭:MoE 架构在重复语料下更容易过拟合

原标题:Data Scarcity and Model Sparsity: Mixtures-of-Experts Overfit More to Repeated Data

论文81

随着人工编写文本资源的枯竭,重复使用语言模型训练数据已成为一种标准做法。先前的研究探讨了稠密激活 Transformer 的数据重复问题,但尽管近年来占据主导地位的稀疏架构(如混合专家模型 MoE)具有更高的计算效率,数据重复对其产生的影响在很大程度上仍未得到探索。我们在单领域和多领域数据混合中,以及包含不同专家数量和粒度的 MoE 设置下,改变数据重复率进行了系统研究。在激活参数量从 80M 到 1B(总参数量 8.5B)的模型中,我们一致发现,在数据重复的情况下,MoE 的性能退化更为迅速。这种效应随着稀疏度的增加而加剧,且由总参数量而非激活参数量决定。虽然 80M 稠密模型在数据重复 8 次以上时性能退化极小,但 MoE 模型在重复 4 次时便开始受损,并迅速恶化;在重复超过 32 次后,MoE 丧失了其在完全不重复数据设定下的性能优势,表现不及稠密模型。我们尝试了现有的正则化方法作为潜在的补救措施。我们发现某些方法(如 dropout)可以缓解过拟合。特别是,在采用基于强掩码的正则化时,即使数据重复超过 64 次,MoE 的表现也能优于稠密模型。然而,没有任何方法能完全达到使用完全不重复训练数据时的性能水平。最后,我们分析了高重复场景下与 MoE 过拟合相关的内部机制,发现 MoE 路由普遍在训练早期即趋于稳定,且专家专门化与对重复数据的过拟合密切相关。总之,我们的工作探讨了稀疏性与数据重复之间的负面相互作用:我们为过拟合的核心机制及其潜在解决途径提供了证据,并为未来通过打破记忆模式来减少模型参数过度专门化的研究指明了富有前景的方向。

为什么值得读

揭示了 MoE 在多轮次训练下的过拟合脆弱性,明确指出退化由总参数而非激活参数决定,为后语料时代 MoE 训练的 epoch 控制提供了直接依据。

标签

Mixture-of-ExpertsPre-trainingData RepetitionOverfittingScaling LawsDeep Learning

评分依据

  • 新颖性80
  • 影响力83
  • 实践价值81
  • 可信度80
  • 时效性78