观察中研究观察中0 家独立报道0
稀疏性与数据枯竭:MoE 架构在重复语料下更容易过拟合
首次出现 · 2026/9/11 01:57最近活动 · 2026/9/11 01:57
当训练语料不足而必须重复使用时,混合专家(MoE)架构比稠密模型更容易过拟合。实验显示,80M 稠密模型经受 8 次重复仍近乎无损,MoE 在 4 次重复时便出现衰退,退化程度取决于总参数量而非激活参数。强掩码正则化虽能延缓路由的过早固化,却仍难完全抹平重复样本造成的损耗。
最近 24 小时事件热度
最近 24 小时共有 8 个真实快照;峰值 0,出现于 9/12 11:00;最新热度 0。
- 9/12 11:00,事件热度 0
- 9/12 14:00,事件热度 0
- 9/12 17:00,事件热度 0
- 9/12 20:00,事件热度 0
- 9/12 23:00,事件热度 0
- 9/13 02:00,事件热度 0
- 9/13 05:00,事件热度 0
- 9/13 08:00,事件热度 0