Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

阅读原文
arXiv 预印本·Pengxiang Zhao·2026年9月4日 16:02

剖析 mHC 多流残差:选择性路由与后层的恒等混合

原标题:How Does mHC Use Its Residual Streams? Selective Routing and Near-Identity Mixing

论文80

超连接(Hyper-Connections)及其流形约束变体 mHC 将残差通路从单流拓宽至 n 个流,但训练好的模型究竟如何利用这种容量仍不明确:各模块读写的广泛程度如何、残差通路混合不同流的强度如何,以及这些流是否承载着不同的表征。我们利用有效流数量、跨流残差权重以及流间余弦相似度,探究了 DeepSeek-V4-Flash 四流残差通路中的这些特性。结果表明,读/写路由较为集中,但随网络深度而变化:典型的注意力机制或 FFN 节点实际上仅使用约两个流,主导流在各层之间不断变化,且各流的表征在方向上保持着明显的区分度。残差混合程度相对适中,且主要发生在早期层;在第 22 至 42 层中,该通路大多是将每个流单独向前传递。针对性的干预实验证实了这些模式的功能重要性:将后期混合器替换为恒等映射仅使 C4 困惑度增加 1.9%,并保持了六项任务的平均得分,而替换早期混合器则使困惑度激增 41%。将每个早期混合器固定为其 C4 诊断均值仅使困惑度上升 0.2%,平均得分下降 0.25 个百分点,这表明在所评估的指标上,其特定于节点的结构远比其逐 token 的变化更为重要。同样,在每个节点处仅保留每个 token 最大的三个路由权重,最多使困惑度增加 2.7%,平均得分变动至多 0.4 分。因此,所研究的模型仅实现了四流 mHC 所赋予的部分灵活性:单个块极少需要全部四个流,而后期的残差混合几乎未带来可测量的收益。

为什么值得读

揭示了多流残差架构在真实大模型中的利用盲区,后层混合近乎恒等的发现为后续极简化网络设计与推理优化提供了明确的剪枝依据。

标签

mHCHyper-ConnectionsDeepSeek残差网络模型可解释性架构优化Transformer

评分依据

  • 新颖性78
  • 影响力80
  • 实践价值76
  • 可信度82
  • 时效性84