Muon 遇见 Mamba:状态空间模型的谱优化
原标题:Muon Meets Mamba: Spectral Optimization for State Space Models
AI 导读
该论文在受控协议下比较 Muon 与 AdamW 训练 Mamba-2 130M,并仅改变使用 Muon 的权重组。结果显示收益集中于输出投影:仅对输出投影使用 Muon 优于用于输入投影或两者同时使用,优势主要体现在 token 效率,并跨两个语料库、两个 token 预算及超出计算最优点的续训保持。
为什么值得读
Muon 在 Mamba-2 上的收益并非普遍存在,而是集中于输出投影,这一结论可直接影响状态空间模型的优化器配置与训练预算分配。
深度解读
1. 发生了什么
原始事实: 论文在 Mamba-2 130M 上比较 Muon 与 AdamW,并通过仅改变采用 Muon 的权重组来控制变量。作者报告,收益集中在输出投影:只对输出投影使用 Muon,优于只用于输入投影或同时用于两者。
2. 核心技术
原始事实: Muon 使用 Newton-Schulz 迭代对每个权重矩阵的更新进行正交化,可解释为谱范数下的最速下降。实验将这种更新规则选择性地用于 Mamba-2 的输入投影和输出投影,并以 AdamW 为对照。
分析: 这种按权重组拆分的设计有助于判断优化器收益来自哪个结构部件,而不仅是比较两套整体训练配置。
3. 关键证据与数字
原始事实: 模型规模为 Mamba-2 130M;测试覆盖两个语料库和两个 token 预算;训练还延续到计算最优点之后。摘要称,仅用于输出投影的 Muon 表现最好,主要优势是 token 效率。Muon 会降低其所训练投影的条件数,但条件更好的输入投影并未带来相应收益。
信息缺口: 所给摘要未提供损失值、下游指标、token 数、训练算力、方差、重复次数或统计显著性。
4. 为什么重要
分析: 现有 Muon 证据主要来自 Transformer;该工作将问题扩展到状态空间模型,并表明优化器效果可能与矩阵在架构中的功能位置强相关。它也削弱了“条件数越低就越有效”这一简单解释。
5. 实际影响
分析: 训练 Mamba-2 类模型的团队可以优先测试“输出投影使用 Muon、其余权重保留 AdamW”的混合配置。若完整论文中的收益幅度足够大且复现实验稳定,这种配置可能在达到同等训练目标时减少所需 token,而无需全面替换优化器。
6. 局限与不确定性
原始事实: 摘要仅明确报告 Mamba-2 130M,未说明更大模型、其他状态空间架构或下游任务的结果。
分析: 单一模型规模限制了外推范围;条件数结果只能排除一种简单机制,不能确定真正原因。
未验证信息: 来源标注的发布日期为 2026-08-04,属于未来日期;本文条目仅依据用户提供的摘要整理,未独立核验论文全文、版本历史或实验表格。
7. 原始来源
- arXiv 摘要页:arXiv:2608.03941
- 论文标题:Muon Meets Mamba: Spectral Optimization for State Space Models