损失函数看不见基底,但 Adam 看得见
原标题:The Loss Does Not See the Basis, but Adam Does
在分解模型 $W = UV^\top$ 上,梯度下降会隐式偏向低秩解,而从相同的小初始化出发的 Adam 则不会。我们将这种差异追溯到损失函数的规范对称性,即其在 $(U, V) \mapsto (UQ, VQ)$ 变换下保持不变。只有当优化器具有规范等变性时,梯度流的低秩机制才可被该优化器利用;这是实现迁移的必要条件,但并不足以保证恢复低秩解。梯度下降、动量法、“共享标量”Adam、Muon 和 Shampoo 满足这一条件,而 Adam、RMSProp 及其他逐坐标方法则不满足。一个结构定理表明,无记忆等变规则恰好是由 Gram 矩阵决定的左预条件器;一个迁移定理则将梯度流的路径性质推广到共享标量流。随后,我们根据相对于植入真实解的恢复误差,对欠定矩阵感知中的九种更新规则进行排序。从逐坐标预条件到共享标量预条件的一参数族以单调方式恢复了这种偏置,从而确定各向异性是其成因。“谱调度”调和了关于 Muon 的两种相互对立的结论:等速率更新能够精确恢复低秩目标,但随着谱尾部增大,其优势会逐渐消失。在 Transformer 中,Adam 在第一步就将两个规范等价的初始化区分开来,而等变优化器仍保持浮点精度;最终,各注意力头的不变量 $W_Q^\top W_K$ 在相对 Frobenius 距离上相差 56%,这一差距无法通过任何逐头旋转消除。在两个高光谱数据集上,当训练损失匹配时,在最低采样密度下,梯度下降将留出误差降低了 43–44%,并且对应更低的有效秩。因此,基选择并非调参细节,而是关于优化器选择哪个插值解的一项决策。
为什么值得读
它把 Adam 与梯度下降在低秩恢复上的差异归因于可检验的规范等变性,并连接到 Transformer 参数化与真实数据误差。