论文为线性模型中的延迟泛化提出可精确求解的机制:全批量重球优化结合权重衰减时,经验零空间中存在保持训练预测不变的“顿悟子空间”,其慢耗散决定总体风险下降和顿悟时间,并延伸到局部二次近似的非线性网络。理论区分耦合L2正则与解耦权重衰减,且在模加法实验中观察到符合预测的延迟尺度。
最近 24 小时暂无可用热度快照。