论文在 ALFWorld 上以 Qwen2.5-0.5B-Instruct 比较 Muon 与 AdamW,发现仅将 Muon 用于隐藏层权重矩阵时,GiGPO 最终验证成功率由 0.290 升至 0.546。效果受优势估计器和学习率影响,GraphGPO 在 1e-5 下达到 0.901,但研究仍是单随机种子的探索性结果。
最近 24 小时暂无可用热度快照。