arXiv (ML)AI
Muon オプティマイザーのグロッキングにおける有効成分の解明
The Active Ingredient in Muon's Grokking
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
機械学習の最適化手法に関する研究論文が発表されました。Muon オプティマイザーという最適化アルゴリズムが、モジュラー算術の学習におけるグロッキング現象(急激な汎化性能の向上)に到達する速度が、従来の AdamW オプティマイザーより大幅に高速であることが知られていました。しかし、その優位性の具体的なメカニズムが明確には理解されていませんでした。本研究は、複数の初期値と学習率での実験を通じて、Muon の性能向上を支える主要因を特定することに成功しました。
実験結果によると、Muon の高速化の鍵は「スペクトル正規化制約」ではなく「直交化(Newton-Schulz反復)」にあることが判明しました。直交化のみを適用した場合は完全な Muon と同等の性能を示し、一方スペクトル正規化のみでは AdamW と変わらないか、さらに不安定になることが示されました。さらに機械的な分析により、直交化を導入したオプティマイザーは約3倍低いスペクトルノルムで汎化に到達し、埋め込みの移動量を制御した場合でも、単なる摂動の削減ではなく本質的に低いノルム解へ収束することが明らかになりました。
Newton-Schulz 反復回数の削減実験では、5回から1回に減らすと閾値到達は加速する一方で、グロッキング後の解が脆弱になり、学習率の増加に伴って崩壊しやすくなることが観察されました。単一の反復は小さな学習率でのみ安定的であり、標準的な5回の反復が学習率に対して堅牢な選択肢であることが結論づけられました。研究チームは再現性を支援するため、完全な学習コードと分析コードを公開しており、グロッキング現象の理解深化に貢献しています。