arXiv (ML)AI
モーメント推定のための信頼領域フレームワーク
A Trust-region Framework for Moment Estimation
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
本論文は、確率的勾配降下法の最適化においてAdamなどの適応的モーメント推定メカニズムの振る舞いを理解するための信頼領域フレームワークを開発している。このフレームワークでは、個々の重みに対する更新ステップの大きさが、p∈[2,4]のモーメント制約によって支配される信頼領域内に制限される。この導出から、2次モーメント推定と正規化されたp次モーメント推定に基づく学習率メカニズムのファミリーが生まれる。p=4の場合、これは尖度(kurtosis)のような推定を含む。Gmakeと呼ばれるこの一般的なメカニズムは、モーメント推定による正規化、学習率スケジューリング、運動量としてのスペクトル低周波フィルタリング、そして演算子レベルのスペクトル正規化を共通の信頼領域フレームワーク内で統一的に解釈する。
GPT2-124M(FineWeb-EduおよびTinyStoriesで訓練)に関する実験結果から、4次モーメント実現は信頼領域制約が弱いときに最大の利益をもたらすことが示唆されている。信頼領域制約が段階的に強化されるにつれて、2次モーメント実現がより競争力を持つようになり、対応する4次モーメント実現と比較してしばしばわずかに低い検証損失を達成する。この研究は、大規模言語モデルの最適化戦略をより深く理解し、異なる制約条件下での最適なモーメント推定方法の選択に関する実践的な指針を提供するものである。