arXiv (ML)AI
大規模言語モデルを用いたクローズドループ特徴チャネル構成のスケーリング
Scaling Closed-Loop Feature Channel Configuration with LLMs
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
大規模言語モデル(LLM)を活用したニューラルネットワークの自動設計が、より大規模な探索環境でも有効であることが新たな研究で示されました。従来の研究では、LLMが生成したコードを実行して得られたフィードバックに基づき、ニューラルネットワークの幅(チャネル数)を直接最適化できることが示唆されていました。しかし、その結果は比較的限定的な評価セットに基づいており、より密集した評価体制での最適化の再現性や、評価ネットワーク数の増加に伴う建築的規則性の出現は未検証でした。
新しい研究では、この探索を大幅にスケールアップしました。各ファインチューニングサイクルで250個の候補ネットワークを評価し、全8サイクルで2000の生成候補を分析しました。タスク関連メタデータフィルタリング後、CIFAR-100での検証評価は462件となりました。結果として、サイクルごとの平均精度は斜率9.87e-4の正の線形トレンドを示し(p=0.043)、高性能領域ではより強い改善が観察されました。最高精度は0.3144から0.3676に向上し、上位5および上位10のサイクル平均も正のトレンドを示しています。
スケール拡大により、パラメータ効率も向上しました。最良モデルは1180万パラメータで0.3676の精度を達成しており、これは初期の高性能モデル(1億6650万パラメータで0.3144の精度)と比較して、大幅な効率化を実現しています。さらに興味深いことに、より多くのサンプルから、従来の観察では見落とされていた建築的な規則性が明らかになりました。検証候補の41.8%が2の累乗ではないチャネル幅を採用しており、強力なモデルは中程度の初期幅と拡張された中盤や後期ブロックを特徴とした構造化されたチャネル配置パターンを共有しています。