arXiv (ML)AI
TITLE_JA: 凍結されたランダムCNN特徴抽出器における深層強化学習での創発的スパース性
Emergent Sparsity in Frozen Random CNN Feature Extractors for Deep Reinforcement Learning
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
深層強化学習の分野で興味深い現象が報告されました。ランダムに初期化されたまま学習中に凍結されたCNN特徴抽出器を用いて訓練されたエージェントが、スパース性を誘導する目的関数を一切使用していないにもかかわらず、極めてスパースな完全結合層表現を自然に発展させるというものです。
具体的には、最初の完全結合層(FC1)において、決定論的なPongゲームではわずか1~3個のニューロン、確率的なPongでは5~11個のニューロンだけを用いてタスク関連情報を圧縮しています。一方、学習可能なCNNでは同じ条件下で55~64個のニューロンが活性化されます。このスパース性はタスク複雑性とともにスケーリングし、Pongでは1~11個、Breakoutでは19~26個、Space Invadersではおよそ42個のニューロンが活性化されます。
興味深いことに、同一ゲームで同じシード値を使用しても異なる結果が生じます。Pongの3つの同一シード値では5個、7個、11個のアクティブニューロンが生成され、5ニューロン版は報酬+14で停滞しますが、他の2つはエキスパート性能(+18.4、+18.7)に達します。このため、ランダム射影の利用可能な次元性が達成可能なパフォーマンスを制限していることが示唆されます。さらに、アブレーション研究により、これらのアクティブニューロンの除去はパフォーマンスを劇的に低下させることが確認されました。
この研究の最も重要な示唆は、入力次元性が本質的タスク次元性をはるかに上回る場合、凍結されたランダム射影に対する勾配降下法が、明示的なスパース性機構なしに基礎となる問題の有効ランクを明らかにする可能性があるということです。