arXiv (ML)AI
CausalGate:因果的重要度蒸留によるTransformerモジュールプルーニング
CausalGate: Causal Importance Distillation for Transformer Module Pruning
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
大規模言語モデル(LLM)の効率的な推論は、計算コストの削減とレスポンス速度の向上という課題を解決する重要な技術です。既存の適応的推論手法は、隠れ状態の類似度や活性化の大きさといった観察的な指標に依存して冗長なモジュールを削除していますが、こうした相関ベースの指標は、意味的精度に不可欠な微妙で非線形な構造計算を見逃しがちです。
新たに提案されたCausalGateは、因果介入に基づいたTransformerの軽量推論フレームワークです。このフレームワークは、キャリブレーション段階でAttentionとMLP(多層パーセプトロン)の各サブレイヤーを個別に分離し、それぞれの出力をゼロ化した上で、最終的なロジット分布のKullback-Leibler発散を通じて正確な意味的損傷を測定します。この手法により、どのモジュールが実際に出力品質に影響しているかを厳密に特定することができます。
さらにCausalGateは、ランタイムの動的ルーティングのオーバーヘッドを排除するため、構造的重要度の階層を静的でしかも軽量なスカラーゲートのセットに蒸留します。この蒸留プロセスでは、指数移動平均平滑化目的関数と微分可能なペアワイズランキング損失を組み合わせることで、推論時のオーバーヘッドゼロを実現しています。
TinyLlama-1.1B、Qwen2.5-3B、Llama-3.1-8Bといった複数のモデルで言語モデリングと常識推論タスクを評価した結果、CausalGateは既存の動的ルーティングやレイヤースキップ手法よりも優れた性能を示し、理論的な計算削減をハードウェアの実レイテンシ削減に変換しました。