arXiv (ML)AI
大規模言語モデルの複合スパース性:単一次元圧縮を超えて
Beyond Single-Dimensional Compression: The Compound Sparsity Frontier of Large Language Models
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
大規模言語モデル(LLM)の圧縮技術は、これまで静的なパラメータプルーニングと動的なトークンレベルの計算削減のどちらか一つの手法に依存してきました。しかし、どちらか一方の手法のみで過度に圧縮を進めると、ある臨界点を超えて急激にモデルの性能が低下する問題がありました。本研究は、これら二つの圧縮メカニズムを組み合わせることで、圧縮の負荷を分散させ、この性能低下をより遠い地点へと遅延させられるのではないかという問いに取り組んでいます。
研究チームが提案する複合スパース性フレームワークは、まず低ランク近似とチャネルプルーニングを適用して静的に圧縮されたバックボーンを構築し、その後、軽量なルータを導入してトークンごとの動的層スキップを実現するというシンプルな設計となっています。このアプローチにより、パラメータスパース性とトークンレベルの計算スパース性を独立して制御することが可能になります。
言語理解および言語モデリングタスク全般にわたる実験結果から、複合スパース性は単一のメカニズムによる圧縮と比べて、同じ総スパース性の条件下で一貫して優れた性能を発揮することが確認されました。特に、理解タスクにおいてはモデルの性能低下が遠い地点で起こり、モデリング性能もより強力に保持されることが示されています。さらに詳細な分析を通じて、パラメータプルーニングとトークンスキップ間に存在する相互干渉が明らかにされ、固定的なスパース性予算下では、両者のバランスの取れた配置が最も効果的であることが判明しました。これらの知見は、複合圧縮がLLM圧縮の実践的な改善方法として有用である一方で、さらなる圧縮を根本的に制限する、より広い次元間スパース性の境界が存在することを示唆しています。