arXiv (NLP)AI
大規模言語モデルにおける畳み込みニューラルネットワークの活用
Convolution for Large Language Models
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
大規模言語モデル(LLM)の主流であるTransformerアーキテクチャは、自己注意機構を通じてトークン間のグローバルな相互作用を実現していますが、自然言語の局所性を明示的に符号化していません。本研究では、軽量なdepthwise畳み込み(深さ方向畳み込み)がモデルサイズを大幅に増加させることなく、局所的な帰納バイアスを提供できるかどうかを検証しています。
研究チームはQwen3 Transformerブロック内の17箇所で畳み込みを適用するマクロレベルのアブレーション研究を実施し、注意メカニズムの前に投影されたクエリ、キー、バリューに畳み込みを適用した場合に最良の結果が得られることを発見しました。その後のミクロレベルの調査では、カーネルサイズがk=3の残差depthwise畳み込みが、追加の正規化や活性化関数なしで最適な性能を示すことが明らかになりました。
Qwen3モデルと複数の事前学習データ予算にわたる評価では、この設計は7つのダウンストリームベンチマークの平均精度を向上させながら、パラメータ数の増加を0.01%未満に抑えています。表現レベルのケーススタディは、畳み込みによって重複するトークンIDが直近の文脈に対してより敏感になることを示唆しており、depthwise畳み込みが短距離トークン相互作用のモデリングにおいて自己注意機構を補完する軽量な手段として有効であることを支持する結果となっています。