arXiv (NLP)AI
TITLE_JA: MoE(混合専門家モデル)における知識注入の存在を探索:LLMの幻覚軽減のための専門家認識対比デコーディング
Knowledge Injection Exists in MoE? Exploring Expert-Aware Contrast Decoding in MoE for Mitigating LLMs'Hallucinations
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
大規模言語モデル(LLM)が生成する事実に基づかない回答である「幻覚」は、実用化の大きな課題となっています。従来、プロンプトエンジニアリングやモデル最適化といった幻覚軽減手法が提案されてきましたが、これらの方法はモデルの内部知識を根本的に変えるか、さもなくば異なるドメインへの汎化性能が低いという問題を抱えていました。近年、注目されている対比デコーディング(contrastive decoding)という手法は、LLMの層間の差異を利用して幻覚を軽減しますが、既存研究ではGPTなどのトランスフォーマーベースのモデルのみに焦点を当てており、混合専門家(MoE)モデルのような別の有効なアーキテクチャを見落としていました。
本研究は、MoEアーキテクチャが従来のトランスフォーマー構造を大きく変えることに着目し、MoEにおいても同様の層間差異が存在するかを実証的に調査しました。その結果、共有専門家を持つMoEでは層間の顕著な差異が存在しないことが判明しました。しかし異なるMoEモデル全般を見ると、高層では事実的な出力と非事実的な出力に対して異なる専門家の活性化パターンが観察されました。
これらの知見に基づいて、研究チームは「EAACD(専門家認識適応型対比デコーディング)」を提案しました。EAACDはMoEの高層における専門家の差異を利用して、質問応答タスクにおける幻覚を軽減します。具体的には、高層の専門家を信頼度と一貫性に基づいて高信頼度グループと複数の低信頼度グループに分類し、高信頼度グループの予測を各低信頼度グループの予測と対比させることで、モデルの元の予測を調整します。対比の効果をさらに強めるため、EAACDは低信頼度の専門家からの幻覚をアテンション機構とマスキングによって増幅し、より強力な負の参照として機能させます。4つのデータセットにおいて、EAACDはすべてのベースライン手法を上回る性能を示しました。