arXiv (NLP)AI
EEG信号の符号化によるLMの人間的な次単語予測行動の検証
Encoding EEG Signals to Examine Human-Like Next-Word Prediction Behaviour in Language Models
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
言語モデル(LM)は与えられた文脈から次の単語を予測することに優れるよう訓練されており、人間も読解時に同様の予測可能性を持っています。神経科学の研究によれば、次単語の予測可能性は脳反応に影響を与え、脳波計(EEG)を用いてミリ秒単位の精度で記録できることが明らかになっています。本研究では、高度なLMが次単語予測タスクで人間のパフォーマンスと密接に一致する精度を達成していることが示されていますが、これは重要な疑問を生じさせます。より高い予測精度が、必ずしも人間の読解理解に関連する認知信号を十分に捉えているとは限らないのではないか、ということです。
本研究では、人間とLM双方に対して、トップ1予測とサプライザル(surprisal)を含む2つの情報尺度に基づいてリグレッサを生成し、EEG記録から誘発された事象関連電位(ERP)を予測します。これらのERPは読書中の認知処理の異なる段階を反映しています。著者らは、ERP パターンのモデル化が、読書時におけるLMの認知的妥当性の詳細な分析を提供できると主張しています。
研究の結果は、サプライザルのみが言語処理ERPと潜在的に相関することを示唆しており、特に高い意味内容を持つ開いたクラスの単語でこの傾向が顕著です。さらに、パラメータ数と計算予算の増加によるLMのスケーリングが、人間的な言語処理への収束を一貫して改善するという仮定に対し、本研究の知見は疑問を投げかけています。