arXiv (NLP)AI
TITLE_JA: 言語モデルにおける位置依存的な繰り返し効果:より多くが必ずしも良くない場合
When More Becomes Less: Position-Dependent Repetition Effects in Language Models
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
言語モデルがテキストを処理する際、同じ単語が何度も繰り返されると、その単語の予測確率がどのように変化するかを調べる研究が注目を集めています。従来の研究では、繰り返される対象トークンの出現回数が増えるほど、モデルの予測確率も単調に上昇すると仮定されていました。しかし、arXivに投稿された新たな研究は、この仮定が必ずしも成立しないことを明らかにしました。
この研究では、読み出し位置を変える「二つのプローブ」設計を採用しています。隣接プローブでは予測スロットを繰り返されたブロックの直後に配置し、分離プローブでは異なる文脈フレーム内に配置しています。隣接プローブでは直感的な予測が成立し、繰り返し数の増加とともに目標トークンの出現確率が上昇してプラトーに達します。一方、分離プローブでは逆U字型の曲線が観察され、最初は確率が上昇しますが、繰り返しが増えるに従って反対に低下する現象が見られました。
この逆U字型の効果は、13の公開オープンアクセス型のエンコーダーとデコーダーモデルすべてで統計的に有意性が確認されました。さらに、スペイン語、中国語、ドイツ語、フランス語を含む42の多言語セルにおいても再現性が確認されています。詳細な因果関係の分析により、この効果は単語の長さや一般的な冗長性ではなく、正確な語彙的繰り返しに由来することが判明しました。注目すべきは、繰り返し数が増えるにつれて、個別のターゲットトークンへの注意は低下する一方で、繰り返されたブロック全体に割り当てられる注意予算は、因果言語モデルでは増加するが、マスク型言語モデルでは増加しないという内部メカニズムの違いも明らかになっています。