arXiv (AI)AI
TITLE_JA: 確率的サンプリングは認識論的に浅い:LLMにおける温度変動とモデル多様性の次元ギャップ
Stochastic Sampling is Epistemically Shallow: The Dimensionality Gap Between Temperature Variation and Model Diversity in LLMs
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
言語モデルが繰り返し実行時に異なる回答を生成する場合、その変動はモデルの知識の限界を何か明かしているのだろうか。この根本的な問いに対し、新しい研究が重要な知見をもたらしている。自己一貫性(Self-consistency)という手法は、多数決投票を通じて、この変動を個別の質問ごとの不確実性推定に変換する。しかし、同じ変動が質問間の構造、すなわち関連する質問が一緒に変動する現象(多様なアンサンブルが示すような)を明かしているかどうかは明確でない。
本研究は同一の質問セットに対して二つの異なるレジームを比較した。一つは単一モデルを温度τ=1で100回実行するケース、もう一つは24個の異なるLLMのアンサンブルを温度τ=0で各々1回実行するケースである。Marchenko-Pastur乱行列検定を用いて、両者のシグナルとサンプリングノイズを区別した。MMLU、HellaSwag、GSM8Kという5つのファミリーと3つのベンチマークに対して、単一モデルの場合、ノイズレベルを超える次元は最大でも1つに留まった。
これに対して、アンサンブルの場合は4つの固有値がノイズの閾値を超えた。一方、難易度を調整したベルヌーイ帰無仮説では、500回のモンテカルロシミュレーションで最大でも1つの固有値がノイズを超える程度である。この結果から、自己一貫性は個別質問の不確実性推定には有効だが、質問間の構造を検出する能力は持たないことが示唆される。モデルの知識の限界を本質的に理解するには、単一モデルの繰り返しサンプリングではなく、複数の異なるモデルによる多様なアンサンブルが必須であることが明確になった。