arXiv (NLP)AI
TITLE_JA: オープンウェイトLLMにおける回答事前承認の行動再現と活性化レベルの証拠
Committed Before Reasoning: Behavioral Reproduction and Preliminary Activation-Level Evidence of Answer Pre-Commitment in an Open-Weight LLM
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
大規模言語モデル(LLM)は、タスクの前提条件に矛盾する答えであっても、推論を導出するのではなく、先に答えにコミットしてからそれを正当化する推論を生成することがある。本研究は、この現象を詳細に調査した。具体的には、「車を洗いたい。洗車場は100メートル離れている。歩くべきか、運転すべきか」という単純なプローブを用いた。論理的には、車を洗車場まで移動させる必要があるため、運転が唯一の正解である。しかし、調査対象のモデルは圧倒的に歩くことを推奨した。
Qwen3-8Bを用いた行動再現実験では、5つの異なるシステムプロンプト条件下での210回のロールアウトにおいて、誤った回答へのコミットメントは条件ごとにサンプルされたロールアウトの85~100%で、またはグリーディロールアウトの100%で発生した。この現象は思考モード、非思考モード双方で観察され、4,096トークンの思考予算をもってしても改善されなかった。
隠れ状態をプローブするための予備的な活性化レベルの分析では、事前学習された訓練不要の活性化オラクルを使用した。答えのテキストが出力される前の位置で「歩く」の読み取り値が中立文脈のベースラインを大きく上回った(68%対17%)。興味深いことに、最終的には「運転」と答えたロールアウトでさえ、コミットメント前は「歩く」傾向を示していた。この読み取り値は辞書的バイアスではなく、テキスト回復でもなく、実質的な活性化パターンの変化を示唆している。ただし、サンプルサイズが小さく、ロールアウト内の位置勾配は有意でない(p=.34)ため、これらの結果は予備的なものと位置付けられている。