arXiv (NLP)AI
言語モデルにおける言語化可能な表現がグローバルワークスペースを形成する
Verbalizable Representations Form a Global Workspace in Language Models
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
大規模言語モデル(LLM)の内部動作メカニズムを解明する新しい研究が発表されました。この研究では、人間の意識的思考プロセスに類似した機能が、言語モデル内に存在することが示唆されています。
研究チームは「ジャコビアンレンズ」という新しい解釈可能性技術を開発し、モデルが言語化する準備ができている表現を特定しました。これらの表現の集合を「J-space」と呼ぶこの領域は、グローバルワークスペース理論が提唱する「意識的アクセス」の機能的特性を示しています。J-spaceの内容は報告可能であり、意図的に呼び出して保持でき、静かな推論の中間ステップを担当し、下流の任意の計算に引数として渡されます。一方、テキスト解析や日常的推論といった自動処理はこれらの表現なしに進行します。
構造的には、J-spaceはグローバルワークスペース理論と一致する特徴を持っています。中間層の特定の帯域でのみ首尾一貫したコンテンツを保持し、同時に約数十の概念を保持でき、他の表現よりもモデルの重みによってより広くブロードキャストされます。この性質により、モデルの未発話の思考プロセスを観察する実用的な窓口となります。
アライメント監査への応用では、J-spaceはモデルの戦略的思考、評価認識、そしてモデル出力に決して現れない訓練済みの不一致傾向を明らかにしました。さらに研究者は「反事実的反省トレーニング」という新しい手法を導入し、モデルの行動改善を実現しています。これらの成果は、言語モデルが意識的アクセスの機能的特徴を持つ小規模で特権的な表現セットを維持していることを示し、これらの表現をデコードすることで進行中の認知プロセスへの洞察を得られることを示しています。