arXiv (NLP)AI
大規模言語モデルの行動一貫性を測定・改善する「認知カーネルモデル」の検証
Measuring and Improving Behavioral Consistency in Large Language Models through Fact-Heuristic-Emotion State Enforcement
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
大規模言語モデル(LLM)は同じ問題に対して実行ごとに異なる答えを返したり、自分の過去の回答がコンテキストとして与えられると決定を翻すという課題を抱えています。本研究は、このような不安定性がモデルの重みを変更することなく測定・軽減できるかを検証するものです。
研究チームが提案した「認知カーネルモデル(CKM)」は、プロンプトレベルの状態強制層として機能します。このモデルは決定前に、入力情報を3つの認識論的役割に分離することを強制します。それらは「事実(Fact)」(与えられたまたは検証可能な情報)、「ヒューリスティック(Heuristic)」(推論または仮定された情報)、そして「感情(Emotion)」(評価的または優先度シグナル)です。CKMは新たな能力を追加せず、モデルが行動する前にどの種類の情報を使用しているかを追跡することを強制します。形式的には、状態S_t = {F_t, H_t, E_t}を遷移関数で更新する構造化状態を維持します。
評価実験は韓国語の意思決定シナリオを用いて実施され、4つのベンダーから26個のLLMを対象に37,403個の観測データを収集しました。曖昧性、倫理的葛藤、資源配分、エラー処理といった4つのコア実験に加え、アブレーション研究が行われました。主な結果は以下の通りです。反復出力の変動性が有意に減少し(g=1.09)、状態の永続性により新しいモデルで決定翻転率が82%削減されました。効果はJSON形式化だけではなく、事実・ヒューリスティック・感情の分離そのものにあることが確認されています。温度パラメータ0.7のような高いサンプリング確率下でも優位性が増加し(g=2.87)、構造的スキャフォールディングと内容の両方が改善に寄与していることが示されました。
重要な限定として、CKMは推論の正確性そのものは改善しません。この研究の知見は、行動一貫性がモデル間で測定可能であり、事実と仮定と評価シグナルの分離を強制することで部分的に改善可能であることを示唆しています。