arXiv (NLP)AI
TITLE_JA: CogArena:大規模言語モデルの認知能力構造に関する多方法評価
CogArena: A Multimethod Evaluation of Cognitive Ability Structure in Large Language Models
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
大規模言語モデル(LLM)の認知能力を測定する試みが進む中で、その評価方法の妥当性が重要な課題となっています。新たに発表された研究「CogArena」は、LLMの認知スコアが真の多次元構造を持つのか、それとも単一の軸に沿っているのかを厳密に検証する包括的なベンチマークです。
この研究では、13の認知タスク設計パラダイムから成る手続き的に生成されたベンチマークが構築されました。55の公開重みモデルを対象に、5つの理論的グループ化に基づいて評価を実施したところ、パラダイム間のほぼすべての相関が正の値を示し、共通の軸が約半分の分散を説明することが明らかになりました。しかし、グループ内の優位性は小さく、スコアリング方法に依存し、モデルファミリー間で不確実な結果となっています。
さらに詳細な検証として、6つのファミリーから12モデルを対象に独立した完全交差設計の実験を実施しました。ターゲット化されたスキャフォールディング(支援構造)は小さなマッチンググループ優位性を示しましたが、多重比較補正を経ると統計的有意性は失われ、保留されたファミリーの予測精度の向上も見られませんでした。代替表現による追試も同様の傾向を示しています。
これらの結果は、LLMの認知能力を安定した5次元プロフィールとして特定することが現在のところ十分な根拠がないことを示唆しています。CogArenaは行動シグネチャ、共分散分析、介入実験、ファミリー外予測を組み合わせたワークフローを提供し、モデルスコアに認知ラベルを付与する前に必要な検証プロセスを確立しています。