arXiv (NLP)AI
LLMは本当に問題の難易度を理解できるのか?LLMを用いた自動問題生成への示唆
Can LLMs Really Understand Item Difficulty Levels? Implications for Automated Item Generation Using LLMs
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
大規模言語モデル(LLM)が教育評価の現場で活用される機会が増える中、その信頼性を問う重要な研究が発表されました。本研究は、LLMが試験問題の難易度レベルをどの程度正確に予測できるのかを検証したもので、大規模な読解・ライティングテストから抽出した問題データを使用して複数のLLMの性能を比較分析しています。
研究チームは様々なプロンプト戦略とパラメータ設定を試みた結果、ゼロショット学習のGPT-4.1を温度0で使用した場合に最高の予測精度を達成し、二次加重カッパ(QWK)で0.578のスコアを記録しました。しかし興味深いことに、このLLMの性能はエンコーダーのみの言語モデルであるConvBERTのQWK 0.625に及びませんでした。さらに詳細な分析を進めると、全てのLLMが難しい問題の識別に苦戦することが明らかになりました。特に最新型のGPT-5.4は問題の難易度を過小評価する傾向を示し、埋め込み表現の次元削減分析では、異なる難易度レベルの問題埋め込みが混在していることが判明しました。
これらの知見は、問題そのものの意味論的情報だけでは難易度予測に不十分であることを示唆しています。研究者らは、LLMが自身の能力向上とともにほとんどの問題を簡単なものとして扱う傾向を示しており、LLMを使用して特定の難易度レベルを持つ問題を生成する際には慎重な対応が必要であると警告しています。この結果は、教育現場でのLLM活用における限界を理解する上で重要な示唆を提供するものとなります。