arXiv (NLP)AI
大規模言語モデルの相対的選好評価のためのコンセンサスベースフレームワーク
A Consensus-Based Framework for Relative Preference Evaluation of Large Language Models
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
大規模言語モデル(LLM)の評価方法として、従来のベンチマークは静的なデータセットと客観的なスコアリング指標に依存してきた。しかし、複数の正解が存在するような場面では、正確性だけでは明確性、完全性、有用性の違いを反映した応答品質の差異を捉えることができない。本論文は、絶対的な正確性ではなく、モデル生成応答間の相対的な選好を測定するコンセンサスベースの評価フレームワークを提案している。
従来の固定的な正解との比較ではなく、このアプローチではモデル群が同じプロンプトへの匿名化された複数の応答にどのようにランク付けするかを評価する。複数の多様なLLMの集約的な一致度を、ブラインド条件下での認識される応答品質のプロキシとして扱うというものである。研究チームはプログラミング、一般知識、安全性、論理推論、数学といった複数のドメインにわたって、最先端の5つのLLMを用いた対照研究を実施した。各モデルが応答を生成し、構造化された投票プロセスを通じてピアの出力を独立して評価している。
スコアは相対知能指数(RII)に集約され、他のモデルによってモデルの応答が選好される頻度を表現する。研究結果は複数ドメインにおいて一貫した選好パターンを示し、特定のモデルがピアから頻繁に高くランク付けされることが明らかになった。ただし、これらの結果はモデル間の選好一致を反映するものであり、客観的な正確性や人間の判断を直接的に示すものではない。複数の有効な答えが存在する場面では、このフレームワークはスケーラブルで実用的なモデル駆動型の比較評価方法を提供し、応答品質に関する新しい視点をもたらす。