arXiv (NLP)AI
TITLE_JA: Relay-Bench:複数領域の推論チェーンでLLMを評価する新しいベンチマーク
Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
近年、大規模言語モデル(LLM)の性能評価は、単一のタスクに特化したベンチマークから、より実践的で複雑な問題へシフトしています。このたび発表された「Relay-Bench」は、こうしたニーズに応える新しい評価フレームワークとして注目を集めています。このベンチマークは、複数の異なる領域から出題されたタスクを1つのプロンプト内で完結させるLLMの能力を測定する包括的なテキストベースのベンチマークです。
Relay-Benchの特徴は、その複合的な問題設計にあります。視覚的推論、コーディング、数学、情報抽出(特にウェブ検索に焦点)、問題解決、一般知識、データ分析といった7つの領域から構成されたサブプロブレムが、複数組み合わされて出題されます。各問題は2つから13の副問題で構成され、異なる領域にまたがる推論を求めるため、単一領域の深い専門知識だけでなく、領域間での知識統合能力が試されます。
さらに注目すべきは、問題の複雑さが意図的に増加させられている点です。プロンプトエンコーディングや意図的なコンテキスト肥大化を通じて、複数の層の複雑性が追加されています。このベンチマークでは、モデルがコード実行やウェブ検索を含むすべての利用可能なツールを活用することが明確に奨励されており、現実的な使用状況に近い評価が実現されています。
現在の最高性能モデルであるGPT-5.5(xHigh)でさえ43.3%のスコアに留まっており、この新しいベンチマークがLLMの能力評価において、いかに高い基準を設定しているかを示唆しています。