arXiv (CV)AI
GEB-Bench:抽象的構造を多様な表現で捉える能力を測定するベンチマーク
GEB-Bench: Abstract Structures Told in Many Voices
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
河川デルタと稲妻を見て、それらが共通の構造を持つことを認識できるだろうか。この問いから出発した新しいベンチマークGEB-Benchが提案されました。このベンチマークの特徴は、自己言及、奇妙なループ、メビウスの捻りといった抽象的な構造モチーフを、ゲーデル、エッシャー、バッハの精神に基づいて複数の表現形式で評価する点にあります。
各モチーフは複数の「声」で表現されます。具体的には、自然の風景(その構成が構造そのもの)、民話(機械的に検証可能な形式装置を通じてそれを具現化)、数学定理、プログラムのスケルトンという四つの異なる領域です。表面的なパラメータは外部変数として扱われ、採点対象にはなりません。これらのモチーフ、声、そしてそれらの間の構造的変化が小規模なクロスモーダルカテゴリを形成し、GEB-Benchのタスクがその問題となります。
12個の公開モデルと商用モデルを評価した結果、抽象化の失敗には法則性があることが判明しました。最も重要な発見は「認識」と「クロスボイスマッピング」の間のギャップです。モデルは単一の声の中で構造を識別することは相対的に得意ですが、複数の声の間で構造を対応付けることは大幅に苦手です。全てのモデルがこのコストを払い、このギャップを縮小するほど強力なマッピング能力は最先端のモデルに限定されています。
エラーパターンは、知覚的ジオメトリではなく設計された形式的ジオメトリとより強く一致し、異なるベンダーの最先端モデルが同じ誤りに収束することが確認されました。また、表面的な複雑さはすべての構造認識モデルに負荷をかけ、容量の増加は完全な免疫ではなく単に作業余地を買うだけであることが示されています。