arXiv (NLP)AI
TITLE_JA: LayerRAG-Bench:エージェント型検索拡張生成システムの層別信頼性ベンチマーク
LayerRAG-Bench: A Cross-Layer Reliability Benchmark for Agentic Retrieval-Augmented Generation
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
エージェント型検索拡張生成(RAG)システムの信頼性を包括的に評価するための新しいベンチマーク「LayerRAG-Bench」が開発されました。このベンチマークは、RAGシステムが一見すると根拠のある回答を生成しているように見えながら、実際には複数の層で障害を起こしている問題に対処することを目的としています。具体的には、証拠層、ツールコントラクト層、認可層、セッション状態層といった異なるレイヤーで信頼性が損なわれるケースを検出できるよう設計されています。
LayerRAG-Benchは、8つのエンタープライズドメイン、240のタスク、9つの障害シナリオ、2つのコントラクトモードで構成されており、OpenAI、Anthropic、Geminiの9つのモデルに対して38,880のライブタスクレベルレコードを生成します。評価実験では、スキーマ正規化がスキーマドリフト成功率を0.000から0.913に向上させることが示されました。
しかし重要な発見として、スキーマ正規化だけでは古い証拠、ツール出力の欠落、権限拒否、間違ったセッションコンテキストの問題は解決されないことが明らかになりました。さらに、根拠性のみを評価基準とする従来のアプローチでは、古い証拠や間違ったセッション証拠の下で大量の偽陽性を生じさせることが判明しています。
これらの結果は、「層別評価原則」の重要性を支持しています。すなわち、信頼性向上のための各種インターベンションは、対象とする特定の層を修復することで評価されるべきであり、万能な解決策として誤解されてはならないということです。このアプローチにより、RAGシステムの各レイヤーの弱点に対する個別の最適化が促進されるでしょう。