arXiv (AI)AI
エビデンスチェーン評価による校正された選別的ファクトチェック
Calibrated Selective Fact-Checking via Evidence Chain Evaluation
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
大規模言語モデル(LLM)はファクトチェックにおいて高い精度を達成できますが、従来の二者択一的な判定方法には重大な信頼性の問題が隠れています。システムが弱い、不十分、または内部的に矛盾した証拠に基づいてさえも確信を持った結論を下してしまうという課題です。新しい研究では、Evidence Chain Evaluation(ECE)と呼ばれる選別的ファクトチェックフレームワークを提案しており、これにより従来の真偽判定に代わって「不確実」という判定を選択することができるようになります。
このシステムはウェブ検索、学術文献検索、実行可能なチェックを通じてエビデンスを収集する、ツール活用型の検証エージェントとして機能します。その後、信頼度とソースレベルのメタデータを含む構造化された判定結果を返します。ECE-Benchテストベンチでは、ECEは標準精度91.6%、カバー率93.7%、回答済みクレームに対する選別精度97.8%を達成しました。
最も強力な検索ベースラインと比較すると、Expected Calibration Error、Brier score、AURCといった集約的な校正指標では必ずしも優位性を示しませんでした。しかし選別予測のトレードオフにおいて明確な利点があります。95件中6件の場合について判定を保留し、それ以外の回答済みクレームでは非常に高い精度を維持しているのです。興味深いことに、保留された6件のケースはいずれも信頼性の低いエビデンス設定に集中しており、特にソースレベルL4の5件がそうです。これは棄却メカニズムが認識論的に弱いエビデンスを扱うための安全性指向のメカニズムとして機能していることを示唆しています。