arXiv (ML)AI
TITLE_JA: FALCON-Discover:キャリブレーション向けの集中した過信領域の発見
FALCON-Discover: Discovering Concentrated False-Confidence Regions for Calibration
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
機械学習モデルの予測信頼度を評価するキャリブレーション技術は、一般的には全体的な性能で評価されることが多いですが、実際には最も危険な失敗は局所的に発生します。つまり、間違った予測であるにもかかわらず高い信頼度を保ち続ける現象です。本研究は、このような危険な失敗モードを「過信の集中化」として定義し、自信過剰なエラーが予測空間の中でどの程度コンパクトで発見可能な領域に占有されているかを研究しています。
研究チームはFALCON-Discoverという事後的でモデル非依存のフレームワークを提案しました。このフレームワークは信頼度、局所的サポート、近傍の一致性、および摂動安定性からの乖離信号を使用して予測をランク付けします。7つのバイナリ表形式データセット、4つのシード値、5分割交差検証、およびXGBoostやCatBoostを含む強力な学習器を用いた実験を通じて、過信の集中化は繰り返し発生するものの、状況依存的であることが判明しました。
主要な信頼度閾値では、乖離ベースのランク付けが検証で選定された最強のキャリブレーション手法やトラストスコアリングベースラインを大きく上回るパフォーマンスを示しました。一方、生の信頼度スコアだけでは危険なエラーをほとんど検出できません。最適な検出器はデータセットごとに異なり、複数の手がかりを組み合わせる必要がある場合は学習された乖離が最も効果的であり、局所的な決定の脆弱性が支配的な場合は安定性中心のランク付けが最適です。これらの結果は、危険な過信を単一スコアのキャリブレーション問題ではなく、ファミリーレベルの発見問題として扱うべきであることを示唆しており、信頼度、サポート、および安定性が乖離する領域を明示的に対象とする新しいキャリブレーション戦略の開発を促します。