arXiv (ML)AI
TITLE_JA: クラウドネイティブな評価サービス:適合的保証を備えたAI監視用マイクロサービスアーキテクチャ
Cloud-Native Evaluation-as-a-Service: A Microservices Architecture for Scalable AI Monitoring with Conformal Guarantees
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
AI技術の実運用において、モデルの性能を継続的に監視し、信頼性を確保することは極めて重要だ。本研究はこうした課題に対応するため、EaaS(Evaluation-as-a-Service)と呼ぶクラウドネイティブな参照アーキテクチャを提案している。このシステムはKubernetesマイクロサービス上に六つの独立した機能を実装することで、スケーラブルかつ堅牢なAI評価基盤を実現している。
具体的には、有限サンプル補正を施した適応的予測集合を用いた適合的予測、キャリブレーション評価、RFF近似最大平均相違度によるドリフト検出、ブートストラップ信頼区間による公平性監視、DAGベースのパイプラインオーケストレータ、および結果ストレージAPIで構成されている。評価実験では、50回のランダムな検定分割を通じて、平均カバレッジが名目目標値から1.4パーセンテージポイント以内に収まる安定した適合保証を確認した。MMLU評価では、必要とされるトークンの100%がトップ20の対数確率に含まれ、10%の補間シミュレーション時でもカバレッジ低下は1.5%未満に抑えられた。
RFF-MMDはドリフト検出において中央値ヒューリスティック帯域幅で完全な検出力を示し、第一種の過誤は5~8.5%範囲に収まっている。また、UCI成人所得データセットを用いた公平性監視では、人種別の統計的パリティにおける大きな格差(DPギャップ=0.33)が明らかになり、逐次バッチを通じて安定したアラート検出が機能することを確認した。適合的予測とキャリブレーションサービスはバッチサイズ100において2ミリ秒以下のp99レイテンシを達成し、RFF-MMDは定期的なバッチ監視に適した約500ミリ秒の処理時間を要する。現在のところ、適合的予測のサービス化、マイクロサービス分解、DAGベースのオーケストレーションを統合したプラットフォームは他に存在しないと考えられる。