arXiv (CV)AI
ビジョン言語モデルの危険認識評価:危機状態と異常状態の区別の重要性
Hazard or Anomaly? Evaluating VLMs for Understanding Dangers and Discrepancies
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
現代の安全性が重要なシステムでは、災害リスクを低減し緊急時の意思決定を支援するため、人間とロボットの相互作用がますます重要になっています。ビジョン言語モデル(VLM)は複雑なシーンを解釈し安全に関連した情報を伝えることができるため、これらの分野での活用が期待されていますが、信頼できる安全推論を確保するには慎重な評価が必要です。
従来の危険認識の評価は「安全/危険」という二項判断で行われることが多く、モデルが実際の物理的危機を識別しているのか、単に異常なシーン要素に反応しているのかが不明確でした。本研究はこの制限に対処するため、「危機(hazard)」と「異常(anomaly)」を明確に区別し、危機状態と異常状態を別々に認識することを提案しています。複数の最先端VLMを2つのデータセットとさまざまなプロンプト戦略を用いて評価した結果、VLMが異常さを危険さとして頻繁に誤解釈していることが明らかになりました。モデルは文脈的な不規則性を危険の指標として過度に依存する傾向を示しています。
研究者たちは、異常と危機を明確に分離することで、VLMの安全推論をより詳細に評価でき、従来の二項的な安全判断では見落とされる失敗モードを明らかにできることを示しました。このアプローチは、ロボットが人間と相互作用する実際の環境での安全性評価をより正確にするために重要な知見をもたらします。公開データセットはRoboflow上で利用可能です。