arXiv (Robotics)AI
SAFECAST:コントラスト集合トレーニングとキャリブレーションによるVLAポリシーの堅牢な故障検出
SAFECAST: Robust Failure Detection for VLA Policies with Contrast-Set Training and Calibration
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
ロボットビジョンと言語を組み合わせたアクションポリシー(VLA)は、実運用環境における様々な環境変化に直面しています。混雑した背景、妨害物体、照明条件の変化、未知のオブジェクト、異なる初期状態、言い換えられた指示など、トレーニング時と異なる条件下では、これらのポリシーはしばしば故障してしまいます。このような配置時の分布シフトに対応するため、研究者たちは隠れ状態ベースのリスク検出器と関数型適合予測を組み合わせた手法を提案してきました。しかし、こうした手法の信頼性は、キャリブレーションデータが実際の運用条件とどの程度一致しているかに大きく依存するという課題がありました。
今回紹介されるSAFECASTは、この課題を解決するため、コントラスト集合摂動を活用して隠れ状態プローブのトレーニングとキャリブレーションを改善する新しいアプローチです。視覚的な異なるパターンや言語的なバリエーションを意図的に導入することで、より堅牢なモデルの構築を目指しています。
実験結果では、SAFECASTが実世界ロボティクスデータセットのDROIDと、シミュレーション環境のLIBEROにおいて、複数の視覚言語モデルバックボーン上で、既存の最先端手法を統計的に有意な水準で上回る故障検出性能を達成しました。特に興味深い知見として、視覚と言語の両方のコントラスト集合摂動を組み合わせてデータを拡張したときに、SAFECASTの効果が最大化されることが判明しました。さらに、シミュレーション環境から実世界へのキャリブレーション転移を使用することで、実際のロールアウトデータのみを用いた場合よりも、より優れたプローブが得られることも示されています。