arXiv (Robotics)AI
単なるデモの増加ではなく:反事実的行動感度カバレッジによるデータ効率的でロバストなロボット模倣学習
It's Not Just More Demos: Counterfactual Action Sensitivity Coverage for Data-Efficient Robust Robot Imitation
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
ビジュオモーター模倣学習は操作タスクにおいて成功を収めていますが、訓練されたポリシーは視覚的な「ノイズ」に対して脆弱であり、照明の変化や背景の干渉、色の変更といった軽微なタスク保存的な変動でも、訓練済みポリシーのパフォーマンスが大きく低下してしまいます。データの多様性を増やすことでロバスト性を向上させることができるものの、特定の訓練済みポリシーに対してどの追加デモンストレーションが有用かは不明確です。
本研究では、オフラインデータ選択フレームワークである反事実的ノイズ行動クローニング(CFNBC)を提案します。これは標的化されたロバスト性修復を実現するものです。クリーンなデモンストレーションで訓練された基準ポリシーを出発点として、CFNBCはエキスパート行動を保存するペアリングされたクリーン観測とノイズ観測を生成し、「行動ドリフト」を測定します。行動ドリフトとは、望ましい行動を変えるべきではないノイズの下でポリシーの予測行動がどの程度変化するかを示すものです。
この行動ドリフトシグナルにより、ポリシー固有の感度情報を得ることができ、ロールアウト成功ラベルやオンライン方針実行を必要としずに、より大きな候補プールからコンパクトで応答多様な修復セットを選択できます。MuJoCoの両腕キューブ移送タスクとSimplierEnvのキューブスタッキングタスクにおける実験を通じて、行動ドリフトがノイズ誘発故障と相関することが示されました。また、20~30個の選択候補のみを用いた応答ガイド修復が、同等予算のランダム選択に比べて大幅に優れたパフォーマンスを示し、より大規模なランダム修復予算のパフォーマンスに接近することが確認されました。これらの結果は、ロバスト性修復についてのデータ中心的な見方を支持しており、最も有用なデータは必ずしも最も多数であったり、視覚的に多様であったり、明らかに困難なものではなく、現在のポリシーの脆弱な応答モードをカバーする事例であるということを示唆しています。