arXiv (Robotics)AI
基盤モデルを活用したキッチンロボットの操作タスク
Kitchen Robotic Manipulation utilizing Foundation Models
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
日常的な人間の環境でロボットを活用するには、多様で変化する状況に対応できる堅牢な知覚システムが不可欠です。本研究では、家庭用の操作タスク、特にキッチン環境での食器類の扱いに焦点を当てた、モジュール型の知覚パイプラインを提案しています。このシステムは、オープン語彙物体検出、マルチビュー セグメンテーション、インスタンス認識型の3D再構成、そして6D姿勢推定とグラスプ計画のための2D-3D特徴融合戦略を統合しています。
パイプラインのモジュール設計により、複数の視覚・幾何学的基盤モデルを系統的に置き換えることが可能で、カスタムキッチンデータセットでの広範な評価を通じて最高性能の構成を特定できます。最良の構成(LLMDet、SAMv2、DINOv2、GeoTransformerの組み合わせ)は、クラッターや遮蔽のある20シーンのキッチンベンチマークで89.12%のADI(Average Distance Index)を達成しています。
実世界での実証実験では、この最適構成が物理的なロボットに環境固有の再学習なしにデプロイでき、シンク から食器洗い機への移動やカップのスタッキングなど、実際のタスクを成功裏に実行できることが確認されました。このパイプラインの適応性とスケーラビリティを実証し、家庭用ロボットシステムの実用的なフレームワークとしての可能性を示す重要な成果となっています。