arXiv (Robotics)AI
SiMDex:ロボット器用操作のための類似一人称視点動画のマイニング手法
SiMDex: Mining Similar Egocentric Videos for Cross-Embodiment Dexterous Manipulation
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
ロボットが人間と同等の器用さで物体を操作できるようにするための学習データセレクションが、近年の重要な課題となっています。大規模な一人称視点(egocentric)の人間動画データセットが利用できるようになった一方で、実際にロボット操作の向上に貢献するデータがどれなのかは明確ではありませんでした。
このような背景から、研究者らが新たに提案したのがSiMDexという類似度ベースのデータマイニングフレームワークです。SiMDexは、ロボット実演データに対して、約3200万件の一人称視点人間動画サンプルのプールから、タスク関連性の高いサブセットを抽出する仕組みを備えています。このフレームワークは推薦問題として捉えられており、三層構造のリコール・ランキング・リランキングパイプラインを採用することで、効率的なデータ選別を実現しています。
重要な特徴として、SiMDexは形態学的に異なるロボット間でも対応できるモーフォロジーに依存しない行動空間で動作するため、既存のVLA(Vision-Language-Action)モデルのアーキテクチャや訓練方法に変更を加える必要がありません。
実験結果は選別の有効性を明確に示しています。同じ量のランダムにサンプリングされた人間データで訓練したベースラインモデルと比較して、SiMDexは全体プールの5%未満に相当する約149万件のマイニングされたサンプルを使用するだけで、成功率を47.7%から61.1%へと大幅に向上させました。この結果は、無差別なデータ混合よりも選別的なキュレーションの方が、ロボット器用操作の学習において優れた効果をもたらすことを実証しています。